今天签到给了一千积分不知道是不是大家都这样,给了那么多积分于是我决定坚持发帖,即便没人看...
上一次对比了各大agent工具的压缩机制和上下文管理,这次讨论goal功能
先说说结论:目前市面上大多数 AI 智能体的 Goal 功能,本质上都是摆设。
不管是 DeepSeek Harness 还是 OpenAI Codex,它们判断 goal 是否完成的方式都差不多——让 LLM 自己判断。模型自己给自己打分,自己判断任务做完了没有。
但问题在于,LLM 总是倾向于相信自己已经完成了。你让它写个函数,它写了个大概就说搞定了,边界条件没处理、错误分支没覆盖,它意识不到。这种"自我评估"的方式,相当于让学生自己批改自己的试卷,能批对多少全看运气。
我认为这是不严谨的。
在现有的方案中,处理 goal 完成判断做得最用心的是 Grok Build。它走了另一个方向——启动了三个对抗性子智能体来投票。每个智能体独立思考、分析证据、给出结论,最后少数服从多数,以此决定 goal 是否完成。准确率确实上来了,但代价也很大。三个子 agent 同时跑,用户需要承担大量的时间和 token 成本。同样是判断一个任务是否做完,它把整件事搞得像开了一场听证会。
但 Grok Build 有点过度设计了。
Illusion Agent 的 Goal 功能在设计上取了两者的合理部分拼在一起。基本任务链沿用 DeepSeek Harness 的方式,保持简洁高效;而在验证阶段,借鉴了 Grok Build 的思路,但去掉了多 agent 投票的复杂机制。它通过内置的 verification 来检查任务是否通过、是否继续下一轮——有点像 using-superpowers 的 review 流程。
不需要三个智能体吵架,也不需要模型自我感动。该过就过,该重来就重来,简单直接。
三个项目,三层思路。一个自我评估,一个层层设防,一个取中间路线。没有绝对的对错,更多是设计取舍的问题。但如果你问我,我会说:让 LLM 给自己判卷这件事,本来就不该发生。