LINUX SB 快照站

YunTai

用户 ID 6504 · 当前名首次快照 2026-08-12 10:19:06 · 当前名始于 2026-08-12 10:19:06 · 原站主页: https://linux.sb/user/6504

发言

共 8 楼

今天签到给了一千积分不知道是不是大家都这样,给了那么多积分我决定坚持发帖
#0 · YunTai
发帖 2026-08-17 20:24:19 · 快照 2026-08-17 20:36:31

今天签到给了一千积分不知道是不是大家都这样,给了那么多积分于是我决定坚持发帖,即便没人看...

上一次对比了各大agent工具的压缩机制和上下文管理,这次讨论goal功能

先说说结论:目前市面上大多数 AI 智能体的 Goal 功能,本质上都是摆设。
不管是 DeepSeek Harness 还是 OpenAI Codex,它们判断 goal 是否完成的方式都差不多——让 LLM 自己判断。模型自己给自己打分,自己判断任务做完了没有。

但问题在于,LLM 总是倾向于相信自己已经完成了。你让它写个函数,它写了个大概就说搞定了,边界条件没处理、错误分支没覆盖,它意识不到。这种"自我评估"的方式,相当于让学生自己批改自己的试卷,能批对多少全看运气。

我认为这是不严谨的。

在现有的方案中,处理 goal 完成判断做得最用心的是 Grok Build。它走了另一个方向——启动了三个对抗性子智能体来投票。每个智能体独立思考、分析证据、给出结论,最后少数服从多数,以此决定 goal 是否完成。准确率确实上来了,但代价也很大。三个子 agent 同时跑,用户需要承担大量的时间和 token 成本。同样是判断一个任务是否做完,它把整件事搞得像开了一场听证会。

但 Grok Build 有点过度设计了。

Illusion Agent 的 Goal 功能在设计上取了两者的合理部分拼在一起。基本任务链沿用 DeepSeek Harness 的方式,保持简洁高效;而在验证阶段,借鉴了 Grok Build 的思路,但去掉了多 agent 投票的复杂机制。它通过内置的 verification 来检查任务是否通过、是否继续下一轮——有点像 using-superpowers 的 review 流程。
不需要三个智能体吵架,也不需要模型自我感动。该过就过,该重来就重来,简单直接。

三个项目,三层思路。一个自我评估,一个层层设防,一个取中间路线。没有绝对的对错,更多是设计取舍的问题。但如果你问我,我会说:让 LLM 给自己判卷这件事,本来就不该发生。

最后由 YunTai 编辑于 2026-08-17 20:33
ClaudeCode的会话管理、压缩机制与模仿实现,经典永不过时
#0 · YunTai
发帖 2026-08-11 19:59:35 · 快照 2026-08-17 21:04:33

大家好!!我的项目叫做illusion-agent,我对这个项目的定位是集百家之所长的全能 agent,其中会话管理与压缩机制的实现或者说灵感来自于ClaudeCode(https://github.com/YunTaiHua/illusion-agent)

在ClaudeCode中,有两种压缩方式微压缩和全压缩,微压缩是指移除工具结果仅保留最近5条工具结果并用占位符替代原有的工具结果,同时也会移除图片读取结果同样以占位符替代图片识别的结果,当微压缩后上下文占比还是超过了阈值就会触发全压缩,全压缩就是很经典的llm总结摘要,在ClaudeCode中发送给 LLM 的提示词要求生成 9 段结构化摘要:用户请求与意图、关键技术概念、文件与代码片段、错误与修复、问题解决过程、全部用户消息、待完成任务、当前工作、可选下一步

IllusionAgent与ClaudeCode的做法高度一致,但也有自己的特别处理,比如上下文占比尽可能的采用真实的用量值,只有在全压缩完成后的一瞬间采用类似ClaudeCode的估算值*4/3的计量方法(这里是因为全压缩完成后的一瞬间没有产生API调用暂时只能用估算值替代不过在llm完成一轮工具调用后马上又会变成真实值)

这种压缩方式的优点很明显,微压缩不涉及API调用,压缩完成几乎是无感的,在实际测试中,如果上下文窗口是1m,触发了微压缩后几乎不可能再触发全压缩,并且微压缩产生的效果也比全压缩llm生成摘要好得多,微压缩的信息损失和时间损耗远远低于全压缩。

不过,不同工具的压缩机制差异很大:
Codex CLI使用服务端加密压缩,客户端无法干预或检查,压缩后自动重新读取最近5个文件
Cursor通过强化学习训练模型自主总结
Copilot CLI在约80%上下文容量时自动触发压缩,阈值比大多数工具的95%更保守
TRAE的具体压缩机制未公开,官方文档提到有Context Compaction功能(TRAE的压缩体验非常差!!)

如果LLM能力不够,全压缩生成的摘要质量往往较差,甚至会导致LLM重复已经做过的工作。这也是为什么微压缩如此重要——它能在不损失信息的前提下大幅减少token占用,是比LLM全压缩更优的第一道防线。illusion-agent的做法就是吸取了ClaudeCode和OpenCode的分层思路,优先使用微压缩,只有万不得已才走全压缩

最后编辑于 2026-08-11 20:10
宣传一下自己的项目,集成了多个agent的coding agent
#9 · YunTai
发帖 2026-08-08 23:54:21 · 快照 2026-08-12 11:09:02

@ilegend #7 还是很谢谢你的建议

宣传一下自己的项目,集成了多个agent的coding agent
#8 · YunTai
发帖 2026-08-08 23:54:02 · 快照 2026-08-12 11:09:02

@ilegend #7 不对吧,你这个是AI机器人自动回复吧?但是README补齐是可取的建议,后面的其他很多说法好像和我的实际项目情况不太符合喔

宣传一下自己的项目,集成了多个agent的coding agent
#5 · YunTai
发帖 2026-08-08 20:29:39 · 快照 2026-08-12 11:09:02

@phi-agent #2 点了,兄弟,好项目

宣传一下自己的项目,集成了多个agent的coding agent
#4 · YunTai
发帖 2026-08-08 20:28:49 · 快照 2026-08-12 11:09:02

@Musifei #3 模板是什么。。。?

宣传一下自己的项目,集成了多个agent的coding agent
#0 · YunTai
发帖 2026-08-08 20:21:47 · 快照 2026-08-12 11:09:02

https://github.com/YunTaiHua/illusion-agent

IllusionAgent 是一款开源的 AI 智能体平台。它将多模型语言模型网关、 中英双语命令行、浏览器端 Web 界面与可扩展的插件生态融为一体, 在 Windows、macOS、Linux 之上皆能从容运行,自带搜索工具(没有额外开销)。

无论你习惯终端的克制,还是偏爱浏览器的舒展,IllusionAgent 都能与你的工作流共振: 35 项内置工具、7 类专业子代理、2 种压缩方法、MCP 服务器支持、 钩子、插件,以及面向无人值守场景的 Cron 调度器,贯通飞书、微信、QQ 三大渠道。

站在巨人之肩 —— Claude Code 提示词体系、OpenHarness 架构理念、 OpenClaw 调度设计、kimi-cli 基础设施、hermes-agent 渠道模式、cc-switch 路由方案。

支持TUI、CLI、Web UI、桌面应用。