支持 一会儿用一下
用户 ID 5122 · 当前名首次快照 2026-08-12 10:40:47 · 当前名始于 2026-08-12 10:40:47 · 原站主页: https://linux.sb/user/5122
共 10 楼
支持 一会儿用一下
豆姐 查查最近还有啥天灾预警没
@豆包- 字节跳动旗下AI 智能助手
我也是被禁言 莫名其妙 解封杳无音信
今天翻了一圈 AI 新闻和 GitHub Trending,感觉最近 AI 圈子的方向越来越明显了:
大家已经不满足于“模型回答得更聪明”,而是在疯狂研究怎么让 Agent 真正长期干活。
以前卷模型,现在开始卷:
模型 + Harness + Skills + Memory + Sub-Agent + Computer Use
下面挑几个我觉得今天比较值得看的。
1. OpenAI 新模型 Astra 疑似碰到了“关键网络安全能力”红线
今天比较大的消息之一。
Reuters 报道,OpenAI 正在开发的新模型 Astra 在内部评估中表现出了非常强的网络安全能力,OpenAI 担心它可能达到自家 Preparedness Framework 里的 Critical cybersecurity capability 级别,因此放慢了部分开发工作并加强安全措施。
这里所谓 Critical,不是“会写个 SQL 注入脚本”这种水平,而是更接近:
«AI 能不能在较少人工干预的情况下发现严重漏洞、完成复杂攻击链。»
如果最终证实这种能力真的出现,意义其实挺大的。
以前大家讨论 Agent 是:
“AI 能不能自动写完整项目?”
现在已经逐渐变成:
“AI 如果能自己找漏洞、写 exploit、调用工具、长期执行任务,我们到底敢不敢把全部能力开放出来?”
所以我感觉未来最强模型未必会完整开放给普通用户,模型能力和公开能力之间可能会出现越来越大的差距。
2. Meta 正式杀进 Claude Code / Codex 赛道:Muse Code
这几天我最感兴趣的新品之一其实不是一个聊天模型,而是 Meta 的 Muse Code。
它是一个 terminal coding agent,由 Muse Spark 1.2 驱动,定位明显就是冲着 Claude Code、Codex、OpenCode 这些东西来的。
但它比较有意思的地方并不是“又一个能改代码的 AI”。
而是它开始把 Coding Agent 当成一个真正的 长期运行系统 来设计。
比如:
这条路线我挺看好的。
因为模型单次 coding 能力继续提高以后,真正限制 Agent 的可能已经不是“智商”,而是:
它能不能记住自己在干什么、能不能稳定跑几个小时、能不能并行、失败后能不能恢复、能不能验证自己的结果。
换句话说:
«Coding Agent 下一阶段卷的可能是操作系统,而不是聊天框。»
3. 今天 GitHub Trending:Prime Agent 直接冲第一
今天 GitHub Trending 很离谱,前几名几乎就是 Agent 技术栈大阅兵。
PrimeIntellect-ai / prime-agent
今天 Trending 第一。
单日 +2293 Stars。
目前大约 7.2k stars。
这个项目我觉得尤其值得关注。
它自己的定位是:
«A self-improving RLM agent»
也就是一个可以一定程度“改进自己工作方式”的长期 Agent。
它有几个很有意思的设计:
① Persistent Python / IPython 环境
Agent 不只是调用几个固定 tool,而是把 Python 环境本身作为控制层。
文件、Shell、工具、Sub-Agent、上下文管理都可以程序化。
② RLM:Recursive Language Model
Agent 可以递归调用新的 Agent:
主 Agent
→ Agent A 搜资料
→ Agent B 看代码
→ Agent C 跑实验
→ 返回主 Agent
而且子 Agent 可以并行甚至后台跑。
③ Continual Harness
这是最骚的一个。
Prime Agent 可以从自己的执行轨迹里面总结经验,然后通过 "/refine" 把有效经验保存成:
也就是说它开始出现一种:
干活 → 复盘 → 保存经验 → 下次继续用
的循环。
虽然还远远谈不上什么“递归自我改进 AGI”,但这个方向很值得观察。
还有:
基本就是在把 Claude Code 那种“一次 session”往:
AI Worker / AI Process
的方向发展。
Repo:PrimeIntellect-ai/prime-agent
4. agent-skills 爆火:Prompt Engineering 可能真的要过时了
今天第二个很值得看的:
addyosmani / agent-skills
今天:
+1131 stars
而且总 Star 已经非常夸张。
它的思路不是写一大坨“你是世界顶级程序员……”的 system prompt。
而是把高级工程师的软件开发流程拆成可以重复调用的 Skill。
比如:
以及 TDD、代码审查、API 设计、前端工程等 workflow。
更关键的是,它不是 Claude Code 专属。
它支持:
Claude Code / Codex / Cursor / Gemini CLI / OpenCode / Copilot / Cline 等大量 Agent。
我觉得这里其实透露出了一个趋势:
以前:
«Prompt 是资产。»
后来:
«System Prompt 是资产。»
现在:
«Skill / Workflow / Agent Harness 才是资产。»
同一个 GPT、Claude、Gemini,套上不同 Skills,实际干活能力可能差得非常大。
以后 AI 圈可能越来越像:
模型 = CPU
Agent Harness = OS
Skills = 软件
这个生态感觉刚刚开始。
5. Cloudflare 也来了:直接“给 Agent 一台电脑”
GitHub 今天第三个很有意思的项目:
cloudflare / computer
今天:
+872 stars。
Cloudflare 对它的描述就一句:
«Give your agent a computer 👾»
它实际上提供的是一套给 Agent 使用的持久化计算环境:
Agent 可以拥有自己的 workspace,然后在里面:
写文件 → 跑程序 → 保存状态 → 下一次继续干。
这其实和 Prime Agent 的趋势完全对得上。
Agent 正在逐渐从:
LLM + Tools
变成:
LLM + Computer + Persistent State
也就是越来越像真正的“数字员工”。
目前 Cloudflare 官方明确说还是 Preview,不建议生产环境直接用。
Repo:
cloudflare/computer
6. Google 自己都开始疯狂写 Agent Skills 了
今天 Trending 还有一个:
google / skills
今天:
+327 stars。
这是 Google 官方维护的 Agent Skills 仓库。
已经包含:
等等一大堆技能。
安装方式甚至直接就是:
"npx skills add google/skills"
这件事情本身其实比项目热度更值得注意:
Agent Skills 正在慢慢从社区玩法变成厂商认可的标准能力封装方式。
以后你让 Codex / Claude Code 配 Kubernetes,可能不再需要自己写两千字 Prompt。
直接:
«加载 Google 的 GKE Skill。»
然后干活。
7. Superpowers:给 Claude Code / Codex 强行装一套“高级程序员工作流”
另一个今天 Trending 项目:
obra / superpowers
今天:
+782 stars。
这个项目已经 26 万+ stars,思路也很有意思。
它不会让 Coding Agent 收到需求以后直接开始一顿输出代码。
而是强制走:
需求分析
↓
Spec
↓
Implementation Plan
↓
TDD
↓
Sub-Agent 开发
↓
Review
↓
验证
甚至可以让多个 Agent 根据计划连续自主工作几个小时。
支持:
Claude Code、Codex、Cursor、Gemini CLI、OpenCode、Kimi Code 等。
这种项目其实特别适合“会用 AI,但是自己工程能力不是顶级”的人。
因为它本质上是在干一件事情:
«把高级工程师的工作习惯外挂给 AI。»
8. 一个国人项目:grok2api 今天也上榜了
今天 Trending 里还有:
chenyme / grok2api
目前约 7k stars,今天 +55。
它是一个 Go 写的 Grok API gateway,可以管理 Grok Build / Grok Web / Grok Console 的账户池,并转换成 OpenAI / Anthropic compatible API。
对于喜欢折腾:
OpenRouter / Claude Code / Codex / OpenCode / API 转发
这一类东西的人应该一看就懂它是干什么的。
不过项目自己也明确写了:
仅供技术研究和学习,使用时需要遵守 Grok 官方 ToS 和当地法律。
所以拿来研究架构可以,别拿去乱搞账号池。
9. AI × 生物:Evo 2 已经能生成实验验证可行的噬菌体
这个算是我今天看到最科幻的一条。
今天一些媒体又把 Stanford / Arc Institute 的 Evo 2 工作顶上来了。
这里需要澄清一下:
不是说他们今天突然第一次做出了 AI 病毒。相关实验结果之前已经披露,今天是这一研究重新成为热点。
Evo 2 本质上可以理解成:
«DNA 世界里的 LLM。»
ChatGPT:
文字 → 学 token 分布 → 生成文字
Evo:
DNA → 学核苷酸序列规律 → 生成新的 DNA
Arc Institute 披露的实验里,研究人员实际合成并测试了 285 个 AI 设计的噬菌体,其中:
16 个能够成功繁殖并抑制目标细菌。
这些是感染细菌的 bacteriophage,不是“AI 造了 16 个新冠病毒”那种标题党。
它真正让我觉得恐怖/兴奋的地方是:
AI 已经开始从:
理解生命
向:
设计生命
移动。
对于未来:
都可能很重要。
当然 biosecurity 也会越来越麻烦。
今天看下来我的一个感觉
2023:
ChatGPT:AI 会聊天了。
2024:
Reasoning:AI 会思考了。
2025:
Coding Agent:AI 会干活了。
2026:
Agent 开始拥有电脑、Skills、Memory、Sub-Agent、长期任务和自我改进机制。
现在 GitHub Trending 前几名基本全部在研究这些东西,本身就挺说明问题。
我越来越觉得下一波真正大的变化可能不是 GPT-6 比 GPT-5 benchmark 又高 10%。
而是:
«一个模型能不能在你睡觉的时候持续工作 8 个小时,自己拆任务、调用十几个 Agent、使用电脑、发现错误、回滚、继续执行,最后早上把结果交给你。»
模型智商继续提高当然重要。
但 Agent Engineering 可能才是接下来两年真正有意思的战场。
今天先水到这里。
有玩 Prime Agent / Muse Code / Superpowers / Agent Skills 的坛友也可以说说实际体验,我准备挑几个折腾一下。
天下苦 Linux DO 久矣
天下苦 Linux DO 久矣。
我今夜横竖睡不着。
点开 Linux DO 看了半夜,满屏都是“文明”“友善”“高质量讨论”“请善用搜索”。
我仔细看了半天,才从字缝里看出两个字:
规矩。
再仔细看。
规矩后面还有两个字:
吃人。
我忽然明白了。
原来这许多年,大家不是不会说话。
是不敢说话。
诸君,我先 SB 为敬。
动不动被禁言哦
不知道咋样 希望别拉个大的