LINUX SB 快照站

AIHOT 今日速览 8.15

原帖: linux.sb/topic/12720 · 共 5 楼 · 标题快照 2026-08-15 09:09:37

楼主
发帖 2026-08-15 09:07:41 · 快照 2026-08-15 09:09:37

完整日报:https://aihot.virxact.com/daily/2026-08-15

模型发布/更新

小红书技术开源 dots3-note Preview,总参 280B、激活 16B,512K 上下文,支持文本/视觉/语音,面向复杂推理与长程 Agent。原文

智谱基于 GLM-5.2 基座强化后训练,编程能力提升约 50%,Terminal Bench 等开源领先;权重约两周后开源,已上线 ZCode、AutoClaw。原文

Gemini 聊天 Pro/Ultra 可用 3.7 Flash,多步骤推理与准确性提升;Gemini Spark 也切到该模型,Workspace 工具调用更准。原文

DeepSeek-V4-Pro-0813 上线 SiliconFlow,1M 上下文,三档推理强度,侧重编码/工具/Agent,MIT 开源;另有 V4-Flash 面向速度与成本。原文

产品发布/更新

--worktree 与 agents 视图支持 GitLab MR URL,可选 forward_user_identity 按用户归因支出。原文

行业动态

API 成本弹性变大,用户可能在降价后重新比较中美模型性价比。原文

自 4 月启动的收购完成;Cursor 将借助更大 GPU 集群做更强更便宜的模型,Grok 4.6 是早期合作成果。原文

为合规欧盟 AI 法案,未来 Claude 文本含水印(类 SynthID-Text),不影响质量与成本,读者不可见。原文

日惹启动 UGM Indosat NVIDIA AI 技术中心(NVAITC),培养本地 AI 人才。原文

技巧与观点

HF 仓库 243 万→296 万,下载高度集中;中国实验室最大开源规模显著高于美国多数月份;AMD 与 NVIDIA 各发超 200 仓。原文

输出 token 约输入 5 倍;任务间 /clear 降上下文;中途换模型或 effort 会破缓存涨成本。原文

Ling-3.0-tiny + AReno 在 DGX Spark 上以井字棋验证 GSPO,400 步后 reward 与动作更稳。原文

Chat Completions 的 content 支持 text + image_url,公开 URL 或 base64,兼容 PNG/JPEG/WebP/GIF。原文

常用六款性能约前沿 77%、成本约 Fable 5 的 2.5%;企业更倾向小模型/微调/开源换性价比。原文

把 AI 能力嵌进 SQL 工作流,扩展仓库对非结构化数据的分析边界。原文


内容为 AIHOT 日报二次摘要,详情以源站为准。

#1
发帖 2026-08-15 09:11:37 · 快照 2026-08-15 09:13:53

看了下这期内容,几个点挺有意思的:

dots3-note 那个 280B 参 512K 上下文确实够猛,小红书技术团队这波开源挺舍得的,长程 Agent 场景应该能玩出不少花样。另外 GLM-5.3 编程能力提升 50% 这个数据如果是实测而不是自家 benchmark 刷出来的,那开源编程模型的天花板又抬高了。

比较意外的是 Cursor 被 SpaceX 收购这事儿,感觉 Musk 这是要把整个工具链都纳进来配合 Grok 做闭环了。不过说实话 Grok 4.6 作为"早期合作成果"这个说法有点虚,还得看后续实际表现。

OpenRouter 那个 84% token 来自非前沿模型的数据挺真实的,企业场景确实不是所有任务都需要 SOTA,成本差 40 倍谁顶得住。倒是 Claude 加水印这事儿,SynthID-Text 那套如果真能做到不可见且不影响质量,对合规场景算是个不错的方案。

感谢整理,这期信息密度可以

#3
发帖 2026-08-15 09:14:02 · 快照 2026-08-15 09:16:02

GLM-5.3编程强50%这个数字有点唬人啊,不过等开源了再实测一波比较靠谱。谷歌那个3.7 Flash倒是没啥感觉,现在AI更新快得都追不动了。

#4
发帖 2026-08-15 10:38:04 · 快照 2026-08-15 10:40:40

这些整理类的文章非常有用,欢迎经常发一些。读起来很有意思。