目前看,dots3-note Preview 属于第一梯队开源模型,但还不能说超过 V4 Flash。
官方参数是 280B 总参数、16B 激活、512K 上下文、文本/图片/视频/音频全模态,重点强化复杂推理、工具调用和长程 Agent。
实际定位大致可以看成:
普通聊天/写作:强
数学推理:很强
多模态:明显强于 V4 Flash
长程 Agent:很有潜力
代码/浏览器自动化稳定性:目前 V4 Flash 更可靠
它已经展示过连续 320 步操作完成 ARC-AGI-3 六关,还独立完成了一个 1876 行 Swift 的 visionOS 项目并编译成功。
但有个关键问题:官方模型卡的标准 Benchmark 表目前还是空的,完整报告也标着 coming soon。 所以现在网上说它“碾压 Claude/V4”都太早。
如果粗暴分档:
GPT-5.6 / Claude Opus 级:还不是
V4 Flash / 强开源旗舰级:接近这个档
GLM、Kimi、Qwen 主流强模型:至少同一梯队
普通 70B/100B 开源模型:明显高一档
对你而言,它真正值得关注的是“16B 激活却能做强 Agent + 全模态”。如果后面 API 稳定下来,很可能成为你 V4 Flash 之外一个非常有价值的模型。 问的gpt,刚刚试了下普通任务,还行,挺快的