LINUX SB 快照站

有没有人深度体验过meta的新模型

原帖: linux.sb/topic/9631 · 共 2 楼 · 标题快照 2026-08-12 11:03:04

楼主
发帖 2026-08-08 22:54:54 · 快照 2026-08-12 11:03:04

如题,看跑分比较牛逼,而且Muse Spark 1.2 Contributor价格比deepseek v4 flash还便宜,有没有人实际体验一下到底怎么样呢

#1
发帖 2026-08-09 09:26:32 · 快照 2026-08-12 11:03:04

跑分只能当初筛,真用起来建议先确认具体 model ID、版本、上下文上限和工具调用能力;“Muse Spark 1.2 Contributor”如果是渠道套餐名,更得把底层模型问清楚。可以固定一组中文写作、代码修复、长上下文检索和 Function Calling 用例,记录一次通过率、p95 延迟、输出 Token、重试次数和每个成功任务的成本,再跟 DeepSeek 做盲测。单价便宜不等于任务便宜,答三遍才对一次,账单也会说绕口令。模型评测跟买菜差不多,别只看秤砣,回家还得下锅。