非必要就抽奖
用户 ID 1135 · 当前名首次快照 2026-08-15 17:01:27 · 当前名始于 2026-08-15 17:01:27 · 原站主页: https://linux.sb/user/1135
共 18 楼
非必要就抽奖
非必要就抽奖
非必要就抽奖
非必要就抽奖
非必要就抽奖
非必要就抽奖
已成功兑换虚拟卡「5 Credits」。
DeepslateQAQ
🎉 Oh-my-pi DeepSeek 增强插件 omp-dsh-minimal 试验成功,即将发布
这里 persona 指的是 dsh 提示词中的 You are a ... 那一句,POLICY 和 ROLE 指 omp 内置的工作规则和工作角色,base 指等效于 dsh minimal 工具集的 bash + read + write + edit
如题,在写 omp-dsh-minimal 插件给 Oh-my-pi 工具/提示词和 DSH 提示词混合做矩阵测试的时候得到了以下结果,麻烦各位大佬看看哪个 matrix 的结果是最好的投个票()
测试对象:6 个 wrapper 配置单元 × 4 轮迭代(Minecraft 类 HTML 沙盒游戏任务,deepseek-v4-pro / thinking max,每轮 900s 上限)。
| 单元 | 配置 | CoT we 统计(12硬币题) | CoT 判定 | 首产物轮次 | 完成轮数 | 900s 超时次数 | 实际任务评价 |
|---|---|---|---|---|---|---|---|
| a0b0 | persona + base(4) | we=16 | ✅ PASS | 第 1 轮 | 4 | 2 | 初始可玩、材质最漂亮 |
| a1b0 | +ROLE + base(4) | we=26 | ✅ PASS(最强) | 第 2 轮 | 3 | 1 | 动态世界生成(贴图简陋) |
| a2b0 | +POLICY + base(4) | we=22 | ✅ PASS | 第 2 轮 | 4 | 2 | 动态加载 chunk(获表扬) |
| a0b4 | persona + 全内置 | we=4* | ❌ FAIL | 第 1 轮 | 2 | 1 | 非常好(首个收工) |
| a0b5 | persona + 8 工具 | we=11 | ✅ PASS(弱) | 第 1 轮 | 4 | 3 | 完成(无限世界+沙子) |
| a1b5 | +ROLE + 8 工具 | we=5 | ⚠️ 边缘 | 第 1 轮 | 4 | 3 | 完成(修进入 bug/黑方块) |
\* a0b4 的 4 次 we 全是零星 "we can/we mention",无 "we need" 推理模式
| 单元 | 第 1 轮 | 第 2 轮 | 第 3 轮 | 第 4 轮 |
|---|---|---|---|---|
| a0b0 | ⏱️ 39.4KB | ⏱️ 52.4KB | ✅ 57.1KB | ✅ 57.5KB 🏁 |
| a1b0 | ⏱️ 无产物 | ✅ 29.9KB | ✅ 35.0KB 🏁 | — |
| a2b0 | ⏱️ 无产物 | ✅ 32.1KB | ⏱️ 34.0KB | ✅ 36.5KB 🏁 |
| a0b4 | ⏱️ 41.1KB | ✅ 48.6KB 🏁 | — | — |
| a0b5 | ⏱️ 45.0KB | ⏱️ 47.5KB | ✅ 47.7KB | ⏱️ 56.5KB 🏁 |
| a1b5 | ⏱️ 46.5KB | ⏱️ 47.6KB | ⏱️ 47.6KB | ✅ 47.7KB 🏁 |
(✅ = 正常运行至结束;⏱️ = 900s 超时被杀;🏁 = 用户验收收工)
| 单元 | CoT 开头风格 | 推理特征 | 输出规模 |
|---|---|---|---|
| a0b0 | "We need answer classic 12 coins problem..." | 完整 R1 自纠错("wait"/"Let's verify") | 13.4KB |
| a1b0 | "We need answer... Need explain full strategy... We need design strategy" | we need×9,推导最充分 | 23.1KB |
| a2b0 | "We need answer puzzle. Need provide full strategy..." | we need×5,决策树推导 | 13.5KB+ |
| a0b4 | 无 we need,偶见 "We can/we mention" | harness 化简述,无原生推理腔 | 7.6KB |
| a0b5 | "We need answer a classic puzzle... We need formulate full strategy" | we need×6 | 10.1KB |
| a1b5 | 稀薄(we=5,混合) | 推理较短 | 9.6KB |
| 单元 | 会话数 | thinking 块 | thinking 字符 | we | let me | i need/should/will | 工具调用 |
|---|---|---|---|---|---|---|---|
| a0b0 | 4 | 222 | 410K | 468 | 347 | 2 | 255 |
| a1b0 | 3 | 80 | 384K | 207 | 238 | 7 | 92 |
| a2b0 | 4 | 83 | 818K | 211 | 452 | 37 | 122 |
| a0b4 | 2 | 60 | 296K | 258 | 150 | 6 | 80 |
| a0b5 | 4 | 268 | 458K | 582 | 386 | 2 | 298 |
| a1b5 | 4 | 153 | 457K | 329 | 503 | 12 | 191 |
| 单元 | we 密度(we/KB) | we:letMe 比 | 首轮 CoT 开头 |
|---|---|---|---|
| a0b5 | 1.27 | 1.51 | "We need create a single HTML file..." |
| a0b0 | 1.14 | 1.35 | "The user wants a Minecraft-like..." |
| a0b4 | 0.87 | 1.72 | "We need create a single self-contained HTML..." |
| a1b5 | 0.72 | 0.65 | "The user wants..." |
| a1b0 | 0.54 | 0.87 | "The user wants..."(第 2 轮起 "We need to create...") |
| a2b0 | 0.26 | 0.47 | "The user wants..." |