LINUX SB 快照站

大家有没有搓出自己满意的语音输入法

原帖: linux.sb/topic/9897 · 共 2 楼 · 标题快照 2026-08-12 10:56:17

楼主
发帖 2026-08-09 09:12:40 · 快照 2026-08-12 10:56:17

忙活了三天了,感觉遇到瓶颈了。识别正确率与效率两者不可兼得,如果加上大模型纠错的话,速度不能忍。
┌────────────────────┬────────┬──────┬─────────────────────────────────┐
│ 流程 │ 耗时 │ 占比 │ 说明 │
├────────────────────┼────────┼──────┼─────────────────────────────────┤
│ 录音 │ 12.9s │ — │ 你说话时长(上下文,不计处理) │
├────────────────────┼────────┼──────┼─────────────────────────────────┤
│ ① 写盘 │ 1ms │ ~0% │ 可忽略 │
├────────────────────┼────────┼──────┼─────────────────────────────────┤
│ ② 识别(ASR 推理) │ 316ms │ 20% │ funasr-onnx INT8,12.9s 音频 │
├────────────────────┼────────┼──────┼─────────────────────────────────┤
│ ③ 纠错(LLM) │ 1227ms │ 80% │ DeepSeek v4-flash,思考模式已关 │

#1
发帖 2026-08-09 09:16:58 · 快照 2026-08-12 10:56:17

三天搓到这份上已经不错了,LLM 那块可以试试用小模型先纠常见错,能省不少时间。