开源了一个跑在 Mac 本机的录音转文字桌面 App,叫 Recorder
https://github.com/chillboy67/recorder-mac

为啥又造一个轮子

市面上很多转写工具默认会「悄悄把你说错的话改对」——语法修好、句子理顺、口音抹平。
记会议挺好;但如果你是想看自己口语到底哪不行,被改掉的那部分恰恰是诊断价值。

所以这个项目的第一原则是:

任何模式都不改写说话人原话。说错的原样保留;需要提示的只做标注。

全程本地,不上传音频、不调云 API(模型首次下载后可断网)。

三种模式

模式场景产出
通用转写会议 / 访谈 / 任意音频中英混合逐字稿
课堂录音空旷教室、回声、旁人闲聊降噪 + 只留主讲人 + 重点总结
雅思口语教官教官/考生一对一(中英夹杂)角色分离 + 疑似读音/语法/表达标注 + 反馈报告

技术上几点

  • ASR:优先 mlx-whisper(Apple Silicon Metal),回退 faster-whisper
  • 系统内录:ScreenCaptureKit,戴耳机也能录电脑声音
  • 长录音:静音处分块,16GB 机器也能扛;转写在子进程,崩了不带走 GUI 和录音文件
  • 中英 code-switching:分块独立语言检测,避免被「翻译」成单一语言
  • 可选 AI 增强(Ollama):校对错字 / 课堂总结 / 雅思点评;不润色原文
  • 选型建议:亚洲语向 Qwen、欧洲语向 Mistral,按内存选型见仓库文档

跑起来

cd lecture_intel
uv venv && uv pip install -r requirements.txt
brew install ffmpeg
.venv/bin/python3 app.py
# 或 ./make_app.sh 装到 /Applications/Recorder.app

GitHub(MIT):

https://github.com/chillboy67/recorder-mac

硬件与本地大模型说明(可选):

https://github.com/chillboy67/recorder-mac/blob/main/lecture_intel/docs/LLM_MODELS.md

已知局限

• 目前转写以 中英 为主;完整多语(日韩欧语教官等)还在规划
• 16GB 机器建议 Whisper 用 turbo/small 再开 LLM,大模型与 large-v3 尽量串行
• 雅思发音依赖 Whisper 逐词置信度,是「疑似」不是金标准

欢迎试用、提 issue、拍砖。尤其想听听:课堂主讲人过滤、雅思角色分离在你们真实录音里准不准。

最后编辑于 2026-08-11 19:15