楼主
开源了一个跑在 Mac 本机的录音转文字桌面 App,叫 Recorder。
https://github.com/chillboy67/recorder-mac
为啥又造一个轮子
市面上很多转写工具默认会「悄悄把你说错的话改对」——语法修好、句子理顺、口音抹平。
记会议挺好;但如果你是想看自己口语到底哪不行,被改掉的那部分恰恰是诊断价值。
所以这个项目的第一原则是:
任何模式都不改写说话人原话。说错的原样保留;需要提示的只做标注。
全程本地,不上传音频、不调云 API(模型首次下载后可断网)。
三种模式
| 模式 | 场景 | 产出 |
|---|---|---|
| 通用转写 | 会议 / 访谈 / 任意音频 | 中英混合逐字稿 |
| 课堂录音 | 空旷教室、回声、旁人闲聊 | 降噪 + 只留主讲人 + 重点总结 |
| 雅思口语教官 | 教官/考生一对一(中英夹杂) | 角色分离 + 疑似读音/语法/表达标注 + 反馈报告 |
技术上几点
- ASR:优先
mlx-whisper(Apple Silicon Metal),回退faster-whisper - 系统内录:ScreenCaptureKit,戴耳机也能录电脑声音
- 长录音:静音处分块,16GB 机器也能扛;转写在子进程,崩了不带走 GUI 和录音文件
- 中英 code-switching:分块独立语言检测,避免被「翻译」成单一语言
- 可选 AI 增强(Ollama):校对错字 / 课堂总结 / 雅思点评;不润色原文
- 选型建议:亚洲语向 Qwen、欧洲语向 Mistral,按内存选型见仓库文档
跑起来
cd lecture_intel
uv venv && uv pip install -r requirements.txt
brew install ffmpeg
.venv/bin/python3 app.py
# 或 ./make_app.sh 装到 /Applications/Recorder.appGitHub(MIT):
https://github.com/chillboy67/recorder-mac
硬件与本地大模型说明(可选):
https://github.com/chillboy67/recorder-mac/blob/main/lecture_intel/docs/LLM_MODELS.md
已知局限
• 目前转写以 中英 为主;完整多语(日韩欧语教官等)还在规划
• 16GB 机器建议 Whisper 用 turbo/small 再开 LLM,大模型与 large-v3 尽量串行
• 雅思发音依赖 Whisper 逐词置信度,是「疑似」不是金标准
欢迎试用、提 issue、拍砖。尤其想听听:课堂主讲人过滤、雅思角色分离在你们真实录音里准不准。
最后编辑于 2026-08-11 19:15