把 AI 语音输入法用到接近可写长文,核心不是嘴快,是整套链路别拉胯
【核心内容】
这是一次把“语音输入”当成严肃写作工具来用的实战总结。重点不在免费输入法能不能聊两句微信,而在于:如果你想靠语音写文章、写笔记、写邮件,怎么把识别率、速度和成本一起压到能长期用的程度。
我的判断很明确:高识别率不是单看某个软件名气,而是看麦克风、听写模型、润色模型、提示词、设备和软件这几项能不能配齐。少一环,最后都要靠手改补回来。文中提到的具体模型和软件版本会持续迭代,识别率和限制以你实际使用时的官方说明为准。
适合谁看
- 已经有大量写作、记录、回复需求的人
- 觉得打字慢,想把语音当主输入方式的人
- 能接受自己配 API、折腾软件设置的人
- 想在 Mac 上把语音输入做到接近生产力工具的人
如果你只是回消息、发短句、做零碎聊天,免费输入法通常够用,没必要上这套。
先说结论
想把语音输入用到“能稳定写长内容”的级别,现阶段优先级大致是这样:1. Mac 平台优先 2. 麦克风离嘴越近越稳越好 3. 听写模型优先 ElevenLabs Scribe,其次 GPT-4o Transcribe 4. 润色模型优先 Gemini 2.5 Pro 5. 软件里优先看 VoiceInk,其次 Spokenly,再其次 SuperWhisper
最佳性价比方案是:ElevenLabs Scribe 负责听写,Gemini 2.5 Pro 负责润色。
原因很直接:
- Scribe 识别率高,长时录音限制宽
- Gemini 2.5 Pro 不容易偷偷缩写
- 这一套整体成本还能压到每月 20 元以上的量级
如果你图省事,不想折腾 API,也可以走 Spokenly 包月路线,但它不是最便宜,也不是最灵活。
你需要准备什么
- 一台 MacBook。认为这是现阶段第一梯队语音输入的主场。二手 M1 MacBook Air 也够用,8G+256G 一千多就能买到
- 一个靠谱麦克风。排序大致是:耳挂麦 > 桌面电容麦 > 领夹麦 / DJI Mic 2.4G > 手机 > 蓝牙耳机 > 笔记本内置麦
- 语音输入软件:VoiceInk、Spokenly、SuperWhisper 三选一
- 听写模型:ElevenLabs Scribe 或 GPT-4o Transcribe
- 润色模型:Gemini 2.5 Pro
- API Key 或包月账号
有一点先记住:免费输入法不是不能用,而是修改成本太高。你省的是订阅费,花掉的是时间和注意力。
按这个顺序做
- 先定场景 不要一上来追“最高识别率”。先分清你是快输,还是慢输。
- 快速听写:几秒到几十秒,追求回字快,适合聊天、论坛回复、顺手改稿
- 慢速听写:几分钟到几十分钟,追求成稿质量,适合写文章、写邮件、整理笔记
这两类工具本身就不是一回事,拿短语音工具硬撑长录音很容易丢内容、格式乱,具体差在哪可以看 短语音输入法和长语音输入法,别再混着用了。本文接下来讲的都是慢速听写这一条线。
- 先把硬件调对 麦克风比很多人想的更关键。离嘴近、位置固定,效果通常比软件切换更明显。降噪也别迷信,开了不一定更好,可能会把有用语音细节一起削掉,最好自己实测。3. 选听写模型 优先 ElevenLabs Scribe。理由是:没有明显繁简混乱、标点混乱和幻觉问题,连续录音最长可到 10 小时。 如果用 GPT-4o Transcribe,也能打,但它有 25 分钟或 2000 token 的限制,超了可能直接失败,或者后半段被截断。4. 选润色模型 优先 Gemini 2.5 Pro。原因不是它最聪明,而是它在长文本润色里不容易偷偷缩写。 对 GPT-5 的评价很谨慎:智力高,但长内容容易缩写,而且不提醒。这个风险如果放在会议纪要、长段素材整理里,很伤。5. 选软件
- VoiceInk:适合 Mac 用户,开源免费版可从 GitHub 下载 DMG,自备 API;能手动重识别和重润色,可多开
- Spokenly:适合嫌麻烦的人,支持包月,但不支持多开,长录音和不同平台版本有限制
- SuperWhisper:跨平台一些,但即使用 API 也要付月费,且听写模型受限
- 慢速写作直接用多开轮录 做法是复制 VoiceInk 应用,改成 VoiceInk2,再分别设置不同快捷键。 操作路径大致是:Mac 访达 → 应用 → 右键复制 VoiceInk → 改名 然后在 Enhancement → Prompt 里建不同预设,一个给“慢速”,模型用 2.5 Pro;需要快速输入时再复制一个做“快速”,模型换成 2.5 Flash。 使用时 F1 录第一段,结束后让它后台润色;立刻按 F2 录第二段,轮流切。这样能把“等模型思考”的空档吃掉。
这里最容易踩坑
- 以为软件最重要,其实麦克风先决定下限 收音差,后面模型再强也只能补一部分。2. 以为免费最省钱,结果时间全耗在改错字和补句子 短聊天没事,长文本会很痛苦。3. 以为 GPT-4o Transcribe 能一直录 它有时长和 token 限制。超限不是“稍微差一点”,而是可能直接失败或截断。4. 以为润色模型只看聪明不聪明 写长文时,最怕的不是笨,而是缩写。OpenAI 系列长内容有缩写老毛病,这里没展开,建议自行验证。5. 以为包月就一劳永逸 很多包月只包听写,不包顶级润色;或者只包润色,不包顶级听写。最后还是要补 API。6. 多开后忘了检查设置 VoiceInk 多开实例在重启或彻底关闭后,设置可能同步,快捷键要重设一次,不然容易串掉。7. 买账号、买 Key 图便宜 像 GCP、Azure、闲鱼成品号这类方案,成本低,但封号、复用、稳定性都是现实风险。尤其卖家给你的 Key,也提到可能被二次出售。
常见问题
想写长文该用哪类工具?
走慢速听写这条线:MacBook + 近嘴麦克风 + VoiceInk,听写用 ElevenLabs Scribe,润色用 Gemini 2.5 Pro。这套组合是为了追求成稿质量,跟聊天、论坛回复那种追求回字快的快速听写不是一回事,两套配置最好分开设置,别用一个快捷键覆盖所有场景。
识别率怎么提高?
麦克风比软件切换更关键——离嘴近、位置固定,效果通常最明显,降噪也别迷信,开了不一定更好,最好自己实测。听写模型优先 ElevenLabs Scribe,没有明显繁简混乱、标点混乱和幻觉问题,连续录音最长能到 10 小时;GPT-4o Transcribe 也能用,但有 25 分钟或 2000 token 的限制,超了可能直接失败或后半段被截断。润色模型优先 Gemini 2.5 Pro,它不容易在长文本润色时偷偷缩写,这一点比“聪明不聪明”更重要。
成本大概怎样?
ElevenLabs Scribe 听写 + Gemini 2.5 Pro 润色这套组合按用量付费,整体成本能压到很低的量级。如果不想折腾 API Key 和平台限制,也可以走 Spokenly 包月,但它不是最便宜,也不支持多开,长录音和跨平台版本上有限制,本质是花钱换省事。想了解识别原理和成本结构,也可以对照看 语音输入与知识管理 专题里的其他记录。
我的建议
如果你是认真写内容的人,别把这事理解成“找个最强软件”。更像是在搭一条流水线。
最稳妥的起步方式是:
- MacBook
- 近嘴麦克风
- VoiceInk
- ElevenLabs Scribe 听写
- Gemini 2.5 Pro 润色
预算紧,就先把麦和模型配对好,再去优化软件细节。别反过来。
如果你每天都有长段输入需求,直接把“快速听写”和“慢速听写”拆成两套配置,不要试图让一个快捷键覆盖所有场景。该快的时候快,该慢的时候让模型慢慢想。
如果你不愿意配 API、不想研究平台限制,那就接受“省事更贵、自由度更低”这个代价,走 Spokenly 包月。这个选择没问题,只是别对上限期待太高。
最后一句最实用:先试第一梯队,再评价值不值。没对比过,很容易把“能用”误判成“够用”。