← Journal
  • 免费
CraftAUG 31, 2025更新于 AUG 18, 20265 min

把 AI 语音输入法用到接近可写长文,核心不是嘴快,是整套链路别拉胯

收录于 语音输入与知识管理 →

把 AI 语音输入法用到接近可写长文,核心不是嘴快,是整套链路别拉胯

【核心内容】

这是一次把“语音输入”当成严肃写作工具来用的实战总结。重点不在免费输入法能不能聊两句微信,而在于:如果你想靠语音写文章、写笔记、写邮件,怎么把识别率、速度和成本一起压到能长期用的程度。

我的判断很明确:高识别率不是单看某个软件名气,而是看麦克风、听写模型、润色模型、提示词、设备和软件这几项能不能配齐。少一环,最后都要靠手改补回来。文中提到的具体模型和软件版本会持续迭代,识别率和限制以你实际使用时的官方说明为准。

适合谁看

  • 已经有大量写作、记录、回复需求的人
  • 觉得打字慢,想把语音当主输入方式的人
  • 能接受自己配 API、折腾软件设置的人
  • 想在 Mac 上把语音输入做到接近生产力工具的人

如果你只是回消息、发短句、做零碎聊天,免费输入法通常够用,没必要上这套。

先说结论

想把语音输入用到“能稳定写长内容”的级别,现阶段优先级大致是这样:1. Mac 平台优先 2. 麦克风离嘴越近越稳越好 3. 听写模型优先 ElevenLabs Scribe,其次 GPT-4o Transcribe 4. 润色模型优先 Gemini 2.5 Pro 5. 软件里优先看 VoiceInk,其次 Spokenly,再其次 SuperWhisper

最佳性价比方案是:ElevenLabs Scribe 负责听写,Gemini 2.5 Pro 负责润色。

原因很直接:

  • Scribe 识别率高,长时录音限制宽
  • Gemini 2.5 Pro 不容易偷偷缩写
  • 这一套整体成本还能压到每月 20 元以上的量级

如果你图省事,不想折腾 API,也可以走 Spokenly 包月路线,但它不是最便宜,也不是最灵活。

你需要准备什么

  • 一台 MacBook。认为这是现阶段第一梯队语音输入的主场。二手 M1 MacBook Air 也够用,8G+256G 一千多就能买到
  • 一个靠谱麦克风。排序大致是:耳挂麦 > 桌面电容麦 > 领夹麦 / DJI Mic 2.4G > 手机 > 蓝牙耳机 > 笔记本内置麦
  • 语音输入软件:VoiceInk、Spokenly、SuperWhisper 三选一
  • 听写模型:ElevenLabs Scribe 或 GPT-4o Transcribe
  • 润色模型:Gemini 2.5 Pro
  • API Key 或包月账号

有一点先记住:免费输入法不是不能用,而是修改成本太高。你省的是订阅费,花掉的是时间和注意力。

按这个顺序做

  1. 先定场景 不要一上来追“最高识别率”。先分清你是快输,还是慢输。
  • 快速听写:几秒到几十秒,追求回字快,适合聊天、论坛回复、顺手改稿
  • 慢速听写:几分钟到几十分钟,追求成稿质量,适合写文章、写邮件、整理笔记

这两类工具本身就不是一回事,拿短语音工具硬撑长录音很容易丢内容、格式乱,具体差在哪可以看 短语音输入法和长语音输入法,别再混着用了。本文接下来讲的都是慢速听写这一条线。

  1. 先把硬件调对 麦克风比很多人想的更关键。离嘴近、位置固定,效果通常比软件切换更明显。降噪也别迷信,开了不一定更好,可能会把有用语音细节一起削掉,最好自己实测。3. 选听写模型 优先 ElevenLabs Scribe。理由是:没有明显繁简混乱、标点混乱和幻觉问题,连续录音最长可到 10 小时。 如果用 GPT-4o Transcribe,也能打,但它有 25 分钟或 2000 token 的限制,超了可能直接失败,或者后半段被截断。4. 选润色模型 优先 Gemini 2.5 Pro。原因不是它最聪明,而是它在长文本润色里不容易偷偷缩写。 对 GPT-5 的评价很谨慎:智力高,但长内容容易缩写,而且不提醒。这个风险如果放在会议纪要、长段素材整理里,很伤。5. 选软件
  • VoiceInk:适合 Mac 用户,开源免费版可从 GitHub 下载 DMG,自备 API;能手动重识别和重润色,可多开
  • Spokenly:适合嫌麻烦的人,支持包月,但不支持多开,长录音和不同平台版本有限制
  • SuperWhisper:跨平台一些,但即使用 API 也要付月费,且听写模型受限
  1. 慢速写作直接用多开轮录 做法是复制 VoiceInk 应用,改成 VoiceInk2,再分别设置不同快捷键。 操作路径大致是:Mac 访达 → 应用 → 右键复制 VoiceInk → 改名 然后在 Enhancement → Prompt 里建不同预设,一个给“慢速”,模型用 2.5 Pro;需要快速输入时再复制一个做“快速”,模型换成 2.5 Flash。 使用时 F1 录第一段,结束后让它后台润色;立刻按 F2 录第二段,轮流切。这样能把“等模型思考”的空档吃掉。

这里最容易踩坑

  1. 以为软件最重要,其实麦克风先决定下限 收音差,后面模型再强也只能补一部分。2. 以为免费最省钱,结果时间全耗在改错字和补句子 短聊天没事,长文本会很痛苦。3. 以为 GPT-4o Transcribe 能一直录 它有时长和 token 限制。超限不是“稍微差一点”,而是可能直接失败或截断。4. 以为润色模型只看聪明不聪明 写长文时,最怕的不是笨,而是缩写。OpenAI 系列长内容有缩写老毛病,这里没展开,建议自行验证。5. 以为包月就一劳永逸 很多包月只包听写,不包顶级润色;或者只包润色,不包顶级听写。最后还是要补 API。6. 多开后忘了检查设置 VoiceInk 多开实例在重启或彻底关闭后,设置可能同步,快捷键要重设一次,不然容易串掉。7. 买账号、买 Key 图便宜 像 GCP、Azure、闲鱼成品号这类方案,成本低,但封号、复用、稳定性都是现实风险。尤其卖家给你的 Key,也提到可能被二次出售。

常见问题

想写长文该用哪类工具?

走慢速听写这条线:MacBook + 近嘴麦克风 + VoiceInk,听写用 ElevenLabs Scribe,润色用 Gemini 2.5 Pro。这套组合是为了追求成稿质量,跟聊天、论坛回复那种追求回字快的快速听写不是一回事,两套配置最好分开设置,别用一个快捷键覆盖所有场景。

识别率怎么提高?

麦克风比软件切换更关键——离嘴近、位置固定,效果通常最明显,降噪也别迷信,开了不一定更好,最好自己实测。听写模型优先 ElevenLabs Scribe,没有明显繁简混乱、标点混乱和幻觉问题,连续录音最长能到 10 小时;GPT-4o Transcribe 也能用,但有 25 分钟或 2000 token 的限制,超了可能直接失败或后半段被截断。润色模型优先 Gemini 2.5 Pro,它不容易在长文本润色时偷偷缩写,这一点比“聪明不聪明”更重要。

成本大概怎样?

ElevenLabs Scribe 听写 + Gemini 2.5 Pro 润色这套组合按用量付费,整体成本能压到很低的量级。如果不想折腾 API Key 和平台限制,也可以走 Spokenly 包月,但它不是最便宜,也不支持多开,长录音和跨平台版本上有限制,本质是花钱换省事。想了解识别原理和成本结构,也可以对照看 语音输入与知识管理 专题里的其他记录。

我的建议

如果你是认真写内容的人,别把这事理解成“找个最强软件”。更像是在搭一条流水线。

最稳妥的起步方式是:

  • MacBook
  • 近嘴麦克风
  • VoiceInk
  • ElevenLabs Scribe 听写
  • Gemini 2.5 Pro 润色

预算紧,就先把麦和模型配对好,再去优化软件细节。别反过来。

如果你每天都有长段输入需求,直接把“快速听写”和“慢速听写”拆成两套配置,不要试图让一个快捷键覆盖所有场景。该快的时候快,该慢的时候让模型慢慢想。

如果你不愿意配 API、不想研究平台限制,那就接受“省事更贵、自由度更低”这个代价,走 Spokenly 包月。这个选择没问题,只是别对上限期待太高。

最后一句最实用:先试第一梯队,再评价值不值。没对比过,很容易把“能用”误判成“够用”。