用 AI 做一本有声书,我一分钱没花:完整踩坑记录

上个月有个读者私信我:「博主,我写了本十来万字的小说,想做成有声书,但配音报价一单要两三千,有别的路吗?」

我当时就笑了——因为我三个月前刚走过这条路。自己配音?录到第三章嗓子就哑了。找配音?预算直接劝退。最后我用 AI 声音克隆在线工具,把自己克隆了一遍,整本书的音频就这么「念」出来了。全程零成本。

这篇文章就是那次的完整记录,包括我踩的坑。

第一步:别急着生成,先把稿子改成人话

这是我踩的第一个坑。我兴冲冲把原稿粘进去,结果生成出来的音频念到「如下图所示」的时候,我自己都愣住了——听众哪来的图?

所以动手之前,先把文稿过一遍:

  • 删掉所有视觉提示,比如「见表格」「如图」这类。
  • 长段落拆短。书面语一大段一百多字,念出来能憋死人。
  • 专有名词、生僻字提前查一遍读音。AI 念错人名,听众立马出戏。
  • 标点认真检查。逗号和句号直接决定停顿,我有一章忘了加句号,念出来像 rap。

一个小技巧:把稿子自己出声读一遍。你读着别扭的地方,AI 念得更别扭。

第二步:用谁的声音?

两条路。一是用现成的 AI 配音音色,省事;二是克隆自己的声音,保留「作者味儿」。

我选了后者。用 web666 的免费声音克隆工具,上传一小段自己的录音——大概一分钟就够——系统就生成了一个跟我音色、语速都很像的声音模型。说实话第一次听到成品的时候有点恍惚,像听自己的播客回放。

不想用自己的声音也行,web666 主站上有不少免费 TTS 声音合成音色可选。挑的时候别只顾着好听,想想你要连着听几十个小时——音色太亮或者太飘的,听久了累。

第三步:批量生成音频

声音定了,开始生成。我的建议是按章节处理,别一口气把十万字全丢进去——中途想改一个字,你总不想从头再来吧。

流程很简单:

  1. 把一章的文字粘进生成器。
  2. 语速调慢一点点。有声书不是短视频,稍慢的节奏更耐听。
  3. 先试听一小段,确认没问题再整章生成。
  4. 下载,存好,命名规范(我用的「章节号_标题」,不然后期剪辑会疯)。

web666 是免注册声音合成,打开浏览器就能用,也不限次数,这点对我这种反复试错的人太友好了——我光语速就调了三轮。想试的朋友直接用这个在线文字转语音免费工具就行。

第四步:剪辑,别偷懒

AI 生成的音频已经很干净了,但业余和专业的差距就在这一步。

  • 章节之间留 1~2 秒静音,听感会舒服很多。
  • 每个文件首尾的杂音、电流声剪掉。
  • 音量统一。我第一版有几个章节忽大忽小,被读者吐槽「像换了个播放器」。
  • 加个简短的开场:书名、作者名,配段免版权的轻音乐。

Audacity 就够用了,免费。导出用 MP3,码率 192kbps 以上,这是大多数平台的底线要求。

第五步:发布去哪

音频齐了,发布渠道看你的目标:

  • 自己的阵地:公众号、个人网站、播客平台,直接发。
  • 有声书平台:各家对格式和审核要求不同,上传前看清楚规则。
  • 短视频引流:剪几段精华音频发抖音、B 站,效果意外地好。

提醒一句:现在不少平台对 AI 生成的音频有申报要求,另外——克隆声音一定要用自己的,或者拿到明确授权。别人的声音,碰都别碰。

常见问题

免费声音克隆,效果真能用吗?

能,但取决于你的原始录音。安静环境、离麦克风近一点、自然说话,效果就好;拿手机在马路上随手录一段,那神仙工具也救不了。

用 AI 做有声书,侵权吗?

文字是你的(或有授权),声音是你自己的(或有授权),就没问题。反过来说,盗别人的书、克隆别人的声音,那不是工具的问题,是你的问题。

免费文字转语音的音质够出版级吗?

说实话,跟顶级配音演员比还有差距。但日常听感已经很自然了,尤其你把停顿和语速调好的话。我的读者里没一个人听出来是 AI——直到我自己承认。

写在最后

整本书做完,我算了一下:工具零成本,花掉的是大概两个周末的时间。比起三千块的配音报价,我觉得值。

如果你手里也压着一本没时间录的书,今晚就可以动手——先把第一章的稿子改成人话,然后去 web666 克隆一段自己的声音试试。十分钟就能听到「自己」念自己的书,那种感觉,你试了才知道。

更多玩法我记在这篇动态合集里了,有兴趣可以去翻翻。