电子书买了一堆,硬盘里躺着;通勤、做饭、散步时又只能刷短视频。市面上的有声书要么没有你想听的那本,要么单本价格不低。
GitHub 上有个项目叫 Audiblez(星标约 8K+),用开源语音合成模型 Kokoro-82M,把 EPUB 直接转成带章节的 M4B 有声书文件,让「看不完的书」变成「听得完的书」。
项目地址:https://github.com/santinic/audiblez
它能做什么?
- EPUB → M4B:解析电子书正文,合成语音并打包成常见有声书格式,可用 VLC 等播放器收听
- 语速可调:大约在 0.5×~2.0× 之间
- 按章转换:可以只转部分章节,不必一次啃完整本
- 命令行 + 图形界面:习惯终端或想点几下的人都有入口
- CPU 能跑,有 NVIDIA 显卡更快:走 PyTorch CUDA 时速度提升明显
语言支持包括:美式/英式英语、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语、普通话等(以仓库当前说明为准)。
官方示例里,在 Colab T4 上转一本约 16 万字符的书大约数分钟量级;纯 CPU(如 M 系列 Mac)会慢不少,但仍可接受做「隔夜转换」。
为什么值得一试?
- 补齐「有书无声书」的缺口
尤其是小众、绝版、尚未上架有声平台的书。 - 本地完成
转换在自己机器上跑,不必把整本上传到未知在线服务。 - 模型轻、声音自然
Kokoro-82M 参数量不大,观感上比很多早期机械 TTS 更接近「能听下去」的水平。 - 碎片时间重新利用
通勤、家务时把进度往前推,比书一直躺在阅读器里强。
使用前必须清楚的几点
版权与合规
只应转换你有权使用的电子书(例如已购买、或明确允许的文本)。把受版权保护的书籍批量制成有声书再传播,通常不合法。工具是中性的,用法要守边界。
中文与断句
普通话在支持列表里,但多音字、专有名词、复杂断句仍可能需要抽听校对,不要默认「零修改就能商用级」。
依赖与环境
一般需要 Python、ffmpeg、espeak-ng 等;首次装模型和依赖会占空间。以 README 安装步骤为准。
质量预期
适合个人听读、复习、过内容;若你要出版级旁白、多角色戏剧效果,专业录制或商业 TTS 仍是另一档需求。
小结
Audiblez 做的事很简单:让已有的 EPUB,用本地 TTS 变成能在路上听的 M4B。
对「书买了没时间看、路上又想输入」的人,这是把阅读场景从书桌挪到耳机里的一条低成本路径。积灰的电子书,换个介质,有时真能重新读起来——在合法使用的前提下,值得装一次试试看。
