CPU 直接跑!0.1B 开源超轻量多语言 TTS!

你有没有遇到过这种情况!
想给自己的 AI 项目加个"会说话"的功能,查了一圈方案,要么需要烧钱租 GPU,要么模型动辄好几个 G 根本下不动,要么效果出来跟机器人一样。
4 月 10 日,复旦大学 NLP 实验室 + MOSI.AI 团队,悄悄在 GitHub 上放出了一个叫 MOSS-TTS-Nano 的项目

上线不到几天天,GitHub Star 已经破 1400 stars,B 站视频收藏超过400。

下面是官方给的效果,大家感受下
语音合成这件事,本来门槛挺高的。
大厂的方案,动不动就是几十亿参数的大模型,配上专业级 GPU,才能生成听起来像真人说话的音频。
你家的笔记本电脑?别想了!
但 MOSS-TTS-Nano 不一样。

0.1B(一亿个参数),模型文件压缩后不到 300 MB。
关键是——纯 CPU 运行,不需要显卡。
甚至在 MacBook Air M4 上用单核就能流畅跑。
这是什么概念?
甚至在 MacBook Air M4 上用单核就能流畅跑。
就像人家都在开法拉利跑赛道,MOSS-TTS-Nano 开着一辆普通家用车,跑出来的圈速,比你想象的快多了。
那它到底能做什么?
说白了,三件事
第一,文字转语音。
你输入一段文字,它给你生成对应的说话音频。支持 20 种语言,包括中文、英语、日语、韩语、法语、德语……基本上你能想到的主流语言都有。
第二,声音克隆。
给它一段 3~10 秒的参考音频,它就能"学会"这个人的声音特征,往后用这个声音说任意内容。
不需要提前训练,不需要额外微调,拿一段录音就能用。
第三,实时流式输出。
不是"等生成完再播放",而是边生成边播放,延迟极低,特别适合对话机器人、实时配音这类场景
它为什么能这么小?
这就是技术含量的地方了,我尽量讲得人话一点。
先说一个背景知识:大脑是怎么"读文字发出声音"的
你读一篇文章时,大脑不是直接把文字"转换"成声音的。
它先理解意思,再调用肌肉控制声带发出声音。
语音合成模型做的,其实和这个类似。
MOSS-TTS-Nano 的内部,由两个核心部件组成:

具体架构如下图

跟其他方案比怎么样?
小巧灵活,还是十分具备优势的

要注意,MOSS-TTS-Nano 是"部署优先"的设计理念,它不是来和旗舰版比音质的,而是在"能跑的设备上尽快跑出足够好的效果"。
官方的定位很直接:小体积、低延迟、够用的实时产品质量、简单的本地配置
MOSS-TTS 家族:它不是孤儿
复旦这次开源的不只是 MOSS-TTS-Nano,背后是一整个语音模型家族:

Nano 就是这个家族里专门为"跑得动、部署快"场景打造的入门选手。
实测局限也要说清楚:
音质比不上旗舰版 MOSS-TTS(8B)和 CosyVoice,这是物理限制
0.1B 参数决定了情感表现力有限,对于要求声音有丰富情绪起伏的场景不太适合
克隆效果依赖参考音频质量,录音环境差会影响结果
多语言中,中英文效果最好,小语种还在优化
语音合成这几年发展太快了,大家好像都在卷"多大"、"多强"。
MOSS-TTS-Nano 反其道而行之,做了一个"足够好"的极小版本。
这背后的逻辑,其实很重要:
真实世界里,大多数应用场景不需要旗舰级音质,但对"能不能跑起来"极其敏感
一个嵌入在 APP 里的语音助手,一个跑在树莓派上的智能音箱,一个没有 GPU 预算的初创团队——他们需要的不是最好,而是能用的最轻量。
这个思路,值得关注。
在线 Demo:
GitHub 项目:
写文不易,如果帮到你了,请麻烦点赞、推荐、转发!
有任何问题欢迎留言,或添加我联系方式交流~