项目概览
本文档对比两款开源轻量级 TTS 系统:Supertonic 与 MOSS-TTS-Nano。Supertonic 由 Supertone Inc. 开发,基于 ONNX Runtime 完全本地运行,约 99M 参数,支持 31 种语言,提供 11 种语言 SDK,采用 Flow Matching 与语音自编码器架构,代码 MIT 许可,模型 OpenRAIL-M。MOSS-TTS-Nano 由 MOSI.AI 和复旦大学 OpenMOSS 团队开发,仅 0.1B 参数,基于 Audio Tokenizer + LLM 纯自回归架构,支持实时流式推理,可在 4 核 CPU 上运行,支持零样本声音克隆,输出 48kHz 立体声,Apache-2.0 许可。两者均解决传统 TTS 的部署、质量、工程与生态痛点,但侧重点不同:Supertonic 适合跨平台部署与极低资源设备,MOSS-TTS-Nano 适合声音克隆与中文 TTS。文档还包含架构原理、系统架构、关键流程、应用场景、优缺点与选型建议。
解决什么问题
传统 TTS 存在六大痛点:商业 TTS 依赖云端 API,存在延迟、成本、隐私问题;大型开源模型需要 GPU,边缘设备无法运行;模型体积大,下载加载时间长;轻量模型常出现重复、跳字、读错数字/电话;多语言切换不自然;固定声音缺乏表现力。工程上,各平台 SDK 不统一,声音克隆流程复杂,文本归一化不完善,流式推理延迟高。生态上,缺乏端到端开源工具链,浏览器端 TTS 能力弱,中文 TTS 生态相对落后。 Supertonic 通过 ONNX Runtime 纯端侧推理解决云端依赖,99M 参数适合树莓派/e-reader,11 种语言 SDK 解决跨平台问题,文本归一化超越 ElevenLabs/OpenAI/Gemini。MOSS-TTS-Nano 通过 PyTorch/ONNX/MLX 多后端实现 CPU 友好,0.1B 参数 + 20M Audio Tokenizer 可在 4 核 CPU 运行,零样本声音克隆简化流程,WeTextProcessing + pynini 处理中文文本归一化,纯自回归支持流式生成。
工作方式
Supertonic 采用 Flow Matching + 语音自编码器架构:输入文本经 Text Encoder,Flow Matching 生成语音潜在表示,语音自编码器解码为 16-bit WAV。自研 LARoPE 位置编码解决文本与语音长度不对齐,Self-Purifying Flow Matching 自动过滤噪声标签。所有推理基于 ONNX Runtime,跨平台零适配成本。 MOSS-TTS-Nano 采用 Audio Tokenizer + LLM 架构:输入文本与参考音频,文本经 WeTextProcessing 归一化,参考音频经 MOSS-Audio-Tokenizer-Nano(20M 参数,Cat 架构,纯因果 Transformer)编码为 token,LLM(0.1B)逐 token 生成目标音频 token 序列,Audio Decoder(RVQ 16 codebooks)解码为 48kHz 立体声。纯自回归生成天然支持流式输出。
核心能力
- Supertonic:约 99M 参数,支持 31 种语言
- Supertonic:11 种语言 SDK(Python/Node.js/C++/Rust/Go/Swift/Java/C#/Flutter/Web/iOS)
- Supertonic:完全离线,浏览器原生 WebGPU/WASM 支持
- Supertonic:文本归一化超越 OpenAI/ElevenLabs(金融/电话/技术文本)
- Supertonic:代码 MIT 许可,商业友好
- MOSS-TTS-Nano:0.1B 参数,4 核 CPU 可运行
- MOSS-TTS-Nano:零样本声音克隆,3-5 秒参考音频即用
- MOSS-TTS-Nano:48kHz 立体声输出,音质接近 1.7B 模型
- MOSS-TTS-Nano:原生流式推理,适合 Voice Agent
- MOSS-TTS-Nano:Apache-2.0 完全开源
- MOSS-TTS-Nano:ONNX CPU 推理效率比 PyTorch 版快 2x
- MOSS-TTS-Nano:支持微调,双平台发布(HuggingFace + ModelScope)
使用前需要了解
- AI 整理 · 本地测试,未经人工复核;依据历史报告节选,不代表当前产品状态。
- Supertonic 不适合需要零样本声音克隆的场景(公开权重仅预设声音,Voice Builder 付费);中文音质和自然度可能不如 MOSS-TTS-Nano;无流式实时对话优化;OpenRAIL-M 模型许可有使用限制。MOSS-TTS-Nano 仅支持 20 种语言;SDK 以 Python 为主,缺乏多语言支持;文本归一化依赖 pynini,安装复杂;无浏览器原生 WebGPU 支持;流式对话仍需 1.7B 的 MOSS-TTS-Realtime;暂无移动端官方 SDK。两者均需注意声音克隆的隐私与合规。

