新闻

VoxCPM2 :这个 2B 模型的野心不只是”又一个 TTS”

1 分钟阅读
来源:aixq.cc
正常人都觉得,语音合成这件事的终点就是把模型做得更大、数据喂得更多。XTTS、CosyVoice、F5-TTS,大家都是这条路:文本进去,切成离散 token,语言模型预测 token 序列,声码器还原波形。这套流程跑了三四年,大家忙着比谁的 MOS 分高零点几,比谁少了几毫秒延迟。VoxCPM2 没这么做,它直接把 Tokenizer 从流水线里删了。 这不是学术噱头。扔掉 Tokenizer 意味着模型不用先把一段语音压缩成 1024 个离散符号再还原,而是在连续空间里直接建模声音,跳过了量化压缩的瓶颈。结果呢