字节跳动的 AI 团队发布了 MegaTTS 4,效果太惊人了。
核心能力
- 输入:30 秒的参考音频
- 输出:可以生成任意文本的高保真语音
- 支持 100+ 种语言,包括中文方言
- 能保留原说话人的情绪、语调、停顿习惯
技术细节
MegaTTS 4 用了一个新的架构叫 Voice Tokenizer + Flow Matching。简单来说:
- Voice Tokenizer 把声音特征编码成离散 token
- 然后用 Flow Matching 做声音生成
- 最后通过神经声码器还原成波形
相比传统的 Tacotron/FastSpeech 方案,MegaTTS 不需要大量配对数据(文本+对应音频),只需要纯音频就能训练。
安全问题
当然,这种技术也带来了 Deepfake 担忧。字节说他们会限制 API 的使用范围,要求用户上传自己的声音样本做验证。
这对内容创作、教育、无障碍领域都有巨大价值,但监管也得跟上来。
参考来源:
评论
评论已关闭。