丢一段录音进去,说一句”语气兴奋一点”,或者”把口音去掉”,模型直接给结果。这是腾讯混元新开源的AuK想做的事。
AuK是一个音频编辑模型,把语音生成和语音编辑合进同一个模型,用自然语言指令加参考音频驱动。能力清单包括:零样本文本转语音,给几秒参考音就能用这个音色念新文本;音色、风格、情绪编辑;去口音;多人语音分离。
一起放出来的还有AuK-Flash,只要4步推理,匹配条件下速度约为标准版的4.5倍。代码、模型权重和演示已经全部上线。
这里面最有意思的是”统一”。
过去做音频,TTS是一个模型,变声是一个模型,降噪和分离又是另外的模型,一条完整流程要串好几个工具,每过一道都在掉音质。AuK的思路跟图像领域的指令编辑模型很像:别拆那么细了,一个模型,用人话告诉它改哪儿。
4步推理的Flash版本,意味着它离实时应用不远了。配音、有声书、播客后期、短视频口播,都是能直接接上的场景。
去口音这个功能对跨境内容团队很实用,一段带口音的英文讲解可以直接修成标准发音,不用重录。
同样的能力也让伪造更容易。零样本克隆加情绪编辑,已经够做出以假乱真的语音,开源之后门槛又降了一截。腾讯在权重分发上会不会加限制、加什么限制,目前还看不到细节。
国内开源语音模型这一年很热闹,做TTS的、做语音对话的都不少。AuK把切口放在”编辑”而不是”生成”,找的是一块相对空的位置。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






腾讯混元开源音频编辑模型AuK,一句话改音色去口音