AI 配音开始会演戏,这行的门槛先塌了一半
一句台词,前面多了个中括号。
[angry] 我跟你说了三遍锁侧门,现在整批货全泡在雨里。
模型念出来的版本,是真的在发火。不是把音量调大的那种假生气,是有咬字、有停顿、尾音里压着火的那种。这段 demo 挂在通义 Lab 的官方博客里,我点开听了几段,怎么说呢,那个中括号比它旁边所有跑分数字都值得聊。
先把新闻本身交代了。通义这周正式放出 Qwen-Audio-3.0-TTS,文本转语音模型,同一套底子出两个版本,Flash 主打实时交互,首包延迟压到 300 毫秒级,Plus 主打音质,自然度和音色保真优先。然后是那个到处刷屏的战绩,在第三方盲测榜单 Artificial Analysis Speech Arena 上,Plus 版以 Elo 1237 登顶世界第一。
第二名是谁呢,Simba 3.2,Elo 1232。
差 5 分。
后面跟着 Gemini 3.1 Flash TTS 和 Sonic 3.5,双双 1211。榜单是真人盲听 PK 出来的,一千四百多场对战攒下的分,不是自家评测集自娱自乐,这个含金量可以认。但差 5 分就叫登顶,这事我们后面还得回来说道说道。

通稿里剩下的信息我给你快进一遍。16 种语言,阿拉伯语泰语越南语都在列。多语言可懂度用 WER 衡量,就是把生成的语音再转回文字,看错了几个词,错得越少越好,Flash 平均 3.87,16 种语言里 10 种拿了最佳。说话人相似度,衡量克隆出来的声音像不像本人,Plus 在全部 16 种语言上排第一,平均 82.75。

还有方言,官方 demo 里挂了杭州话、陕西话、上海话,上海话那条念的是「屋里向装修真个是烦人,天天敲墙壁,声音响得来」,有点子牛逼,那个「响得来」的语气词是真拿捏住了。
好,通稿部分到此为止。这些数字别的号今天都会写,你多刷两篇就背下来了。
我想聊的是另一件事。这次发布真正的分水岭,是你控制这个模型的方式变了。
做过语音应用的朋友大概还记得被 SSML 支配的日子。SSML 是老一代语音合成的标记语言,XML 格式,你想让一句话读得慢一点、调门高一点,得写 prosody 标签把台词包起来,属性一层套一层,改一个语气要试十几遍参数。写起来的感受,约等于用记事本手写网页,而且写完还不一定对,模型理解的「慢一点」和你想要的「慢一点」经常是两码事。真的就是一声叹息。
Qwen-Audio-3.0-TTS 给了两条新路。
第一条,直接用自然语言说戏。官方 demo 里有个提示词是这么写的,「大厅投影感、开阔的节奏、轻微混响、欢迎词的语调上扬,一个体育场播音员在欢迎观众」。然后模型就真给你一个球场播报腔。注意这段话里没有任何参数,没有标签,就是一段人话,像导演跟演员讲这场戏的规定情境。
第二条,在台词里嵌内联标签管细节。[gasp] 是倒吸一口气,[giggles] 是咯咯笑,[whisper] 是耳语,写在哪个词前面,情绪就落在哪里。开头那句泡在雨里的货,就是这么标出来的。
一个管整体基调,一个管逐字细节。你发现没有,这就是导演的两种工作方式,开拍前给演员讲戏,加上在剧本边上做铅笔标注。配音这件事,从「在音色列表里挑一个声音」变成了「写一份带标注的剧本」。
而写剧本,是我们每个人都会的事。
再往上升一番。真实场景里最烦的其实不是控制,是克隆的原材料。你想复刻一个声音,手里往往只有一段微信语音、一段会议录音,背景里有键盘声、空调声、隔壁工位的哈欠。以前这种素材直接不可用。这一版把语音增强直接做进了克隆链路,模型自己抑制混响和噪声,只留音色。官方对比 demo 里,同一段高噪声参考音频,老版本克隆出来一耳朵电流声,新版本干干净净。
选角不挑素材了,说戏用人话了,标注写剧本里了。好家伙,一个配音棚的活,一个 API 就接完了。
聊到这里得亮一下我自己的身份,我平时的活是给大模型搭脚手架的,就是让模型真正能干活的那层工程,工具怎么接、超时怎么办、延迟预算怎么分。从这个视角看这次发布,我最在意的数字反而不是 Elo 1237,是 Flash 那个 300 毫秒首包。
你如果做过语音对话应用就知道,用户对「对方开口」的忍耐度大概就一秒钟。这一秒里要塞进三件事,语音识别把你的话转成文字,大模型想好怎么回,TTS 再把回答念出来。中间那步是大头,留给 TTS 的预算其实只有三五百毫秒。首包 300 毫秒,配合流式生成,刚好卡进这个门槛。所以我跟你说,虽然登顶的是 Plus,真正走量的大概率是 Flash,它是奔着千千万万个语音 agent 的嘴去的。
顺着上面的再聊聊普通创作者能拿它干嘛,这部分我觉得比跑分实在。做有声书和播客的,以前卡在长文本念着念着就平了,现在情绪可以逐句标注,念到反转处手动塞一个 [gasp],比换十个音色都管用。做游戏的,NPC 台词配音是出了名的成本黑洞,独立开发者根本请不起配音棚,现在一个预置音色库加内联标签,先把 demo 阶段糊弄过去完全够用。最馋的应该是做内容出海的朋友,还记得前面那个说话人相似度 82.75 吗,它真正的价值是跨语言音色保持,也就是同一个声音,用泰语、西班牙语、阿拉伯语说出来还是同一个人。你的账号人设声音可以原样搬去 16 个语言市场,这在两年前是个纯科幻需求,现在是个 API 参数。
我自己还没在真项目里压测过它,先不吹稳定性,但看纸面能力,这几个场景都值得排队试。
当然,也有官方没写在标题里的部分,我给你挑三个。
一个是那个 5 分。Elo 榜单是有置信区间的,这个榜上前两名的区间是正负 17 和正负 16 分。你去看榜单原图会发现一个诚实的细节,排名那一列,第一名和第二名标的都是 1 到 2,也就是榜单自己都承认这俩在统计上没分出胜负,谁今天多赢几场明天就换个座次。登顶是真的,断档领先是没有的,宣传口径和统计事实之间,隔着一个市场部。
一个是权重。Qwen 系列这两年靠开源攒下的口碑不用我多说,但这次的 TTS 只有 API,挂在阿里云百炼上按量计费,权重没放出来,想本地跑的朋友可以先散了。价格也不算客气,榜单上标的是 27.6 美元每百万字符,第二名 Simba 3.2 只要 10 美元,快三倍的差价。

这跟 Qwen 一贯的开源人设是有落差的,也侧面说明语音这块,各家都觉得是能收着卖钱的东西。
一个是「即将推出」。48kHz 高采样率输出,coming soon。完整语言支持,rolling out soon。官方博客里这两个 soon 挨得很近,你可以理解为发布节奏赶了一点,赶的是什么,我们往下看。
前几天字节刚发了 Seed Audio 1.0,把人声和音效统一建模,一个模型端到端生成影视级的整段音频,台词、脚步声、环境音一锅出。这周通义就把 TTS 榜单第一拿下了。两家的路线其实岔开了,字节想做的是整个音频后期部门,你给剧本它给成片,通义做的是一个可以指挥的配音演员,控制粒度细到一个倒吸气,延迟低到能实时对话。再算上海外那边长期霸占创作者心智的 ElevenLabs,还有 MiniMax 这些一直在语音赛道深耕的选手,耳朵这个入口,突然就挤满了人。
为什么是现在。我自己的判断是,文本模型的能力曲线肉眼可见地趋同了,跑分你追我赶两三分的差距,用户根本感知不到。下一轮体验差异在交互界面上,而语音是所有界面里最自然的那个。谁先把「好听、听得懂、演得像、还便宜」这四件事凑齐,谁就拿到下一个场景的门票。TTS 以前是各家产品线里的配角,现在被推到台前单独打榜,这个信号本身比榜单名次重要。
有个不那么舒服的话题我也不想绕开。克隆鲁棒性变强,另一面就是一段嘈杂的电话录音就够复刻你的声音了。骗子拿你的声音给你爸妈打电话要转账,拿你老板的声音在语音里催你付款、要验证码,这类事只会更逼真更便宜。技术上水印和声纹验证都在做,但普及速度肯定追不上克隆速度。这里没什么高明的建议,就一句土办法,跟家里人约一个电话里绝不外传的暗号,成本为零,比任何检测模型都可靠。
最后回到那个中括号。
剧本里的 [angry],一百年来都是写给人类演员看的提示,演员看到它,调动自己的经历和技巧,把这个词变成表演。现在它第一次变成了可执行的指令,机器读到它,直接输出结果。
配音行业的门槛,塌了一半。念得字正腔圆这件事不再值钱,音色好听也不再稀缺,因为这些都可以被两分钟的参考音频拿走。但塌掉的是门槛,不是这个行当。你听完 demo 就会发现,模型演得像不像,取决于标注写得准不准,戏说得对不对。判断哪里该倒吸一口气、哪里该压着火,这个判断依然在人手里,而且比以前更值钱了。
工具把执行的价格打下来的时候,品味的价格就涨上去了。这句话我在代码这行已经看它应验了一轮,现在轮到声音了。
那批泡在雨里的货,总得有人知道该用什么语气去心疼它。