阿里语音模型超了 GPT-Realtime,最狠的不是那个第一
今天凌晨,阿里通义把一个叫 Qwen-Audio-3.0-Realtime 的实时语音模型放出来了,前身是之前那个 Fun-Realtime-AudioChat,改了名,能力全面升级。
一句话概括官方通稿,它在 Artificial Analysis 的语音推理(Speech Reasoning)子项里综合排名第一,超过了 OpenAI 的 GPT-Realtime-2。榜单地址是 https://artificialanalysis.ai/ ,感兴趣可以去翻。
这句话你今天大概率已经在别的号刷到过了。国产模型又登顶了,超过 OpenAI 了,很燃。
但说实话,我盯着那份发布看了半天,最想跟你唠的不是这个第一。
这个第一当然值钱,语音这条赛道能把 OpenAI 按下去不容易。顺带说一句,在另一个中文语音对话表现力榜 VStyle-ZH 上,它也并列榜首,跟豆包 App 一起排在最前面。

可对一个天天给模型搭运行脚手架的人来说,榜单排名是结果,我更关心的是它到底解决了哪个真实的工程难题,以及官方在通稿末尾用小字贴出来的那张表里,藏着什么它没大声说的东西。
我们一个一个聊。
先说语音 Agent 这玩意为什么难做,难在哪,你才能明白这次的第一是从哪个坑里爬出来的。
很多做后端的朋友可能没接过实时语音,我给你还原一下那个场景。你想做一个能打电话的 AI 客服,或者一个能陪你聊天的语音搭子。听起来不就是把语音转成文字,喂给大模型,再把回答转成语音播出来吗,三步走,中间接个 GPT 就完事了。
我一开始也是这么想的。厉害了,真去做才发现,这三步里每一步都是坑。
第一个坑,叫双工。
人和人打电话是可以互相打断的。你说到一半我插一句「等下,你是说昨天那个吗」,你会停下来听我说完。这种你来我往、随时能插话、还知道什么时候该闭嘴的能力,术语叫双工(duplex,就是通话双方能同时占用信道、互相打断,而不是一人说完另一人才能开口)。
传统的语音助手基本都是半双工。你说完,它憋着一句话答完,中间你想插嘴它根本不理你,跟对讲机似的,一个人说完喊个「over」另一个人才能说。这种交互一旦超过两个回合,那种机械的错位感就上来了,你会本能地觉得对面是个机器。
更麻烦的是,双工不光是「允许打断」,而是要判断该不该被打断。你在一个开放工区里跟 AI 语音对话,旁边俩同事在争一个需求,背景音一堆。这时候 AI 怎么知道哪句是在跟它说话,哪句是环境噪音,哪句是别人在旁边聊天不用理。你一个「嗯」到底是敷衍的附和还是真的想插话打断它。
这就是为什么大部分语音 Agent 一放到真实的嘈杂环境里就废了。安静的录音棚里 demo 得挺好,一到地铁上就开始鬼打墙。
Qwen-Audio-3.0-Realtime 这次专门搞了个「多模态感知的双工控制」模型来干这件事。它同时分析音频、语义和声纹三路信息,来判断到底该不该接话。官方说它能在餐厅、开放工区这种嘈杂环境里精准锁定你的声音,多人讨论时也不被旁听者带偏。
这里有个细节我觉得是给开发者留的真东西。它在 Realtime API 里预留了一个 audio_prompt 字段,你可以提前把特定用户的一段录音传进去,模型就能做到声纹级的锁定,只听这个人的,别人的声音和背景噪音全部忽略。
这个设计我一看就懂它想干嘛。呼叫中心、车载、智能硬件,这些场景里最头疼的就是「别人说话我也应答」。有了声纹锁定,一个开放大厅里几十个坐席同时打电话,每个 AI 只认自己那个客户的声音,互相不串。这不是 demo 花活,这是能直接省掉一大堆工程 workaround 的接口设计。
好,双工是第一个坑。第二个坑更隐蔽,也是我觉得这次最有意思的地方。
叫语音模型的智商衰减。
这个词是官方自己在架构那节里用的,我第一次看到还挺意外,因为这是个圈内心照不宣但很少被摆到台面上讲的痛点。
啥意思呢。同一家的模型,纯文本版本往往很聪明,能推理、能算数、能一步步拆解复杂问题。但一旦你让它处理语音、让它端到端地听和说,它就变笨了。同样一道需要绕两个弯的题,打字问它答得挺好,用嘴问它就开始胡说八道。
为什么会这样,简单讲就是训练语音能力的时候,模型的一部分算力和参数被拿去伺候「怎么把话说得像真人」这件事了,推理那部分就被挤掉了。你要它耳朵灵、嘴巴甜,它的脑子就跟不上。鱼和熊掌。
所以你看市面上很多语音助手,聊天寒暄没问题,一旦你问点需要真思考的东西,它立刻露馅。这不是它不想答,是它那套架构下真的没这个脑子。
Qwen-Audio-3.0-Realtime 解决这个的思路,用了个叫 On-Policy Distillation(在线策略蒸馏)的框架。蒸馏(distillation)这个词圈外朋友可能陌生,我用大白话说,就是让一个笨一点的小模型去模仿一个聪明的大模型的解题过程,把大模型的本事「学」过来,但自己体量还是小、跑得快。
这次他们干的事,是把文本大模型那套完整的推理能力,蒸馏进语音模型里。而且不是找一个老师,是找了一堆老师,多教师蒸馏,每个老师管一摊。
有个老师专门教口语表达和指令遵循,保证它说话像人、听得懂吩咐;有个通用老师保证基本问答和推理不掉链子;有个 Agentic 老师专门教它怎么调用工具、执行复杂任务;还有个音频理解老师,负责让它听懂语气、叹息、笑声这些话里话外的东西。
四个老师各教各的,最后确保这个语音模型「不偏科」。既有耳朵和嘴,也保住了脑子。
这套打法我是真觉得聪明。它没有硬造一个全能模型,而是承认了「语音会让模型变笨」这个客观事实,然后用蒸馏这个手段,专门把丢掉的那部分脑子给补回来。工程上这叫对症下药,比空喊「我们的模型又快又聪明」实在多了。
得益于这套,它才在语音推理那个子项拿了第一。你看,第一不是凭空来的,是把智商衰减这个坑填了才换来的。
聊到这,我得把那张表拿出来了。就是我开头说的,官方在通稿末尾用小字贴出来、但没大声念的那张。
在一个叫 AudioMultiChallenge 的基准上,官方老老实实贴了两组数。这个基准测的是多轮音频对话里的指令遵循能力,就是你连着吩咐好几件事、还带前后依赖,看它跟不跟得住。
标准 prompt 下,plus 版本拿了 44.0 分。但换成口语 prompt,也就是模拟人真的用大白话、带口头禅、说得没那么规整地去问它,分数掉到了 37.6,掉了 6.4 分。flash 版本也一样,从 43.6 掉到 38.1,掉 5.5 分。

我盯着这个数字看了一会儿。
坦率讲,我特别欣赏它把这个数贴出来。多数发布会只会给你看最漂亮的那个标准分,绝口不提口语场景掉了多少。可对我们做工程的来说,口语那一栏才是生产环境的真实分数。因为你的用户不会字正腔圆地念指令,他们会含含糊糊、会说半句、会「那个啥你帮我把上面那个改一下」。
掉 6 分是个什么概念,我不吹也不黑。它说明多轮口语指令遵循这块,即便是这个登顶的模型,也还没到能撒手不管的程度。你要拿它去做一个需要连续多步、还得听懂大白话的复杂语音 Agent,这 6 分的缺口就是你上线前得自己用工程手段(兜底话术、确认反问、状态机约束)去填的。
顺便说一句,VoiceBench 那组数据倒是稳,标准到口语只掉 2 分左右,说明单轮的开放域问答它已经很扎实了。问题集中在多轮。这个分布其实挺符合直觉,越到多轮、依赖越长,模型越容易在口语的模糊性里迷路。
所以你看,一张诚实的表,比十句「遥遥领先」有用。它直接告诉你这模型今天能干什么、还差在哪,你据此决定要不要接、接了要补多少工程。这才是发布通稿里最值钱的部分,可惜大部分人只看排名。
除了这两块,它还有个我顺带提一下的能力,动态工具调用。它能自己判断什么时候该调工具、什么时候就是闲聊,基于 FunctionCall 标准协议接 MCP、API、知识库。官方在 TauBench(一个覆盖零售、航空、电信真实业务的工具调用基准)上测了,把里面的文字用户换成语音输入去跑。
这个方向是对的。语音 Agent 光会聊天没用,得能长出手脚去干活,帮你订个行程、查个实时股价、规划条路线。让语音真的成为一个能办事的助理,而不是一个会说话的玩具。不过工具调用这块各家都在卷,不算这次最大的亮点,我就不展开了。
说回来。这次发布,如果你只带走一个第一,那有点亏。
我更想让你带走的是这三层。双工控制解决了「什么时候该说话」,蒸馏解决了「说话的同时别变笨」,那张掉分表告诉你「它现在到底能扛多复杂的活」。前两个是它凭什么第一,第三个是它还不是万能。三个加起来,才是这个模型完整的样子。
模型已经上线阿里云百炼了,分 plus 和 flash 两个版本,plus 更强,flash 更快更省,看你场景挑。想上手的话,官方在 GitHub 上放了对话 demo,地址是 https://github.com/aliyun/alibabacloud-bailian-speech-demo ,拉下来就能跑,比看十篇通稿强。
我一直觉得,语音是 AI 交互里最难也最动人的一个方向。文字是冷的,语音是带体温的,它有语气、有停顿、有那一声没绷住的笑。真要让机器学会这种带体温的对话,光聪明不够,还得懂什么时候闭嘴、什么时候接话、以及在一片嘈杂里,认得出你那一句「在吗」。
这次阿里往前挪了一步。不大不小,但方向是对的。
至于那 6 分的缺口,会有人去填的。说不定就是正在读这篇的你。