差评君 2026-09-24 00:00 浙江
全民进入唠嗑大时代
如果你最近发现同事变得神神叨叨的,经常对着手机、电脑小声说话
那他不一定是在跟谁摸鱼聊天,也有可能是在工作。
这么说吧,用语音和 AI 随地大小聊,在打工人的圈子里已经成了一种时髦。
以前往工位上一坐,噼里啪啦的键盘声一响,就知道这人开始干活了。
现在不一样。
越来越多的人开始尝试用动嘴来代替敲键盘,让 Agent 改个文档、写个代码就是顺嘴的事儿。
当然,Siri都出来多少年了,跟 ChatGPT 开语音聊天也不是啥稀奇体验。
但这波有点不一样的是,Agent 帮人干活,原来那套你一句、我一句的回合制对话,就显得有点不够用了。
所以最近几个月,大模型厂商很默契地又折腾起了怎么让 AI 对话变得更实时。
OpenAI、Google接连推出实时语音交互模型 GPT-Live 和 Gemini 3.8 Live,在 GPT-Live 的演示视频里,AI 被打断了还能接着聊,聊着聊着还能顺手把活儿干了。
差评君这两天跑了趟云栖大会,发现包括阿里,也在卷这个方向。
这次大会,阿里带来了一波模型更新,基模这边,新一代架构的 Qwen4 已经在训练中,后面的 Qwen4.5、Qwen5 也排上了日程,参数规模计划扩展到 5-10T。其他像视频、图像、语音、世界模型,也基本轮番更了一遍。
具体到语音这条线,这次发布的语音大模型系列Qwen-Audio-3.1,就一口气升级了语音转写、语音合成和实时语音交互三类模型,其中的 Qwen-Audio-3.1-Realtime,可以边听、边想、边说。
AI 明明早就会说话了,为什么大家现在又要抢着做 Realtime?
想搞明白这个问题,咱们可能得先看看现在的这些实时语音交互模型,到底都在卷些什么。
大伙儿可以回忆一下,以前跟 AI 语音聊天是什么感觉。
话最好是一口气说完,但凡中间多停顿了几秒,话茬就让 AI 接过去了,完了你还不好打断它,没说完的话只能等下一轮。
没办法,以前的轮次式语音模型判断你的话有没有说完,一个很重要的参考是看你安静了没。
在 GPT-Live 的技术文档里有提到,以前的轮次式架构会单独放一个小模型充当轮次检测器,但这个判断的尺度不好拿捏。
判断早了,AI 老抢话,判断晚了嘛,又怕空气突然地安静。
问题是,谁说话还没个卡壳、改口的时候?或者说到一半突然想起来另外一件事,打断、插嘴也是常有的事。
所以这一轮实时语音交互,有一个非常直观的变化,就是 AI 不需要非得等你把话全都说完,才知道下一步该干嘛。
以 Qwen-Audio-3.1-Realtime 为例,这个语音模型的特点是可以边听、边想、边说。
注意,是同时。
你还在说话,它一边听一边理解,它说话的时候,也能分出注意力听你讲,什么时候该开口、什么时候该保持沉默,也可以自己判断。
就算你中途改口或者突然插嘴,都不需要非得把这一轮走完,再开启下一轮。
这种可以同时处理输入和输出,而不是严格按照你说完、我再说的顺序来交流的能力,就是所谓的全双工。
所以,Realtime 模型现在卷的是怎么让听、理解、判断和回应,变成一个持续、流畅的过程。
当然,知道怎么接话是一回事,能不能把话听明白又是另外一回事。
毕竟人在说话的时候,传递出去的信息从来不只有字面意思。
同样一句“卧槽”,能表达的意思可太多了。
刚买的 iPhone Duo 摔地上的“卧槽”,跟刮刮乐中了 5000 块的“卧槽”,显然不是同一种情绪。
语速快慢、语气轻重、情绪变化,包括一句话中间的犹豫和停顿,本身也都是信息。
OpenAI 在介绍 GPT-Live 的时候,就专门提到过传统级联语音模型的一个问题。
过去那种先把语音转成文字,再交给大模型理解,最后再通过 TTS 转回声音的级联方案,不只是链路长,声音转手几道,像语气、节奏这些原本藏在语音里的信息,就有可能在这个过程中丢失。
这么干巴巴地硬聊不是不行,但谁还没幻想过自己也能有个贾维斯呢?
所以厂商们开始尝试,把这些原本容易在“语音转文字”这一步被压缩的信息,留给模型去理解。
像 Qwen-Audio-3.1-Realtime,就会结合语音里的情绪和意图来理解用户。
你不一定非得把“我现在很急”说出口,你着不着急,听声音就知道了。而且轮到 AI 开口,它也会根据具体情况调整语气、节奏和表达。
在这个基础上,能玩的花样就多起来了。
就比如角色扮演。
你让 Qwen-Audio-3.1-Realtime 扮演贾宝玉,那它能一直用这个角色的声音、说话方式陪你玩 Cosplay。
聊着聊着,你突然蹦两句英语出来,它也照样能用一口流利的英语接着往下唠。
其实聊到这儿,大伙儿会发现,实时语音交互已经越来越像那么回事了。
但别忘了,现在很多人用语音跟 Agent 聊,是奔着让它干活去的。
既然是干活,就免不了来回扯皮、随时改需求,要是 Agent 每次一开工,就原地消失几十秒,期间完全不能交互,那体验不就又开倒车了嘛。。
所以这一波 Realtime 模型,还有一个很明显的变化,就是可以边聊边干活。
Google 的 Gemini 3.8 Live 支持异步调用工具,Extended Thinking 版本还能一边在后台推理、调工具,一边告诉你活儿干到哪了。
Qwen-Audio-3.1-Realtime 同样可以在实时对话里调用工具。
比如让它上携程看明天去北京的机票,搜到一半,你中途补一句“别看太早的,十点以后吧”,也不用等这一轮任务结束,再重新交代一遍。
但又要聊天、又要调用工具,模型要处理的事情变多了,速度还不能慢。
所以 Qwen-Audio-3.1-Realtime 这次用了一个多教师蒸馏架构,在保持低延迟的同时,进一步提升了理解、推理、表达和安全能力。
反正看下来,实时语音交互模型已经不是单纯比谁的嘴皮子更利索,谁的反应更快了,能不能自然流畅地沟通,顺手再把活儿给干了,才是真正能拉开差距的地方。
而这些能力之所以变得抢手,是因为 Agent 在生产力场景落地之后,咱们跟 AI 打交道的整个逻辑都变了。
以前用 AI,最后交付给你的基本都是一段答案,在输入方式上,打字也好,说话也好,区别没那么大。
但现在干活的是 Agent,人要做的事情,其实就是把需求说明白。
而且相比于反复敲键盘、来回修改 Prompt,语音输入明显更省事,唯一需要考虑的情况,可能就是 i 人在公共场合不好意思开口。
所以这也是为啥,模型厂商都抢着实时语音交互这个入口。
不过要担起这活儿,对模型的要求可不低。
从外部榜单来看,千问在实时语音交互上拿过不错的成绩。
今年 5 月,Qwen-Audio-3.0-Realtime 的 Preview 版本,曾在 Artificial Analysis 的语音推理能力和对话流畅度两项评测中,拿过第一。
7 月发布的 Qwen-Audio-3.0-Realtime,又围绕推理、Agent 工具调用、共情对话和双工交互流畅度这些能力做了升级。
而随着模型能力的不断成熟,实时语音交互也有了更多落地的地方。
软件这块,已经接入了 Qoder 和千问办公。
在 Qoder 里,你可以跟 Agent 口头对需求,让它跑任务。
硬件也没落下,千问办公刚发布的 Agent 硬件 QwenNote A2,可以随时把会议、采访这些信息转成文字,有后续的任务安排,说句话就能吩咐千问办公干活。
包括 Qoder 也被塞到了眼镜里,戴着眼镜看到的东西,可以直接成为 Agent 的上下文,要是不在电脑跟前,一副眼镜就能问进度、改需求,给电脑上的 Qoder 派活也不在话下。
从公开信息来看,这些能力之后还会往耳机、麦克风这些随身硬件里塞。
从电脑软件里的一个语音按钮,到眼镜、耳机、麦克风这些随身设备,咱们跟 Agent 打交道的方式,正在变成一种随时随地的即时沟通。
而且这次云栖大会逛下来,差评君明显观察到接了 Qwen 的 AI 硬件,有不少。
什么 AI 陪伴玩偶、AI 学习机,各种形态的 AI 智能硬件,有些可能连屏幕都没有,语音就是最直接、最主要的交互方式。
所以可以预料到的,像 Qwen-Audio-3.1-Realtime 这种自然流畅、低延迟、边聊边干活的实时语音交互能力,在未来很可能会成为 AI 硬件的一项基础能力。
归根结底,Realtime 真正改变的,不只是语音模型的能力,还有人与 Agent 的协作方式。
或许再过一两年,我们不会再特意提起“实时语音交互”这个词,就像拿起手机滑动屏幕一样自然,随口跟身边的 Agent 交流,也成了再普通不过的日常。
撰文:西西
编辑:江江
美编:素描
图片、资料来源:
Artificial Analysis、千问办公、Qoder
部分图源网络