如意小报
版块首页原文 ↗
科技 · 新闻详情

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。

科技公司 · 搜狐 · 搜狐科技 · 2026-09-24 · 重磅值 84.74
真正值得关注的不是搜狐这一条动作本身,而是它可能把「科技公司」的竞争焦点推向更大范围的连锁反应。
发生了什么:这么说吧,用语音和 AI 随地大小聊,在打工人的圈子里已经成了一种时髦。
为什么重要:它提示了一个值得继续跟踪的变化方向。
观察窗口:接下来观察它是否会引发更多同类动作,以及影响范围能否扩大。
正文来源:原文正文机器翻译
原文链接:https://www.sohu.com/a/1080146378_355019

这么说吧,用语音和 AI 随地大小聊,在打工人的圈子里已经成了一种时髦。

越来越多的人开始尝试用动嘴来代替敲键盘,让 Agent 改个文档、写个代码就是顺嘴的事儿。

当然,Siri都出来多少年了,跟 ChatGPT 开语音聊天也不是啥稀奇体验。

但这波有点不一样的是,Agent 帮人干活,原来那套你一句、我一句的回合制对话,就显得有点不够用了。

所以最近几个月,大模型厂商很默契地又折腾起了怎么让 AI 对话变得更实时。

OpenAI、Google接连推出实时语音交互模型 GPT-Live 和 Gemini 3.8 Live,在 GPT-Live 的演示视频里,AI 被打断了还能接着聊,聊着聊着还能顺手把活儿干了。

这次大会,阿里带来了一波模型更新,基模这边,新一代架构的 Qwen4 已经在训练中,后面的 Qwen4.5、Qwen5 也排上了日程,参数规模计划扩展到 5-10T。 其他像视频、图像、语音、世界模型,也基本轮番更了一遍。

具体到语音这条线,这次发布的语音大模型系列Qwen-Audio-3.1,就一口气升级了语音转写、语音合成和实时语音交互三类模型, 其中的 Qwen-Audio-3.1-Realtime,可以边听、边想、边说。

想搞明白这个问题,咱们可能得先看看现在的这些实时语音交互模型,到底都在卷些什么。

话最好是一口气说完,但凡中间多停顿了几秒,话茬就让 AI 接过去了,完了你还不好打断它,没说完的话只能等下一轮。

没办法,以前的轮次式语音模型判断你的话有没有说完,一个很重要的参考是看你安静了没。

在 GPT-Live 的技术文档里有提到,以前的轮次式架构会单独放一个小模型充当轮次检测器,但这个判断的尺度不好拿捏。

问题是,谁说话还没个卡壳、改口的时候?或者说到一半突然想起来另外一件事,打断、插嘴也是常有的事。

所以这一轮实时语音交互,有一个非常直观的变化,就是 AI 不需要非得等你把话全都说完,才知道下一步该干嘛。

以 Qwen-Audio-3.1-Realtime 为例,这个语音模型的特点是可以边听、边想、边说。

你还在说话,它一边听一边理解,它说话的时候,也能分出注意力听你讲,什么时候该开口、什么时候该保持沉默,也可以自己判断。

这种可以同时处理输入和输出,而不是严格按照你说完、我再说的顺序来交流的能力,就是所谓的全双工。

所以,Realtime 模型现在卷的是怎么让听、理解、判断和回应,变成一个持续、流畅的过程。

刚买的 iPhone Duo 摔地上的“卧槽”,跟刮刮乐中了 5000 块的“卧槽”,显然不是同一种情绪。

语速快慢、语气轻重、情绪变化,包括一句话中间的犹豫和停顿,本身也都是信息。

OpenAI 在介绍 GPT-Live 的时候,就专门提到过传统级联语音模型的一个问题。

过去那种先把语音转成文字,再交给大模型理解,最后再通过 TTS 转回声音的级联方案,不只是链路长,声音转手几道,像语气、节奏这些原本藏在语音里的信息,就有可能在这个过程中丢失。

所以厂商们开始尝试,把这些原本容易在“语音转文字”这一步被压缩的信息,留给模型去理解。

像 Qwen-Audio-3.1-Realtime,就会结合语音里的情绪和意图来理解用户。

你不一定非得把“我现在很急”说出口,你着不着急,听声音就知道了。而且轮到 AI 开口,它也会根据具体情况调整语气、节奏和表达。

你让 Qwen-Audio-3.1-Realtime 扮演贾宝玉,那它能一直用这个角色的声音、说话方式陪你玩 Cosplay。

聊着聊着,你突然蹦两句英语出来,它也照样能用一口流利的英语接着往下唠。

既然是干活,就免不了来回扯皮、随时改需求,要是 Agent 每次一开工,就原地消失几十秒,期间完全不能交互,那体验不就又开倒车了嘛。。

所以这一波 Realtime 模型,还有一个很明显的变化,就是可以 边聊边干活。

Google 的 Gemini 3.8 Live 支持异步调用工具,Extended Thinking 版本还能一边在后台推理、调工具,一边告诉你活儿干到哪了。

Qwen-Audio-3.1-Realtime 同样可以在实时对话里调用工具。

比如让它上携程看明天去北京的机票,搜到一半,你中途补一句“别看太早的,十点以后吧”,也不用等这一轮任务结束,再重新交代一遍。

所以 Qwen-Audio-3.1-Realtime 这次用了一个多教师蒸馏架构,在保持低延迟的同时,进一步提升了理解、推理、表达和安全能力。

反正看下来,实时语音交互模型已经不是单纯比谁的嘴皮子更利索,谁的反应更快了, 能不能自然流畅地沟通,顺手再把活儿给干了,才是真正能拉开差距的地方。

而这些能力之所以变得抢手,是因为 Agent 在生产力场景落地之后,咱们跟 AI 打交道的整个逻辑都变了。

以前用 AI,最后交付给你的基本都是一段答案,在输入方式上,打字也好,说话也好,区别没那么大。

而且相比于反复敲键盘、来回修改 Prompt,语音输入明显更省事,唯一需要考虑的情况,可能就是 i 人在公共场合不好意思开口。

今年 5 月,Qwen-Audio-3.0-Realtime 的 Preview 版本,曾在 Artificial Analysis 的语音推理能力和对话流畅度两项评测中,拿过第一。

7 月发布的 Qwen-Audio-3.0-Realtime,又围绕推理、Agent 工具调用、共情对话和双工交互流畅度这些能力做了升级。

硬件也没落下,千问办公刚发布的 Agent 硬件 QwenNote A2,可以随时把会议、采访这些信息转成文字,有后续的任务安排,说句话就能吩咐千问办公干活。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…