Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式
真正值得关注的不是cnBeta这一条动作本身,而是它可能把「科技公司」的竞争焦点推向更大范围的连锁反应。
原文链接:https://www.cnbeta.com.tw/articles/tech/1578144.htm
主题 硬件 Apple Google iPhone 科学探索 人物 手机 游戏 视点·观察 阿里云 微软 通信技术 Android 软件和应用 SONY 索尼 the United States美国 Apple iPad Windows Phone Intel英特尔 腾讯 HTC 安全 Mozilla FireFox 小米科技 百度 通信运营商 媒体播放器 / 视频网站 BlackBerry 黑莓 网络应用 / Web Apps Google Chrome Microsoft XBOX 硬件 - 上网本 / 平板电脑 / 超极本 电子商务 - B2C / B2B Lenovo 联想 LG Yahoo! 雅虎 AMD SNS 社交网络 诺基亚 Windows 7 Huawei 华为 中国移动 中国联通 中国电信 更多...
Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。
这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变了语音AI在复杂专业场景下的应用范式。
在此前的主流语音交互架构中,AI系统通常需要在“快速响应的浅层对话”与“耗时较长的深度思考”之间做出妥协,面对高难度问题往往需要用户忍受长时间的静默等待。Google此次推出的Gemini 3.8 Live着重优化了极速对话与日常流式交互体验,能够以更敏锐的语调起伏、自然打断与上下文理解能力,为用户提供极其流畅且具备人类级质感的实时语音交流。而在其基础上推出的Gemini 3.8 Live Extended Thinking,则针对高复杂度业务流进行了根本性升级。该模型赋予了AI“边说边想”(Think as it speaks)的后台扩展推理能力,使系统在维持实时连贯对话的同时,于后台并发执行复杂的多步骤逻辑拆解、代码排错或技术诊断,无需在遇到困难问题时生硬中断对话节奏。
在实际应用落地方面,新一代Live系列模型将大幅拓宽语音助手的服务边界。除了日常的自然交谈外,Gemini 3.8 Live及扩展推理版本在实时步骤排错、复杂数理推导、实时外语同声辅导以及多任务流式指令执行等高智力需求场景中展现出了显著优于以往版本的表现,在多项多模态与语音推理行业基准评测中位居榜首。
对于开发者与企业级用户,Google宣布相关模型能力即日起通过Gemini API及Google AI Studio正式开放接入。开发者可直接调用这一极低延迟的原生音频API接口,在智能硬件、客户服务、实时编程辅助及协同办公等产品形态中快速构建具备高阶推理能力的下一代全双工语音代理服务。
5 首都禁飞区将于9月20日启用 北京全市禁飞无人机且不得持有、存放、运输、携带