​Google 官宣 Gemini 3.8 Live,首创“边说边想”颠覆行业交互

Google今日正式公布其在原生端到端语音交互领域的最新成果,推出全新一代实时语音大模型Gemini 3.8 Live及面向高难度任务的Gemini 3.8 Live Extended Thinking两款产品。此次更新标志着Google原生音频对音频(Audio-to-Audio)技术体系实现重大跨越,不仅将实时对话的延迟与自然度推向全新高度,更首次在低延迟语音流中落地深层多步推理能力,彻底改变了语音AI在复杂专业场景下的应用范式。

​Google 官宣 Gemini 3.8 Live,首创“边说边想”颠覆行业交互

Gemini 3.8 Live主打极速自然实时对话

作为基础版本的Gemini 3.8 Live聚焦日常流式交互场景的体验优化,针对传统语音交互响应迟滞、语气机械、打断后衔接生硬等痛点做了全面升级。模型能够以极低的延迟响应用户语音输入,同时精准捕捉语调起伏、语速变化等语音特征,支持用户随时打断对话,且能基于上下文理解完成自然衔接,输出具备人类级质感的实时语音交流,完全满足日常闲聊、实时翻译、客户服务等高频轻量场景的需求。

Extended Thinking版首创边说边想扩展推理

针对高复杂度任务的处理需求,Google同步推出了Gemini 3.8 Live Extended Thinking版本,首次实现“边说边想”的扩展推理能力,打破了此前语音AI“快速响应仅能处理浅层问题、深度思考需要长时间静默等待”的固有妥协。该版本可在保持低延迟语音输出的同时,同步完成多步逻辑推理、复杂信息检索、专业问题分析等深度任务,用户无需等待AI的长时间停顿,即可获得逻辑严谨、内容详实的回答,彻底补齐了语音AI在专业场景下的能力短板。

原生音频架构打破传统交互瓶颈

此次技术突破的核心来自于Google对原生音频智能架构的升级。传统语音交互普遍采用“音频转文本-文本处理-文本转音频”的多步刚性管线,该流程会直接剥离人类对话中的语调、节奏、情感与文化细微差别,导致交互质感生硬。而Gemini 3.8 Live系列采用端到端原生音频处理模式,可直接理解音频本身的语义与情感特征,完整保留真实交流的质感。此外,该技术体系也已融入Google全球多语言AI战略,目前可支持超过300种语言,覆盖全球71亿人口、86%的人口比例,让不同语言、不同文化背景的用户都能获得自然的语音交互体验。

多场景应用落地边界被彻底重构

凭借“边说边想”的能力与极致的自然度,Gemini 3.8 Live系列将语音AI的落地场景从轻量交互拓展至复杂专业领域:

  • 教育场景:实时为学生解答复杂的数理推导问题,边讲解边梳理逻辑,匹配学生的学习节奏;
  • 专业咨询场景:在法律、金融等领域,同步完成信息核查与逻辑分析,无需用户等待冗长的处理过程;
  • 日常交互场景:作为智能语音助手,可自然承接多轮复杂对话,支持打断、情绪感知等拟人化交互。