Gemini3.8Live升级语音智能:对话、推理与任务执行进一步融合

谷歌发布Gemini 3.8 Live双版本实时对话模型

当地时间9月15日,谷歌官方正式推出Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking两款实时对话模型,由Gemini Audio团队首席工程师Tom Ouyang、技术员工Malini Jaganathan共同对外介绍。谷歌将两款模型定位为迄今最先进的实时对话产品,其中Gemini 3.8 Live主打规模化部署与成本效率,融合对话智能、自然流畅的语音交互、视觉定位能力;Extended Thinking版本则针对高复杂度场景设计,具备更强的智能水平与多步骤推理能力。谷歌表示,两款模型为开发者和企业构建可落地的语音代理提供了基础支撑,同时将大幅提升Gemini应用、Google Workspace、Search Live等产品中的对话流畅度。

Gemini3.8Live升级语音智能:对话、推理与任务执行进一步融合

实时交互与推理能力实现多维度突破

基础版Gemini 3.8 Live支持近实时视觉输入处理,对话过程中可自动检测并在97种支持的语言之间自由切换,同时可在后台静默执行工具与API调用,全程不中断对话流,支持对用户请求进行确认,任务完成后可无缝衔接后续对话。
针对需要深层推理的高复杂度任务,Extended Thinking版本支持边思考边语音输出的模式,可通过早期语言提示自然确认用户需求,还能通过实时进度叙述引导用户逐步完成多步骤后台任务,完全不打断对话节奏。在ComplexFuncBench Audio基准测试中,Extended Thinking版本的任务准确率达到90.8%。
随公告发布的演示视频展示了两款模型的实际落地能力:Gemini 3.8 Live可基于实时视觉上下文回答现场提问、完成新员工入职引导、近实时对弈、生成完整商业计划与定制营销