谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型,支持 97 种语言切换
当地时间9月15日,谷歌正式推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时对话模型,重点升级语音交互、实时推理及复杂任务执行能力,两款模型目前已向开发者及普通用户开放访问。
谷歌Gemini 3.8 Live上线,近实时视觉交互与多语言自动切换落地
普通版Gemini 3.8 Live主打低成本实时交互场景,支持近实时视觉输入处理,可在对话过程中自动检测并切换97种支持的语言,无需用户手动调整语言设置;同时支持后台异步执行工具与API调用,用户无需等待任务完成即可继续对话,模型会在后台任务结束后同步反馈结果。目前该模型已同步在Search Live平台上线,面向普通用户开放使用。
扩展思考版发布,边推理边对话适配复杂任务需求
Gemini 3.8 Live Extended Thinking专门针对多步骤复杂任务场景优化,支持边进行逻辑推理边完成语音交流,无需中断对话即可后台调用工具处理任务,可满足专业场景下的复杂需求。该版本已面向Gemini Live用户推出。
开发者端全面开放调用,语音交互成本低于市场平均水平
两款模型均已通过Gemini API和Google AI Studio向开发者及企业开放调用权限,音频输入定价为每分钟0.005美元,输出定价为每分钟0.018美元,具备较高的性价比。谷歌表示,两款模型为开发者提供了构建生产级可靠语音Agent的基础组件,可应用于语音助手、企业客服、实时培训、员工入职引导等多种场景,比如可通过视觉上下文实时回答新员工入职过程中的问题;在Gemini应用、Google Workspace及搜索服务中也能实现更流畅的语音交互体验,帮助用户仅通过语音即可完成复杂任务。
测评数据登顶语音交互榜,综合表现优于主流竞品
根据第三方机构Artificial Analysis发布的Speech-to-Speech Quality Index测评数据,Gemini 3.8 Live Extended Thinking以82.6分的成绩位列榜首,超过GPT-Live-1 + Astra的81.5分和Grok Voice Think Fast 2.0的81.3分;在语音Agent专项任务τ-Voice测评中,该模型也拿到了68.6%的得分,综合交互能力优于当前主流竞品。