OpenAI 将打造“贾维斯”式语音助手,未来有望登陆第三方智能眼镜
从“对话”到“陪伴”:OpenAI语音助手的“贾维斯”式进化
OpenAI近期推出的ChatGPT语音模式升级版“GPT-Live”,标志着其语音助手从简单的问答工具向全天候、多模态交互的智能体跨越。在内部演示中,GPT-Live能够实时处理用户的语音指令,并具备上下文记忆、情绪识别和主动建议能力,其交互流畅度与响应速度已接近科幻电影中“贾维斯”的设定——不仅能听懂指令,还能预判需求、串联任务。OpenAI创始成员Andrej Karpathy曾指出,AI的发展方向正是朝着这种通用人工智能(AGI)的形态演进,而语音交互将成为连接物理世界与数字世界的关键桥梁。
走出自家大门:第三方智能眼镜成关键落地场景
与过往布局不同的是,OpenAI明确表示这套语音助手将不局限于自有硬件设备。据内部消息,该技术已与多家第三方智能眼镜及可穿戴设备厂商展开原型测试,目标是在2025年前后实现商业落地。智能眼镜因具备“解放双手、视觉呈现、实时感知”三大优势,被视为承载“贾维斯”式助手的理想载体。用户只需通过眼镜上的麦克风或轻触镜腿,即可唤醒GPT-Live,实现信息查询、导航指引、实时翻译、日程管理甚至多模态识别(如识别眼前物体并给出说明)。这一布局与Meta、Google等厂商的智能眼镜策略形成直接竞争,但OpenAI的差异化在于其底层大模型的通用能力与第三方生态的开放性。
实体化革命:GPT-Live如何让AI“看得见、听得懂”
根据报道,GPT-Live不仅升级了语音合成与自然语言理解能力,还集成了多模态感知模块。在演示中,用户可通过眼镜摄像头拍摄周围环境,GPT-Live能实时识别并描述场景、分析数据(如识别植物、解读菜单、计算卡路里),甚至根据用户表情调整语气——例如在用户紧张时放缓语速、提供鼓励。这种“视觉+听觉+情感”的融合交互,突破了传统语音助手只能处理文字指令的局限,让AI更像一个“随时在线的智能伙伴”。OpenAI计划将该功能集成到未来的智能眼镜SDK中,让第三方开发者也能调用这些能力,比如为教育、医疗、工业巡检等场景定制专属语音代理。
生态野心:从“钉钉版贾维斯”到通用智能体平台
值得注意的是,OpenAI的“贾维斯”式语音助手并非孤例。此前,国内钉钉个人版已基于通义千问技术推出了同名“贾维斯”对话机器人,可扮演助教、程序员、心理顾问等角色,并集成绘画、法律咨询等AI工具。这反映出全球科技巨头对“语音通用智能体”的共识:未来的AI助手将不再是一个独立App,而是嵌入所有硬件与软件的“系统级能力”。OpenAI此次的布局,本质上是在构建一个开放平台:通过GPT-Live的语音交互+多模态感知,让智能眼镜、汽车座舱、家庭机器人等设备都能接入其智能体生态,最终实现“万物皆可贾维斯”的愿景。