OpenAI 引入两种转录模型:低延迟、更好理解上下文

推理能力跃升:GPT-Realtime-2 带来堪比 GPT-5 的智能

GPT-Realtime-2 是本次发布的核心,专为即时语音互动设计。它最大的突破在于将 Token 上下文窗口从 32,000 扩展至 128,000,能够承载更长、更复杂的对话。模型可以并行调用多个工具,并在处理过程中通过“让我查一下”等短语告知用户,避免静默等待。即便遇到问题,模型也会主动反馈,而非直接中断。开发者可设置五种推理强度,默认“低”以保持简单请求的低延迟,复杂任务则调用更多计算资源。在 Big Bench Audio 基准测试中,其准确率从上一代的 81.4% 提升至 96.6%(高设定下),威力可见一斑。

实时翻译打破语种壁垒:GPT-Realtime-Translate 支持 70+ 语言

这款模型主打语音到语音的连续翻译,适用于广播、直播、电话会议等场景。它能够自动识别输入语言,并根据设定输出翻译后的语音和文本。与传统翻译模型要求说话人停顿、等待整句结束后再翻译不同,GPT-Realtime-Translate 更接近同声传译,可以紧跟着说话者的语速实时输出。目前支持 70 多种输入语言和 13 种输出语言,覆盖客户支持、跨境销售、教育和媒体等场景。费用为每分钟 0.034 美元,性价比突出。

低延迟流式转录:GPT-Realtime-Whisper 让语音转写实时化

GPT-Realtime-Whisper 是一款低延迟的流式转录音模型,能够即时将语音内容转为文本。它的核心应用场景包括会议、课堂、广播的实时字幕生成,以及对话进行中的笔记与摘要。企业可利用它在通话中构建具备连续语音理解能力的语音助手。每百万 Token 输入费用仅为每分钟 0.017 美元,相比其他模型更加轻量高效。结合 Realtime API,开发者可以快速集成该能力。

语音 Agent 的完整链路:模型栈统一与竞争格局

OpenAI 此次发的三款模型,本质上是将语音识别、实时翻译、流式转录、推理与工具调用整合到同一个开发者平台。对企业而言,这意味着只需对接一个供应商即可完成整个语音 Agent 链路,大大降低集成、运维和延迟成本。不过,市场上已有强劲对手:ElevenLabs 估值 110 亿美元,Deepgram 已获1.3亿美元融资并服务1300多家客户,Cartesia 则以90毫秒级延迟和42种语言抢占实时语音市场。OpenAI 的优势在于模型原生协同,劣势在于需要与这些专业厂商竞争特定垂直场景。

开发者部署的挑战与优化:WebRTC 遇上 Kubernetes

实时语音交互对延迟极其敏感。OpenAI 在部署中采用了 transceiver 模型:在边缘终止 WebRTC 连接,然后将媒体和事件转换为内部协议,用于模型推理、转录、语音生成等。这种设计避免了传统每会话一个端口的端口耗尽问题,同时保留了 ICE 连通性、DTLS 握手等状态。在 Kubernetes 环境下,transceiver 服务需要处理状态粘性,即创建会话的进程必须持续接收该会话的数据包,否则会导致媒体中断。OpenAI 通过将状态集中在单一服务中,结合高效的应用层解复用,实现了高性能的弹性伸缩。