当前标签:低延迟
OpenAI 引入两种转录模型:低延迟、更好理解上下文
OpenAI 发布新一代语音模型,包括 GPT-Realtime-2 增强推理、GPT-Realtime-Translate 实时翻译和多语言支持、GPT-Realtime-Whisper 低延迟流式转录,显著提升语音交互的上下文理解和响应速度。
砍掉独立编码器:Gemma 4 12B推翻多模态"拼接设计"
Google Gemma 4 12B 通过彻底砍掉独立的视觉和音频编码器,采用统一的 Encoder-Free 架构,让多模态模型直接在消费级笔记本上运行,延迟与内存占用大幅降低。
CosyVoice2.0
一个低延迟、高质量的语音合成平台,提供流畅自然的语音生成服务。
Groq AI
Groq AI 是一个专注于 AI 推理的集成平台,利用 LPU 技术提供超高速的模型推理服务。
谷歌掀语音Agent新纪元,开口就是生产力,Siri的最强来了?
谷歌通过发布低延迟、高精度的实时音频模型Gemini 3.1 Flash Live,正式开启了语音Agent时代,旨在将单纯的语音交互转化为高效的生产力工具。