那个教 ChatGPT 说话的人,做了一个「哑巴」模型
AI圈子里最懂教大模型「说话」的人,如今亲手掐掉了自己造出的模型的语音能力。

教ChatGPT说话的人,把模型的嘴「缝」了
这位前OpenAI核心研究员、ChatGPT的共同发明人Diogo Almeida,在OpenAI深耕大模型对话能力两年后悄然离职,创立AI公司TypeSafe AI,带着4000万美元融资重回公众视野。此次公司发布的首款产品Jev,完全打破了大众对大模型「能说会道」的固有印象:它既写不了打工人的周报,也陪不了用户深夜长聊,甚至连一个标点符号都不会输出。正如TypeSafe喊出的口号所说:「嘴闭上了,腿腳快得飛起!」TypeSafe放出的对比测试显示,3秒时间内Jev已经完成了整轮决策输出,而传统大模型才刚刚开始生成首个Token,响应速度差距肉眼可见。公开的游戏测试视频中,Jev甚至在《毁灭战士》(Doom)测试里仅用3秒就完成了人类玩家需要数秒才能处理的决策流程,性能优势十分突出。
毫秒级响应的「系统一模型」凭什么跑赢大模型几十倍?
Jev的定位是业内首个纯粹的「系统一模型」,对应卡尼曼《思考,快与慢》中人类无意识、极速的本能直觉决策系统,完全跳出了当前主流大模型依赖的自回归逐字生成逻辑。传统大模型需要一步步推演下一个Token的内容,不仅速度慢,还容易出现格式幻觉、输出不符合要求的内容;而Jev的所有决策都在一次单向平行计算中同时完成,输出严格锁定在开发者预先定义的Schema框架内,从根源上消灭了结构幻觉。TypeSafe给出的测试数据显示,Jev的端到端延迟被压缩在70到500毫秒之间,比当前市面上的前沿大模型快了40到200倍,成本仅为主流模型的极小部分。在四个典型的企业工作流测试中,Jev的决策精准率达到67.8%,几乎打平了GPT-5.6 Terra的67.9%,即便只看判断准确率也丝毫不输贵出数十倍的大模型。TypeSafe为Jev规划的定位是AI Agent的「反射神经」,专门处理工单分类、内容合规初筛、大批次数据打标、多API精准调用选择这类高频且简单的决策任务,把大模型从繁琐的基层决策中解放出来,专注于宏观规划和高难度思考,从架构层面消除AI Agent落地的执行摩擦。
性能亮眼却难掩黑盒与合规隐忧
不过Jev并非完美的行业银弹,其技术特性带来的缺陷也十分突出。首先是可解释性的全面丧失,由于所有决策都在黑盒中一次性完成,开发者和使用者完全无法追溯决策的依据和逻辑链路,一旦出现错误决策,很难定位问题根源。其次是当前所有性能数据均来自TypeSafe单方面的自有测试,尚未有第三方独立机构的评估背书,其实际落地效果存疑。尤其在金融风