GPT-6 Astra的新架构:Latent Reasoning?

OpenAI于本周正式发布新一代旗舰大模型GPT-6 Astra,作为其迄今智能化程度最高的产品,该模型最大的技术亮点便是首次落地的Latent Reasoning(潜空间推理)架构,彻底重构了Transformer模型的底层计算逻辑。

GPT-6 Astra首搭Latent Reasoning架构 重构Transformer计算逻辑

不同于传统Transformer每生成一个token就执行固定量计算的模式,GPT-6 Astra采用混合专家(MoE)架构,将模型中间一半的Transformer层复用两次,形成类似此前Nanbeige模型的“潜空间推理三明治”结构:下一个待生成token的计算过程,可以直接获取前一个token在底层栈的最终表征,进一步强化了中间推理信息的利用率。
针对1B基座模型的测试显示,这种潜空间反馈机制可以在MATH500数学推理数据集上将模型的推理轨迹缩短近三成,同时保持甚至提升解题准确率,不过该缩短效应会在指令微调后消失。同时,该架构还支持可变深度推理:面对简单问题时模型仅需执行少量潜空间计算即可输出结果,面对复杂难题则会进行更多轮次的潜空间运算再给出回答,相当于给模型赋予了“按需思考”的能力。不过这种设计也带来了算力需求的跃升,GPT-6每轮推理的潜空间计算量是GPT-4的10到100倍,对硬件供给提出了更高要求。

潜空间推理加持 Astra任务执行效率提升近半

潜空间推理的落地直接带来了实际任务效率的大幅提升。在OSWorld