如何让大语言模型思考得更准确
适度思考的力量:推理长度与准确性
让大模型“想”得更久,并不总是更准确。研究团队通过“预算强制”实验发现,对于事实推理任务,推理令牌预算从256增加到2048时,准确率稳步提升,但超过2048令牌后便趋于平稳。这意味着,中等长度的思考(约2K令牌)是最优选择——思考太少会遗漏关键信息,思考太多则可能引入噪音,导致“过度思考”。例如,在比较0.9和0.11这样简单的问题上,某些模型竟写出600多字的推理过程,反复验证同一结论,既浪费计算资源又拖慢响应速度。适度思考,才是提升准确性的关键。

知识图谱:给模型装上“事实核查”引擎
即使最先进的大语言模型,也容易在事实性问题上“编造”答案。引入知识图谱增强(fs1)后,模型通过将可验证的事实注入推理过程,答案准确率显著提升。这就像给模型配备了一个实时查证的知识库,让它在回答“西班牙裔艺术家的族裔”这类问题时,不再依赖模糊记忆,而是基于结构化事实进行推理。研究显示,这种外部知识源对较小模型的帮助尤为明显,而大型模型同样能从中获益,尤其是在开放域问答任务中。
让模型学会“偷懒”:高效推理技术
推理效率与准确性并非不可兼得。在强化学习中加入长度奖励,鼓励模型在保证答案正确的前提下使用更少的token;利用可变长度的思维链数据进行监督微调,让模型学会灵活应对不同复杂度的任务。此外,推测拒绝优化和CoD方法(每个思考步骤仅用最多五个单词),能快速排除低质量推理路径,只保留关键步骤。这种“按需思考”策略,让模型在自动驾驶、实时交互等场景中既快又准。
分步拆解与外部验证:从链式思考到形式化验证
复杂问题需要分步解决。通过“由少至多”提示策略,模型将问题拆解为子问题,逐步构建答案——例如计算Amy在水滑梯关闭前能滑几次,先算出每次滑行需5分钟,再算出15分钟内可滑3次。更进一步,微软亚洲研究院提出的LIPS框架,将大模型的数学直觉与符号方法结合,通过形式化验证将自然语言问题转化为公理,从而确保推理的可靠性。这种“先拆解、再验证”的流程,大幅提升了模型在数学和逻辑推理任务上的准确性。