Skill Following:模型“搜到了Skill”,不等于最终答案真的从中受益
之前业内普遍将模型在“检索返回Skill”类题目上的更高得分,视为Skill对模型能力的正向赋能信号,但这一判断存在根本性的逻辑漏洞——相关测试的题目分组并非随机生成,而是由模型自主决定是否触发检索、选择哪些题目进入检索组,得分差异本质是模型“挑题”带来的偏差,而非Skill的实际作用。
模型自主选题组颠覆检索效果评估逻辑
现有主流评估框架默认模型会在遇到需要Skill的题目时自动触发检索,将检索组的得分高于非检索组,直接等同于Skill带来了准确率提升,但忽略了核心前提:题目分组是模型自主选择的,而非随机分配的。模型会主动规避它判定为“无法通过检索Skill解决”的难题,仅将自身有一定把握、且检索到的Skill能直接套用的题目纳入检索组,这种自我筛选机制让检索组的基础难度远低于非检索组,高得分是题目难度差异的结果,和Skill是否真的被使用无关。
挑题偏好让Skill命中率严重失真
模型的挑题行为有明确的倾向性,具体表现为:
- 优先选择题干包含明确功能关键词(如“计算”“生成表格”“查询天气”)的题目,这类题目的Skill匹配度高,模型容易检索到对应工具;
- 避开需要多Skill联动、模糊需求匹配、跨领域知识整合的复杂题目,这类题目即使检索到Skill,模型也难以直接套用;
- 仅在自己训练数据中见过类似Skill调用样例的题目场景下触发检索,陌生场景下即使需要Skill也不会主动搜索。
这种筛选机制下,检索组的题目本身就是模型更容易答对的题,就算不检索Skill,得分也会高于非检索组,所谓的“Skill提升得分”完全是伪命题。
检索到Skill≠实际嵌入解题流程
就算模型偶然检索到了匹配当前需求的Skill,也不代表它会把这个Skill用到最终答案里。实际测试中发现,很多模型检索到Skill后,仍然会按照自身原有的错误逻辑生成答案,完全忽略Skill提供的规范流程:比如检索到“小学数学应用题解题步骤”的Skill,模型还是会跳过Skill要求的“先列公式再代入数值”的步骤,直接给出错误结果;检索到“商务邮件撰写规范”的Skill,模型还是按照口语化习惯输出,完全没有采用Skill里的正式语气、固定格式要求。这种情况下,模型只是“搜到了Skill”,并没有真正从中受益,最终答案的质量和没有检索Skill时没有区别。
强制调用测试才能验证Skill真实价值
要真实衡量Skill对模型的提升作用,必须跳出“模型自愿检索”的评估框架,采用强制调用测试:一方面,设置强制检索规则,要求模型在所有题目作答前必须先检索至少一个Skill,排除模型自主挑题的偏差;另一方面,新增“Skill调用率”“Skill内容采纳率”两个核心指标,统计模型检索到的Skill内容有多少真正被用到了最终答案里,而不是只看检索组的得分。只有通过这种方式,才能判断Skill是真的帮模型提升了能力,还是只是被模型“搜了但没用”的摆设。