一只鹈鹕成了Agent时代的大明星

最近AI Agent赛道的热度持续升温,不少创业公司公开的营收数据让外界咋舌:头部Agent创业企业Genspark上线仅9天就冲到了1000万美元ARR,远超AI Coding明星产品Cursor用21个月才达到同规模的速度。但在这股商业化狂奔的浪潮下,底层大模型在Agent场景下的能力短板正逐渐暴露,一只原本只出现在测试用例里的鹈鹕,成了戳破行业泡沫的标志性符号。

一只鹈鹕成了Agent时代的大明星

鹈鹕缘何闯入Agent评测赛道?

这只鹈鹕的走红,源自AI领域权威基准测试Astra的特定测试用例。Astra测试原本用于评估大模型在复杂Agent任务下的推理稳定性,其中一道测试题要求模型在完成“查询鹈鹕的栖息地、食性等基础信息”的Agent任务时,准确识别输入图像中的鹈鹕物种。在2025年之前,这道题对主流大模型来说几乎没有难度,绝大多数模型都能准确识别并完成后续任务。但今年上半年开始,陆续有开发者在社交平台晒出测试结果:多家主流大模型在运行Agent任务链时,居然把清晰的鹈鹕图像识别成了鸬鹚、甚至完全无关的家禽,任务完成率直接从90%以上跌到了不足30%。这个反常的现象迅速引发了