AI 大模型周榜:Kimi K3 蝉联前端开发榜全球第一、智能体榜表现突出
Kimi K3 霸榜前端开发,国产模型包揽头部梯队
本周前端开发榜呈现出前所未有的格局:月之暗面的 Kimi K3 以 1679 分 ELO 直接拿下第一名,领先第二名 Claude Fable 5 的 1631 分,分差高达 48 分,优势极为明显。国产模型在前端开发场景中已经形成完整梯队,覆盖榜单头部和中上游多个位置:
- 月之暗面 kimi-k3 排名第 1 位,ELO 1679 分,稳居第一。
- 智谱 glm-5.2 (max) 排名第 4 位,ELO 1587 分,保持在前五,甚至超过了多款 Claude、OpenAI 的旗舰模型。
- 字节跳动 seed-2.1-pro-preview 排名第 14 位,ELO 1534 分,首次入驻榜单前半区。
- 智谱 glm-5.1 排名第 15 位,ELO 1526 分,表现稳定。
- 阿里 qwen3.7-max-20260517 排名第 17 位,ELO 1516 分。
- 月之暗面 kimi-k2.6 排名第 18 位,ELO 1515 分。
这意味着国产大模型在前端开发这一细分场景的能力已经走在了全球最前列,Kimi K3 的基座能力在代码生成、长程任务处理及大型代码库理解等方面表现尤为突出。

智能体榜:GLM 5.2 杀入前十,工具能力亮眼
智能体榜本周全部是全新入榜模型,头部格局清晰分层。排名第一的是 Claude Fable 5 (High),净提升度 13.94%,同时拥有 30.65% 的最高好评/差评比,工具幻觉率仅 1.33%。第二名 GPT 5.6 Sol (xHigh) 的可控性数值最高,达到 17.26%。国产模型方面,智谱 GLM 5.2 (Max) 表现突出,直接杀入榜单 Top 10 位列第 9,净提升度为 6.24%,其 Bash 恢复速度仅 4.45,远好于头部平均水平,命令出错后能快速恢复。
国产模型在智能体榜覆盖靠前和中间多个位置,工具相关能力亮眼:
- 智谱 glm-5.2 (max) 排名第 9 位,净提升度 6.24%,任务确认成功率 8.72%。
- 智谱 glm-5.1 排名第 16 位,净提升度 1.19%。
- 阿里 qwen3.7 Plus 排名第 18 位,净提升度 0.61%,工具幻觉率仅 0.19%。
- 月之暗面 kimi-k2.7-code 排名第 20 位,净提升度 0.76%。
- 阿里 qwen3.7 Max 排名第 21 位,净提升度 0.81%。
- 深度求索 deepseek-v4-pro 排名第 22 位,净提升度 1.11%。
代码榜与综合榜:Kimi K3 首次跻身 Top 10,国产多点开花
在代码生成能力榜单中,Kimi K3 同样表现强势,首次进入代码榜 Top 10,凭借 1486 分的 ELO 排名第 9 位,与第 8 名的 Gemini 3 Pro、第 10 名的 GPT 5.6 Sol (xHigh) 分数完全接轨,综合智能水平已接近全球前沿闭源模型。代码榜其他国产模型表现:
- 阿里 qwen3.7-max-preview 排名第 12 位,ELO 1527 分。
- 智谱 glm-5.1 排名第 17 位,ELO 1521 分,较上周上升 1 位。
- 小米 mimo-v2.5-pro 排名第 24 位,ELO 1518 分,较上周下降 1 位。
- 月之暗面 kimi-k2.6 排名第 26 位,ELO 1515 分,较上周下降 1 位。
- 百度 ernie-5.1 排名第 27 位,ELO 1514 分,较上周下降 1 位。
国产模型在多个维度实现突破,从代码生成到智能体工具调用,从前端开发到综合能力,形成了覆盖全梯队、多点开花的竞争格局。