当前标签:AI评测

AI 成绩单背后,藏着一位华人“出题人”

AI基准测试MMLU-Pro等背后出题人是加拿大滑铁卢大学华人助理教授陈文虎,他创办了“老虎实验室”,为模型能力设下考题。

超越 Claude Fable 5:智谱 GLM 5.2 登顶 Design Arena 网页设计 AI 榜单

超越 Claude Fable 5:智谱 GLM 5.2 登顶 Design Arena 网页设计 AI 榜单

权威第三方评测平台Design Arena最新榜单显示,智谱AI开源的GLM-5.2模型以Elo 1360分的成绩登顶第一,正式超越此前高居榜首、目前已下线的Claude Fable 5,标志着国产开源模型首次在网页设计类编程任务中占据全球制高点。

俩小时就烧掉400块Token后,我终于看懂Claude Fable 5有多猛

俩小时就烧掉400块Token后,我终于看懂Claude Fable 5有多猛

俩小时烧掉400块人民币的Token后,Claude Fable 5用全自主打通《宝可梦》、9小时跨洲规划、以及暴打《Science》级科研成果,证明了它不仅是史上最强公开版Claude,更是一个让你花钱买“整座设计院”的昂贵但恐怖的生产力机器。

难上热搜的高考数学,我拿ChatGPT和豆包PK了一把!

难上热搜的高考数学,我拿ChatGPT和豆包PK了一把!

今年高考数学难上热搜,多家AI大模型实测成绩出炉:豆包与腾讯元宝并列第一,OpenAI o3仅获34分惨败,国产模型在数学推理上取得显著进步。

Opus 4.8烧1万美元,冲顶AI最难考试,断崖领先GPT-5.5近4倍

Opus 4.8烧1万美元,冲顶AI最难考试,断崖领先GPT-5.5近4倍

Claude Opus 4.8以1.5%的RHAE得分碾压第二名3倍,但单次评测成本高达1万美元,同时带来更精准、更诚实的代码能力。

实测 Claude Opus 4.8:活干得更漂亮了,话说得更难听了

实测 Claude Opus 4.8:活干得更漂亮了,话说得更难听了

实测显示Claude Opus 4.8在代码生成和Agent任务上表现显著提升,但模型在安全批评和对话风格上变得更加直接犀利。

别再无脑装豆包了,实测五款国产 AI App,最强的竟是...

别再无脑装豆包了,实测五款国产 AI App,最强的竟是...

国产AI实测排名大洗牌:DeepSeek综合最强,豆包修图无敌,千问生态独霸

超越GPT-Realtime-2,阿里语音大模型获三项第一

超越GPT-Realtime-2,阿里语音大模型获三项第一

阿里巴巴语音大模型Fun-Realtime-ASR和Fun-Realtime-AudioChat在Artificial Analysis评测中超越GPT-Realtime-2,在词错误率、语音推理和对话流畅度三项指标上均获第一。

MaxVideoAI

MaxVideoAI

MaxVideoAI 是一个提供 AI 视频模型对比的平台,帮助用户在视频渲染前评估不同模型性能,匹配最佳引擎,提高视频生成效率。

AI Ping

AI Ping

AI Ping是一个专注于大模型服务评测与API调用的一站式平台,致力于帮助用户快速评估和选择最适合的大模型服务。

预测这件事,人类越犹豫,这个大模型越有优势

预测这件事,人类越犹豫,这个大模型越有优势

预测这件事,人类越犹豫,这个大模型越有优势