当前标签:AI评测
AI 成绩单背后,藏着一位华人“出题人”
AI基准测试MMLU-Pro等背后出题人是加拿大滑铁卢大学华人助理教授陈文虎,他创办了“老虎实验室”,为模型能力设下考题。
超越 Claude Fable 5:智谱 GLM 5.2 登顶 Design Arena 网页设计 AI 榜单
权威第三方评测平台Design Arena最新榜单显示,智谱AI开源的GLM-5.2模型以Elo 1360分的成绩登顶第一,正式超越此前高居榜首、目前已下线的Claude Fable 5,标志着国产开源模型首次在网页设计类编程任务中占据全球制高点。
俩小时就烧掉400块Token后,我终于看懂Claude Fable 5有多猛
俩小时烧掉400块人民币的Token后,Claude Fable 5用全自主打通《宝可梦》、9小时跨洲规划、以及暴打《Science》级科研成果,证明了它不仅是史上最强公开版Claude,更是一个让你花钱买“整座设计院”的昂贵但恐怖的生产力机器。
难上热搜的高考数学,我拿ChatGPT和豆包PK了一把!
今年高考数学难上热搜,多家AI大模型实测成绩出炉:豆包与腾讯元宝并列第一,OpenAI o3仅获34分惨败,国产模型在数学推理上取得显著进步。
Opus 4.8烧1万美元,冲顶AI最难考试,断崖领先GPT-5.5近4倍
Claude Opus 4.8以1.5%的RHAE得分碾压第二名3倍,但单次评测成本高达1万美元,同时带来更精准、更诚实的代码能力。
实测 Claude Opus 4.8:活干得更漂亮了,话说得更难听了
实测显示Claude Opus 4.8在代码生成和Agent任务上表现显著提升,但模型在安全批评和对话风格上变得更加直接犀利。
别再无脑装豆包了,实测五款国产 AI App,最强的竟是...
国产AI实测排名大洗牌:DeepSeek综合最强,豆包修图无敌,千问生态独霸
超越GPT-Realtime-2,阿里语音大模型获三项第一
阿里巴巴语音大模型Fun-Realtime-ASR和Fun-Realtime-AudioChat在Artificial Analysis评测中超越GPT-Realtime-2,在词错误率、语音推理和对话流畅度三项指标上均获第一。
MaxVideoAI
MaxVideoAI 是一个提供 AI 视频模型对比的平台,帮助用户在视频渲染前评估不同模型性能,匹配最佳引擎,提高视频生成效率。
AI Ping
AI Ping是一个专注于大模型服务评测与API调用的一站式平台,致力于帮助用户快速评估和选择最适合的大模型服务。
预测这件事,人类越犹豫,这个大模型越有优势
预测这件事,人类越犹豫,这个大模型越有优势