当前标签:基准测试
HumanizerBench
HumanizerBench是一个透明的人工智能人性化工具基准测试平台,旨在评估各类AI文本人性化工具在主流AI检测器上的表现。
超越Claude Mythos的AI模型,诞生了?
一个由Transformer发明者联合创立的公司Sakana AI,高调推出名为“Fugu”的AI模型,声称其能力比肩Anthropic未公开的顶级模型Claude Mythos,且通过独特的智能体编排技术,规避了前沿模型的出口管制风险。
前DeepMind华人研究员离职喊话:AI行业所有人都搞错了方向
前DeepMind华人研究员Lun Wang离职发文指出,AI行业在基准测试和安全评估上犯了方向性错误,真正的瓶颈被严重低估。
李飞飞再出手,空间智能的ImageNet来了
李飞飞团队接连发布ESI-Bench与HourVideo两大基准,剑指空间智能测评真空,被寄予“空间智能版ImageNet”的厚望。
LLMEval3
LLMEval3是一个由复旦大学NLP实验室推出的综合性大模型评测基准平台,旨在为研究人员和开发者提供科学、系统的评估工具和标准。
MMBench
MMBench是一个针对多模态大模型的全面评测体系,旨在系统评估模型在多种任务和模态下的综合能力。
C-Eval
C-Eval是一个专注于中文基础模型全面评估的权威工具套件。