HumanizerBench是一个透明的人工智能人性化工具基准测试平台,旨在评估各类AI文本人性化工具在主流AI检测器上的表现。
FlagEval是智源研究院推出的“天秤”大模型评测平台,致力于提供全面、公正、可复现的大模型评估服务。