
AGI-Eval 是一个专注于大语言模型与多模态模型评测的开放平台,致力于通过科学、透明的评测体系,帮助用户深入了解 AI 模型的能力边界,让 AI 成为更好的伙伴。
基于通用评测方案,提供业内大语言模型的能力得分排名榜单。榜单涵盖综合评测和各能力项评测,数据透明、权威,帮助用户深入了解每个模型的优缺点,做出明智选择。平台定期更新榜单,确保用户掌握最新信息,轻松找到最适合的模型解决方案。
榜单类型包括:

构建人机协同评测方案,探索下一代评测方案的无限可能:
平台提供丰富的评测数据集资源,分为两类:
代表评测集:OI Bench Preview
由高难度信息学算法竞赛题构成,试题难度包括 NOIP(信息学竞赛省赛)/ 信息学竞赛省队选拔赛 / NOI(信息学竞赛全国赛)三档,试题由高校合作建设完成。
为大模型发展助力,支持个人贡献专业领域数据。特色包括:
AGI-Eval 汇聚了多位学术界专家担任平台贡献者,包括上海交通大学翟广涛教授(国家杰青)、刘笑宏助理教授、张伟楠副教授,以及专注于自然语言处理的陈琴博士、知识图谱专家王昊奋博士等。
美团、同济大学、上海交通大学、华东师范大学、Datawhale 等。