AGI-Eval

AGI-Eval

AI大模型评测社区

访问网站
AI模型评测149 次访问更新于 a month ago反馈
AGI-Eval screenshot

详细介绍

AGI-Eval

AGI-Eval 是一个专注于大语言模型与多模态模型评测的开放平台,致力于通过科学、透明的评测体系,帮助用户深入了解 AI 模型的能力边界,让 AI 成为更好的伙伴。

AGI-Eval Logo

主要功能

评测榜单

基于通用评测方案,提供业内大语言模型的能力得分排名榜单。榜单涵盖综合评测和各能力项评测,数据透明、权威,帮助用户深入了解每个模型的优缺点,做出明智选择。平台定期更新榜单,确保用户掌握最新信息,轻松找到最适合的模型解决方案。

榜单类型包括:

  • 大语言模型榜单:覆盖精调与基座模型
  • 多模态模型榜单
模型榜单示例

人机评测

构建人机协同评测方案,探索下一代评测方案的无限可能:

  • 体验前沿科技:与大模型协作,感受人工智能的强大力量
  • 共建未来标准:亲身参与构建下一代评测方案,定义行业新标杆
  • 收获丰厚回报:在享受创新乐趣的同时,获得实实在在的收益

评测集

平台提供丰富的评测数据集资源,分为两类:

  • 平台官方评测集:官方自建,涉及多领域的模型评测
  • 用户自建评测集:由社区用户贡献

代表评测集:OI Bench Preview

由高难度信息学算法竞赛题构成,试题难度包括 NOIP(信息学竞赛省赛)/ 信息学竞赛省队选拔赛 / NOI(信息学竞赛全国赛)三档,试题由高校合作建设完成。

Data Studio

为大模型发展助力,支持个人贡献专业领域数据。特色包括:

  • 活跃用户群体:平台用户互助交流,用户规模达 20000+
  • 多元收集方式:单条数据、扩写数据、Arena 数据等方式,满足评测不同需要
  • 多样数据类型:500+ 任务标签,持续收集多领域、多维度数据
  • 完备审核机制:机审+人审,多重审核机制保证数据质量

平台贡献者

AGI-Eval 汇聚了多位学术界专家担任平台贡献者,包括上海交通大学翟广涛教授(国家杰青)、刘笑宏助理教授、张伟楠副教授,以及专注于自然语言处理的陈琴博士、知识图谱专家王昊奋博士等。

合作机构

美团、同济大学、上海交通大学、华东师范大学、Datawhale 等。

适用场景

  • 模型选型参考:通过权威榜单对比不同厂商模型的能力表现
  • 学术研究支持:获取标准化评测集,开展模型能力评估研究
  • 行业应用决策:基于多维度评测数据,选择最适合业务场景的模型
  • 数据贡献共建:通过 Data Studio 参与评测数据建设,推动评测生态发展