LLMEval 是由复旦大学自然语言处理实验室(Fudan NLP Lab)发起的一项大语言模型评测研究项目,致力于构建严谨、公平的大语言模型评估框架。该项目覆盖 13 个以上学术学科、医疗 AI 领域以及超过 220,000 道生成式问题,相关成果已发表于 AAAI 2024、EMNLP 2025、ACL 2026 及 arXiv 2026 等顶级学术会议和平台。
主要功能与特色
多维度评测体系
LLMEval 围绕大语言模型的综合能力评估,建立了覆盖多个关键领域的评测框架:
- 学术能力评测:横跨 13 个以上学科领域,包含 220,000+ 研究生级别问题
- 逻辑推理评测:通过 LLMEval-Logic 专注考察模型的命题逻辑与一阶逻辑推理能力
- 医疗临床评测:通过 LLMEval-Med 评估模型在真实临床场景中的表现
- 公平性与鲁棒性评测:通过 LLMEval-Fair 进行长达 30 个月的纵向研究
核心数据集与工具
| 项目名称 |
状态 |
核心特点 |
| LLMEval-Fair |
已发布 |
220K 问题, contamination-resistant 设计,90% 人机一致性 |
| LLMEval-Logic |
已开源 |
196 道基础题 + 154 道对抗强化题,Z3 求解器验证 |
| LLMEval-Med |
已发布 |
2,996 道医师验证的临床问题,覆盖五大核心医疗领域 |
开源资源
LLMEval-Logic 已正式开源,提供:
- 196 道公开基础题目(Base items)
- 154 道对抗性强化的题目(Adversarially hardened items)
- Z3 求解器验证的标准答案
- 专家评分规则(Expert rubrics)
- 可复现的评测流程(Reproducible evaluation pipeline)
代表性研究成果
LLMEval-Logic(arXiv 2026)
专注于大语言模型逻辑推理能力的中文评测基准。采用三阶段审计流程构建:
- 正向命题:标注人员从真实世界故事出发编写题目,而非从公式反向模板化生成
- 双重校验:手写评分规则清单与 Z3 SMT 求解器共同审计自然语言到一阶逻辑的转换
- 对抗强化:闭环对抗强化智能体流程淘汰过于简单的题目
该数据集包含两个配对子集:
- LLMEval-Logic-Base:单问题命题逻辑与谓词逻辑项目,含 Z3 验证答案、黄金形式化及原子级评分规则
- LLMEval-Logic-Hard:多问题/子问题项目,涵盖枚举、计数、唯一性、替代方案及反事实推理
评测结果显示,14 个前沿大语言模型在三组独立运行中,最强模型在 Hard 集上的项目准确率仅为 37.5%,表明前沿推理研究仍有巨大提升空间。
LLMEval-Fair(ACL 2026 Main Conference)
针对大语言模型评测中的鲁棒性与公平性问题,开展为期 30 个月的纵向研究。基于 220,000 道研究生级别题目的专有题库,每次评测动态采样未见过的问题集。其自动化流程通过 contamination-resistant 数据筛选、新型反作弊架构,以及经校准的 LLM-as-a-Judge 机制(达成 90% 专家一致性)确保评测完整性。对近 60 个领先模型的研究揭示了性能瓶颈,并暴露了静态基准无法检测的数据污染漏洞。
LLMEval-Med(EMNLP 2025 Findings)
首个经医师验证的真实临床大语言模型评测基准,覆盖医学知识、语言理解、推理、伦理安全及文本生成五大核心领域。题目来源于真实电子病历记录和专家设计的临床场景,通过专家开发的清单进行自动化评测,并经人机一致性分析验证。已对 13 个大语言模型(含专科、开源、闭源类别)完成评测。
适用场景
- 学术研究:为大语言模型能力边界研究提供标准化、可复现的评测工具
- 模型选型:帮助开发者和机构了解不同大语言模型在各专业领域的真实能力表现
- 医疗 AI 评估:为医疗大语言模型的临床落地提供经过医师验证的评估标准
- 逻辑推理研究:为探索大语言模型形式推理能力提供经过严格验证的基准数据集
- 抗污染评测:利用 contamination-resistant 设计,获得更可信的模型能力评估结果
参与方式
LLMEval 面向公众开放。研究者和开发者可通过以下方式参与:
- 访问 GitHub 探索代码与数据
- 查阅 论文合集 了解详细技术方案
- 查看 评测榜单 对比模型表现
- 通过邮件(mingzhang23@m.fudan.edu.cn)或微信(zanyingluan)联系团队寻求合作