PubMedQA Homepage

PubMedQA Homepage

生物医学研究问答数据集和模型得分排行榜

访问网站
AI模型评测142 次访问更新于 a month ago反馈
PubMedQA Homepage screenshot

详细介绍

PubMedQA Homepage

简介

PubMedQA 是一个面向生物医学研究领域的问答数据集,专门用于解决需要推理能力的生物医学研究问题问答任务。该数据集由 Jin 等人于 2019 年发表在 EMNLP 会议上,旨在推动生物医学自然语言处理的发展。

主要功能

核心任务

PubMedQA 的核心任务是根据论文摘要回答研究性问题,答案限定为三种:是(yes)/ 否(no)/ 可能(maybe)。例如:"术前他汀类药物是否能减少冠状动脉旁路移植术后的心房颤动?"

数据集构成

  • 1,000 条 专家标注数据
  • 61,200 条 未标注数据
  • 211,300 条 人工生成的问答实例

公开资源

  • 提供完整的数据集下载
  • 开源代码与数据处理流程
  • 支持模型提交与评测

适用场景

  • 生物医学 NLP 研究:开发和评估面向医学文献的理解模型
  • 临床决策支持:辅助科研人员快速获取研究问题的结论性答案
  • 大语言模型评测:作为专业领域推理能力的基准测试(如 GPT-4、Med-PaLM 2、Claude 3 等模型均在此评测)

排行榜(推理必需设置)

网站维护着活跃的公开排行榜,截至 2024 年 4 月 28 日的领先模型包括:

排名 模型 机构 准确率
1 GPT-4 (Medprompt) Microsoft 82.0%
2 Med-PaLM 2 Google Research & DeepMind 81.8%
3 MEDITRON EPFL 81.6%
4 Palmyra-Med Writer Inc. 81.1%
5 AntGLM-Med Ant Group 80.6%

人类性能基准为 78.0%(准确率)/ 72.2%(Macro-F1),目前顶尖模型已超越人类水平。

引用信息

使用该数据集请引用原始论文:

Jin, Q., Dhingra, B., Liu, Z., Cohen, W., & Lu, X. (2019). PubMedQA: A Dataset for Biomedical Research Question Answering. EMNLP-IJCNLP 2019, 2567–2577.