
PubMedQA 是一个面向生物医学研究领域的问答数据集,专门用于解决需要推理能力的生物医学研究问题问答任务。该数据集由 Jin 等人于 2019 年发表在 EMNLP 会议上,旨在推动生物医学自然语言处理的发展。
PubMedQA 的核心任务是根据论文摘要回答研究性问题,答案限定为三种:是(yes)/ 否(no)/ 可能(maybe)。例如:"术前他汀类药物是否能减少冠状动脉旁路移植术后的心房颤动?"
网站维护着活跃的公开排行榜,截至 2024 年 4 月 28 日的领先模型包括:
| 排名 | 模型 | 机构 | 准确率 |
|---|---|---|---|
| 1 | GPT-4 (Medprompt) | Microsoft | 82.0% |
| 2 | Med-PaLM 2 | Google Research & DeepMind | 81.8% |
| 3 | MEDITRON | EPFL | 81.6% |
| 4 | Palmyra-Med | Writer Inc. | 81.1% |
| 5 | AntGLM-Med | Ant Group | 80.6% |
人类性能基准为 78.0%(准确率)/ 72.2%(Macro-F1),目前顶尖模型已超越人类水平。
使用该数据集请引用原始论文:
Jin, Q., Dhingra, B., Liu, Z., Cohen, W., & Lu, X. (2019). PubMedQA: A Dataset for Biomedical Research Question Answering. EMNLP-IJCNLP 2019, 2567–2577.