AI万址

PubMedQA

PubMedQA 是基于 PubMed 摘要的生物医学研究问答数据集,提供 1k 专家标注与 211k 生成实例,是评测 LLM 医学推理能力的权威基准。

PubMedQA
访问官网
基本信息详情
开发公司Qiao Jin 等,匹兹堡大学与 NCBI/NLM/NIH
上线时间2019 年(EMNLP 2019)
官网https://pubmedqa.github.io/
支持平台Web / GitHub
价格免费开源
核心定位生物医学研究问答评测基准

PubMedQA 是一个面向生物医学研究问答的数据集与基准。它给模型出一道道 yes/no/maybe 的研究问题,比如"术前他汀能否减少冠脉搭桥术后的房颤",模型要结合对应论文摘要给出判断。说白了,它把 PubMed 上真实研究问题拎出来,测一测 LLM 到底懂不懂医学文献。

数据规模上,PubMedQA 提供了 1,000 条专家标注、61.2k 无标注、211.3k 人工生成的 QA 实例,覆盖从临床到基础研究的多个方向。起初步我以为它只是又一个 QA 数据集,结果发现它的价值在于 reasoning-required——模型必须真正读懂摘要才能答对,光靠常识不行。

榜单上,GPT-4 (Medprompt) 以 82.0% 准确率居首,Med-PaLM 2 紧随 81.8%,而人类专家基线是 78.0%。也就是说,顶级模型已经超过人类。但别急着下结论——这个"超过"建立在 yes/no/maybe 的简化任务上,真实临床决策远比这复杂。

核心功能

01

三类标注数据

专家标注的 1k、无标注 61.2k、人工生成 211.3k,分别服务于监督训练、半监督和大规模预训练。你可以按需取用。

02

Reasoning-required 评测

和 MedQA 那种选择题不同,PubMedQA 强迫模型做推理判断——答案不是从 A/B/C/D 选,而是基于摘要推一个 yes/no/maybe。这个设计更贴近"读文献下结论"的真实场景。

03

公开排行榜

官网维护着按准确率和 Macro-F1 排序的榜单,支持模型提交。你跑完模型,按 GitHub 流程提交预测结果就能上榜。

04

与 BioNLP 生态打通

PubMedQA 被纳入 Yale 团队做的 12 个 BioNLP 评测集之一,可以和 MedQA、BioASQ 等配合做横向对比。

适合谁

医学 NLP 研究者

要做领域微调、评测 LLM 医学能力的,PubMedQA 是绕不开的基准。

LLM 开发团队

想证明自家模型在医学推理上不输 GPT-4 的,可以拿它刷分。

临床信息学团队

做 RAG、文献综述自动化时,用它做回归测试,看模型读懂摘要的能力。

学术评测项目

需要多任务医学基准的,PubMedQA 是 reasoning-required 这一档的代表。

同类竞品对比

基准任务类型数据规模语言特点
PubMedQAyes/no/maybe + 摘要推理1k 专家 + 211k 生成英文reasoning-required,文献接地
MedQA (USMLE)多选题(5 选 1)~12.7k英文/中文临床考试题,知识覆盖广
BioASQ事实型问答 + snippet~4.8k英文检索+抽取,任务更杂
MMLU Clinical多选题数百题英文综合基准的医学子集
MultiMedQA多数据集聚合聚合英文含 HealthSearchQA,Google 力推

横向看,PubMedQA 胜在"推理+接地",MedQA 胜在"知识广度"。如果你只选一个测医学推理,PubMedQA 更合适。

FAQ

A

Q1:PubMedQA 是免费使用的吗? 是的。数据集和评测代码在 GitHub 开源,任何人都能下载、复现、提交模型。

A

Q2:模型怎么提交到排行榜? 按 GitHub 仓库的 submission 说明,上传模型在测试集上的预测结果,团队会核验后上榜单。

A

Q3:为什么人类基线只有 78%? 这个基线来自匹兹堡大学和卡内基梅隆的研究者,针对 yes/no/maybe 的标注。医学研究问题本身就有不确定性,78% 反映了"专家也会答错"的现实,不是模型有多神。

A

Q4:PubMedQA 适合做 RAG 评测吗? 可以,但要注意它给的是摘要,不是检索任务。如果你想测"检索+推理",需要在 PubMedQA 之上自己加检索环节。

A

Q5:有中文版吗? 官方没有中文版。中文医学评测可以看 C-Eval 的医学相关科目或 CMExam 等本土基准。

A

Q6:排行榜多久更新一次? 官网最近一次更新停在 2024 年 4 月。新模型需要团队手动核验,更新节奏不快,建议同时看 Papers with Code 的聚合榜单。

更新动态

PubMedQA 自 2019 年发布后,长期作为医学 LLM 评测的"标配"被引用。2023–2024 年是榜单活跃期,GPT-4、Med-PaLM 2、MEDITRON 相继上榜。2025 年起,社区更多把 PubMedQA 当作回归测试集,重心转向 MultiMedQA、MedQA-Reasoning 等更难的衍生基准。

客户评论

PubMedQA 是学术基准而非商业产品,没有用户评分系统。社区反馈主要来自论文引用和讨论:

  • Yale BioNLP 团队:将 PubMedQA 纳入 12 个 BioNLP 数据集系统评测,指出 fine-tuning 仍优于 zero-shot,GPT-4 在 reasoning 类任务上能超过 SOTA。
  • PubMed Reasoner(WPI, 2026):以 PubMedQA 为主战场,用 GPT-4o 达到 78.32%,略超人类专家,验证了"检索增强+推理"路线的可行性。
  • JMIR 2026 研究:提醒社区注意 benchmark 完整性——即便是 MedQA 这类基准也存在错题,PubMedQA 的 yes/no/maybe 设计相对更干净,但仍需警惕 data leakage。