| 基本信息 | 详情 |
|---|---|
| 开发公司 | Qiao Jin 等,匹兹堡大学与 NCBI/NLM/NIH |
| 上线时间 | 2019 年(EMNLP 2019) |
| 官网 | https://pubmedqa.github.io/ |
| 支持平台 | Web / GitHub |
| 价格 | 免费开源 |
| 核心定位 | 生物医学研究问答评测基准 |
PubMedQA 是一个面向生物医学研究问答的数据集与基准。它给模型出一道道 yes/no/maybe 的研究问题,比如"术前他汀能否减少冠脉搭桥术后的房颤",模型要结合对应论文摘要给出判断。说白了,它把 PubMed 上真实研究问题拎出来,测一测 LLM 到底懂不懂医学文献。
数据规模上,PubMedQA 提供了 1,000 条专家标注、61.2k 无标注、211.3k 人工生成的 QA 实例,覆盖从临床到基础研究的多个方向。起初步我以为它只是又一个 QA 数据集,结果发现它的价值在于 reasoning-required——模型必须真正读懂摘要才能答对,光靠常识不行。
榜单上,GPT-4 (Medprompt) 以 82.0% 准确率居首,Med-PaLM 2 紧随 81.8%,而人类专家基线是 78.0%。也就是说,顶级模型已经超过人类。但别急着下结论——这个"超过"建立在 yes/no/maybe 的简化任务上,真实临床决策远比这复杂。
核心功能
三类标注数据
专家标注的 1k、无标注 61.2k、人工生成 211.3k,分别服务于监督训练、半监督和大规模预训练。你可以按需取用。
Reasoning-required 评测
和 MedQA 那种选择题不同,PubMedQA 强迫模型做推理判断——答案不是从 A/B/C/D 选,而是基于摘要推一个 yes/no/maybe。这个设计更贴近"读文献下结论"的真实场景。
公开排行榜
官网维护着按准确率和 Macro-F1 排序的榜单,支持模型提交。你跑完模型,按 GitHub 流程提交预测结果就能上榜。
与 BioNLP 生态打通
PubMedQA 被纳入 Yale 团队做的 12 个 BioNLP 评测集之一,可以和 MedQA、BioASQ 等配合做横向对比。
适合谁
要做领域微调、评测 LLM 医学能力的,PubMedQA 是绕不开的基准。
想证明自家模型在医学推理上不输 GPT-4 的,可以拿它刷分。
做 RAG、文献综述自动化时,用它做回归测试,看模型读懂摘要的能力。
需要多任务医学基准的,PubMedQA 是 reasoning-required 这一档的代表。
同类竞品对比
| 基准 | 任务类型 | 数据规模 | 语言 | 特点 |
|---|---|---|---|---|
| PubMedQA | yes/no/maybe + 摘要推理 | 1k 专家 + 211k 生成 | 英文 | reasoning-required,文献接地 |
| MedQA (USMLE) | 多选题(5 选 1) | ~12.7k | 英文/中文 | 临床考试题,知识覆盖广 |
| BioASQ | 事实型问答 + snippet | ~4.8k | 英文 | 检索+抽取,任务更杂 |
| MMLU Clinical | 多选题 | 数百题 | 英文 | 综合基准的医学子集 |
| MultiMedQA | 多数据集聚合 | 聚合 | 英文 | 含 HealthSearchQA,Google 力推 |
横向看,PubMedQA 胜在"推理+接地",MedQA 胜在"知识广度"。如果你只选一个测医学推理,PubMedQA 更合适。
FAQ
Q1:PubMedQA 是免费使用的吗? 是的。数据集和评测代码在 GitHub 开源,任何人都能下载、复现、提交模型。
Q2:模型怎么提交到排行榜? 按 GitHub 仓库的 submission 说明,上传模型在测试集上的预测结果,团队会核验后上榜单。
Q3:为什么人类基线只有 78%? 这个基线来自匹兹堡大学和卡内基梅隆的研究者,针对 yes/no/maybe 的标注。医学研究问题本身就有不确定性,78% 反映了"专家也会答错"的现实,不是模型有多神。
Q4:PubMedQA 适合做 RAG 评测吗? 可以,但要注意它给的是摘要,不是检索任务。如果你想测"检索+推理",需要在 PubMedQA 之上自己加检索环节。
Q5:有中文版吗? 官方没有中文版。中文医学评测可以看 C-Eval 的医学相关科目或 CMExam 等本土基准。
Q6:排行榜多久更新一次? 官网最近一次更新停在 2024 年 4 月。新模型需要团队手动核验,更新节奏不快,建议同时看 Papers with Code 的聚合榜单。
更新动态
PubMedQA 自 2019 年发布后,长期作为医学 LLM 评测的"标配"被引用。2023–2024 年是榜单活跃期,GPT-4、Med-PaLM 2、MEDITRON 相继上榜。2025 年起,社区更多把 PubMedQA 当作回归测试集,重心转向 MultiMedQA、MedQA-Reasoning 等更难的衍生基准。
客户评论
PubMedQA 是学术基准而非商业产品,没有用户评分系统。社区反馈主要来自论文引用和讨论:
- Yale BioNLP 团队:将 PubMedQA 纳入 12 个 BioNLP 数据集系统评测,指出 fine-tuning 仍优于 zero-shot,GPT-4 在 reasoning 类任务上能超过 SOTA。
- PubMed Reasoner(WPI, 2026):以 PubMedQA 为主战场,用 GPT-4o 达到 78.32%,略超人类专家,验证了"检索增强+推理"路线的可行性。
- JMIR 2026 研究:提醒社区注意 benchmark 完整性——即便是 MedQA 这类基准也存在错题,PubMedQA 的 yes/no/maybe 设计相对更干净,但仍需警惕 data leakage。
参考来源
- ▸PubMedQA 官网 | PubMedQA: A Dataset for Biomedical Research Question Answering,项目主页与排行榜
- ▸arXiv | PubMedQA: A Dataset for Biomedical Research Question Answering (EMNLP 2019),原始论文
- ▸Nature Communications | Benchmarking large language models for biomedical natural language processing applications and recommendations,Yale 团队的 12 数据集系统评测
- ▸arXiv | PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering,2026 年 SOTA 方法
- ▸JMIR | Benchmark Integrity and Reasoning-Trace Errors in Medical Question Answering With Large Language Models,基准完整性与推理错误分析
