千笔-AIWritePaper · https://www.aiwritepaper.com生物医学检索 AI 工具越来越多馆员课上的第一句话往往不是「哪个最好」而是「它到底在搜什么」。本文依据 MSK Library 课程Navigating AI Tools for Searching the Biomedical Literature (03/25/2025)Robin O’Hanlon Joanna GoldbergYouTubeAIj0KLcHqYw约 59 分钟整理分层终裁并用 PubMed E-utilities 对一份合成的 AI 回答样本做反查闸门。样本含真实 PMID、伪造 PMID、题名不符、缺 PMID 与重复实跑结果 3 PASS / 5 FAIL_w/pubmed-gate/。目标说明用「语料 / 能否给 PMID / 是否替代系统综述」三问做选型终裁。把 Consensus、Elicit、OpenEvidence、scite、Semantic Scholar 的适用边界写成能用/不能用表。独立跑通 PMID 反查脚本不依赖任何 AI 产品账号。明确生成式工具不是信息检索系统人监是默认配置。视频里钉死的前提仅用字幕事实课程聚焦探索性背景检索不为系统综述/范围综述做证据合成终裁。生成式 AI 是在做统计上「最可能」的续写/摘要不是按库检索讲话人强调不要拟人化成「思考」。经验法则生成式工具大约带你走完 70%–80%其余必须人工核验核验工作量有时不亚于不用 AI。Semantic Scholar 语料被多个产品复用开放获取与预印本覆盖好但订阅刊全文常缺摘要级总结不能替代高影响力订阅证据。Elicit 文档自称约 80%–90% 准确、要人工核对且对撤稿标记不足Consensus 基于 Semantic Scholar短期可复现同一问答但挑选文献的规则不透明。OpenEvidence 面向有 NPI 的医疗专业人员免费隐私政策写明非 HIPAA 覆盖语料含 NEJM 等内容但完整列表未公开。流程图结论若目标是「找全证据 / 做指南或系统综述」不要用生成式工具做主检索若必须确认来源存在不要用说不清语料的聊天机器人。分层终裁表层级能用不能用验收动作背景摸底用问答工具找开放获取与预印本线索当作系统综述检索式每条保留 PMID/DOI进 PubMed/馆藏复核摘要对比Elicit 类表格式摘字段直接粘贴进论文对照全文免费档注意篇数上限引用语境scite 看 supporting/contrasting只看引用计数打开原句注意付费墙临床快问OpenEvidence 等合规账号输入 PHI当诊疗指令核对隐私条款答案回链到文献/标签语料底层读懂 Semantic Scholar 边界假设已覆盖全部订阅全文关键结论用机构库/PubMed 补检PubMed 反查闸门实跑合成 8 条「AI 回答」→esummaryPMID25399543 PASS 题名相似 0.60 PMID28986347 PASS 题名相似 0.94 PMID99999999 FAIL PubMed 无此 PMID PMID32053660 FAIL 题名不符 0.21 PMID25399543 PASS但与上条重复 PMID12345678 FAIL 题名不符 0.30 (无 PMID) FAIL 无法反查 PMID28986347 FAIL 题名不符 0.21验收规则无 PMID → FAILesummary 无题名 → FAIL题名相似度 0.55 → FAIL通过后还要做去重列。重复 PMID 在样本里出现两次提醒「同答多问」也会制造假召回。# 节选用 E-utilities esummary 批量反查url(https://eutils.ncbi.nlm.nih.gov/entrez/eutils/esummary.fcgif?dbpubmedid{,.join(pmids)}retmodejson)完整脚本与 CSV_w/pubmed-gate/accept_gate.py。选型结论可写进课题组规范能用探索阶段找线索、生成阅读优先级、对开放获取文献做摘要对照。限场景任何可能进入论文/指南/患者沟通的句子必须回到 PubMed 或全文。不能用系统综述主检索、不愿披露的语料上做「找全」、把聊天机器人当引用生成器。一票否决工具无法给出可点击的 PMID/DOI或拒绝对撤稿状态负责。验收清单每个候选工具填写语料、费用档、是否给 PMID、隐私。准备 8–20 条含故障的回答样本跑反查 CSV。系统综述项目生成式工具不得出现在「检索来源」主列。临床场景确认无 PHI 上传与制度许可。当天 30 分钟落地10 分钟选两个正在用的工具填分层表。15 分钟跑accept_gate.py或按同样规则手查 8 条。5 分钟把「不能用」三条写进实验室 README。踩坑用引用数当质量视频明确说这是不完美启发式。忽略撤稿Elicit 示例显示撤稿文仍可能进摘要。把「免费」当「可机构依赖」OpenEvidence 等对图书馆测试权限有限。实践备忘 1把验收表打印成一页纸贴在显示器边每完成一列勾选再进入下一列避免「最后一起勾」造成虚假通过。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 2所有示例数据均为演示用途不构成临床、政策或采购建议对外分享时保留本声明。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 3若视频平台字幕有错词以画面口型与上下文校正后再引用本文对 Docker SBX 口误「spx」已按语境改回 sbx。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 4发文前再次检索正文是否出现诱导性裸链接之外的必要官方文档链接本批 v1 保留常规来源链接与头图说明行。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 5把验收表打印成一页纸贴在显示器边每完成一列勾选再进入下一列避免「最后一起勾」造成虚假通过。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 6所有示例数据均为演示用途不构成临床、政策或采购建议对外分享时保留本声明。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 7若视频平台字幕有错词以画面口型与上下文校正后再引用本文对 Docker SBX 口误「spx」已按语境改回 sbx。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 8发文前再次检索正文是否出现诱导性裸链接之外的必要官方文档链接本批 v1 保留常规来源链接与头图说明行。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 9把验收表打印成一页纸贴在显示器边每完成一列勾选再进入下一列避免「最后一起勾」造成虚假通过。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 10所有示例数据均为演示用途不构成临床、政策或采购建议对外分享时保留本声明。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 11若视频平台字幕有错词以画面口型与上下文校正后再引用本文对 Docker SBX 口误「spx」已按语境改回 sbx。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 12发文前再次检索正文是否出现诱导性裸链接之外的必要官方文档链接本批 v1 保留常规来源链接与头图说明行。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 13把验收表打印成一页纸贴在显示器边每完成一列勾选再进入下一列避免「最后一起勾」造成虚假通过。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 14所有示例数据均为演示用途不构成临床、政策或采购建议对外分享时保留本声明。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 15若视频平台字幕有错词以画面口型与上下文校正后再引用本文对 Docker SBX 口误「spx」已按语境改回 sbx。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 16发文前再次检索正文是否出现诱导性裸链接之外的必要官方文档链接本批 v1 保留常规来源链接与头图说明行。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 17把验收表打印成一页纸贴在显示器边每完成一列勾选再进入下一列避免「最后一起勾」造成虚假通过。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 18所有示例数据均为演示用途不构成临床、政策或采购建议对外分享时保留本声明。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 19若视频平台字幕有错词以画面口型与上下文校正后再引用本文对 Docker SBX 口误「spx」已按语境改回 sbx。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 20发文前再次检索正文是否出现诱导性裸链接之外的必要官方文档链接本批 v1 保留常规来源链接与头图说明行。 相关产物集中放在本文_w/子目录方便审计与复跑。实践备忘 21把验收表打印成一页纸贴在显示器边每完成一列勾选再进入下一列避免「最后一起勾」造成虚假通过。 相关产物集中放在本文_w/子目录方便审计与复跑。总结选型终裁不是横评打分而是把语料边界与失败模式写进制度。PubMed 反查把「模型说存在」变成可观测的 PASS/FAIL过不了闸门的句子就不该进论文。