医生与AI评估LLM临床能力存在系统性分歧:400+医生7专科多中心研究揭示评估标准不可互换
← 行业趋势一、研究背景大语言模型LLM在医疗领域的应用正从实验室走向临床一线然而一个根本性问题始终悬而未决谁来评估AI的临床能力如何评估当前主流的评估范式存在三重偏差。其一多数基准测试依赖选择题或合成病例synthetic vignettes将复杂的临床推理压缩为单一正确选项这种考试思维与实际床旁决策之间存在深刻鸿沟。其二评估者往往是少数几位临床专家其判断未必能代表更广泛医生群体的观点。其三随着AI智能体技术的兴起越来越多研究开始用AI评估AI——但这种方式是否可靠此前从未被系统验证。2026年7月2日首都医科大学附属北京友谊医院放射介入科金龙/栗荐团队联合北京同仁医院王宁利团队、复旦大学附属中山医院葛均波/李晨光团队以及英国帝国理工学院、伦敦大学学院、香港中文大学、香港科技大学等17家国内外机构在Nature旗下数字医学顶刊npj Digital MedicineIF15.1发表了一项里程碑式研究DOI: 10.1038/s41746-026-02942-6首次以大规模实证数据揭示了医生与AI智能体在评估LLM时存在的系统性认知分歧。二、研究创新点这项研究的突破性体现在三个层面第一规模空前。研究纳入超过400名执业医生跨越7个医学专科心内科、神经内科、肝胆外科、眼科、放射科、介入放射科等覆盖中国从东部沿海到西部高原的多个地理区域是迄今为止规模最大的LLM临床评估研究。第二真枪实弹。不同于选择题或合成病例研究使用的是2024年多中心收集的真实、去标识化临床病例。5个通用LLMGPT-4o、Claude 3.5、Qwen-Max、DeepSeek-R1、OpenAI o1需要对病例生成自然语言解读医生再从全面性、连贯性、准确性、有用性、无害性和结构性六个维度进行盲法评分。第三人机对账。研究部署了与医生数量相等的AI评估智能体作为平行对照组使用完全相同的病例材料和评估维度。这种配对设计使得人机评估差异得以被精确量化这在既往文献中尚无先例。三、技术原理本研究的核心设计是双轨评估框架其架构如下图所示。人类评估轨Human Evaluation Track400余位医生按年资分为初级、中级、高级三组按执业地域分为平原地区组和高原地区组每位医生对LLM输出在6个维度上进行Likert量表评分采用盲法设计医生不知晓输出来自哪个模型AI评估轨Agentic Evaluation Track部署等量的AI评估智能体智能体被配置为模拟特定医生特征年资、专科等使用相同的评估提示词和评分标准所有评估输出被记录用于一致性分析数据分析层组内一致性采用Kendall’s W系数人机一致性采用跨组比较排名稳定性通过Bootstrap重采样验证亚组分析按年资、地域、专科分层该设计的精妙之处在于它不仅回答了哪个LLM最好的问题更追问了谁的标准才算数——这一通常被AI评估研究所忽视的元问题。四、实验结果研究结果呈现出一幅远比AI赢或人类赢更为复杂的图景。发现一年资塑造评估偏好。初级医生最青睐Qwen-Max而高年资专家在连贯性、准确性和临床有用性维度上对GPT-4o和DeepSeek-R1给予更高评价。最受青睐的模型在不同年资组之间并不稳定提示临床经验的积累深刻改变了医生对AI输出的判断标准。发现二地域导致排名逆转。高原地区与平原地区医生的评估模式存在显著差异——部分模型的相对排名甚至出现方向性逆转。这一发现表明临床实践环境资源可及性、疾病谱差异、转诊模式等可能深刻影响医生对LLM生成内容的判断标准未来LLM评估研究应将执业环境作为重要的分层变量。发现三AI评估者高度自洽但与人不同。在平行评估中AI智能体在所有六个维度上均将OpenAI o1视为最优解而人类医生则更青睐DeepSeek-R1和GPT-4o。虽然人机之间存在中等程度的整体一致性Kendall’s W0.798但AI智能体在不同模拟经验水平下产生的排名高度一致76.7%而人类医生中这一比例仅为3.3%。发现四AI评估者无法捕获人类判断的异质性。人类医生的评估呈现出丰富的异质性——不同年资、不同地域、不同专科的医生有着不同的判断标准。这种异质性不是噪声而是临床多样性的真实反映。AI智能体虽然高效但输出的整齐划一恰恰暴露了其无法模拟人类临床判断结构化差异的根本局限。五、应用前景这项研究的结论对医疗AI产业有三个直接启示对AI开发者而言评估标准不可一刀切。一个在选择题基准上表现优异的模型可能在真实临床环境中被不同医生群体给出截然不同的评价。未来的医疗LLM评测应纳入多中心、多专科、多年资的医生评估而非仅依赖自动化基准测试。对医院采购决策者而言AI评估工具不应替代医生试用。本研究明确显示AI评估者与人类医生的偏好存在系统性偏差——如果医院仅凭自动化评测选择LLM产品可能选到一个AI认为好但临床医生实际用不上的系统。对AI智能体研究者而言这项研究提示了一个深层问题我们究竟希望AI评估者模拟人类平均判断还是人类判断的多样性从临床安全角度看后者才是正确答案——但当前技术显然还做不到。这也为下一代专科AI智能体的开发指明了方向不是追求一个万能评估器而是开发能够适配不同临床场景的分层评估体系DOI: 10.1038/s41746-026-02942-6。六、结论当医疗AI从能不能用走向好不好用的阶段评估问题就不再是技术问题而是认识论问题。金龙/栗荐团队的这项研究用超过400位医生的真实声音告诉我们LLM的临床价值不存在唯一答案它取决于谁来问、在哪里问、为谁而问。AI智能体可以作为高效的辅助筛选工具帮助在数以千计的LLM输出中初步分诊——但临床相关性、安全性和实用性的最终判断仍必须锚定于真实医生的多样化视角。临床评估需要的不是一个标准答案裁判而是一个能够包容并反映临床异质性的多维框架。论文原文详细信息https://www.simoagent.com/blog/2026-08-01-llm-evaluation-divergence/参考文献Shi P, Li J, Yang Z, et al. Physicians and artificial intelligence diverge in evaluating large language models on real clinical cases.npj Digital Medicine, 2026. PMID: 42393197 DOI: 10.1038/s41746-026-02942-6Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents.Nature, 2026. PMID: 42310457 DOI: 10.1038/s41586-026-10675-5Liu Y, Carrero ZI, Jiang X, et al. Benchmarking large language model-based agent systems for clinical decision tasks.npj Digital Medicine, 2026. PMID: 41708802 DOI: 10.1038/s41746-026-02443-6

相关新闻

XSS攻击与JavaScript免杀技术:水坑钓鱼攻防实战解析

XSS攻击与JavaScript免杀技术:水坑钓鱼攻防实战解析

1. 项目概述:从“水坑”到“鱼获”的攻击链剖析“水坑钓鱼”这个名字听起来有点野外生存的意味,但在网络安全领域,它描述的是一种极具针对性和隐蔽性的攻击手法。想象一下,在干旱的季节,动物们会不约而同地前往少数几个…

2026/10/11 8:33:14 阅读更多 →
LibreOffice无头模式:命令行批量转换Office文档为PDF的完整指南

LibreOffice无头模式:命令行批量转换Office文档为PDF的完整指南

1. 项目概述:为什么需要LibreOffice进行文档转换?在日常办公和文档处理中,PDF格式因其跨平台、格式固定、不易被随意编辑的特性,几乎成了文件交换和归档的“硬通货”。无论是提交报告、发布通知,还是分享设计稿&#x…

2026/10/11 1:06:46 阅读更多 →
深入理解计算机系统:程序员必备的系统思维与底层知识框架

深入理解计算机系统:程序员必备的系统思维与底层知识框架

1. 为什么这本书被奉为“神书”? 如果你在计算机专业领域待过一段时间,或者在网上搜索过“计算机专业必读书籍”,那么《深入理解计算机系统》(Computer Systems: A Programmer‘s Perspective, 简称CSAPP)这…

2026/10/11 14:36:05 阅读更多 →

最新新闻

物理与动画系统架构深度解析:从帧循环到Transform协同的引擎设计要点

物理与动画系统架构深度解析:从帧循环到Transform协同的引擎设计要点

做引擎这几年,最常被问到的一个问题就是:物理和动画这两个模块放在一起讲,是不是有点强行组CP?其实不是,这俩在帧循环里的位置紧挨着,数据耦合又深,渲染那边等着同一份Transform结果。你拆开看会…

2026/10/12 2:06:09 阅读更多 →
28岁没房没车别焦虑:转行前先搞懂副业与财富自由的底层逻辑

28岁没房没车别焦虑:转行前先搞懂副业与财富自由的底层逻辑

28岁,无车无房,收入一眼望到头,拿着几千块的工资,晚上躺床上刷手机,看到别人晒新房晒婚礼,再想想自己连恋爱都不敢谈,一种说不出的恐慌直接顶到嗓子眼儿。这种日子我太熟悉了,因为我…

2026/10/12 2:06:09 阅读更多 →
给Claude Code接入MCP搜索:告别过期答案,实时联网查资料

给Claude Code接入MCP搜索:告别过期答案,实时联网查资料

我印象最深的一次,是在某次项目重构里要用到一个库的最新接口。Claude Code 三两下就把代码写完了,看起来头头是道,结果一编译直接报错。后来我自己上官网翻文档才发现,这个库在两三周前刚改过一次函数签名,而 Claude …

2026/10/12 2:06:09 阅读更多 →
Ant Design Landing 设计资源页解析:Sketch 源文件、数据模型与前端实现

Ant Design Landing 设计资源页解析:Sketch 源文件、数据模型与前端实现

前端文档 【免费下载链接】ant-design-landing :mountain_bicyclist: Landing Pages of Ant Design System 项目地址: https://gitcode.com/gh_mirrors/antd/ant-design-landing 点击查看 免费下载 Ant Design Landing(ant-design-landing)是…

2026/10/12 2:06:09 阅读更多 →
Apache Beam Python 的 Mean 聚合变换:Globally 与 PerKey 用法及底层实现

Apache Beam Python 的 Mean 聚合变换:Globally 与 PerKey 用法及底层实现

【免费下载链接】beam Apache Beam is a unified programming model for Batch and Streaming data processing. 项目地址: https://gitcode.com/gh_mirrors/beam18/beam 点击查看 免费下载 本文围绕 Apache Beam Python SDK 中计算算术平均值的 Mean 聚合变换展开…

2026/10/12 2:06:09 阅读更多 →
Jenkins 2.346.1 内网离线安装插件:依赖解析与版本匹配实战

Jenkins 2.346.1 内网离线安装插件:依赖解析与版本匹配实战

简介:本资源面向在内网、隔离网等无外网环境中部署Jenkins的运维与DevOps工程师,针对Jenkins 2.346.1无法在线拉取插件的问题,提供一套完整的离线插件安装方案。压缩包共约2000个文件,整体314.4MB,涵盖90个jpi与30个hp…

2026/10/12 2:05:08 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →