医生与AI评估LLM临床能力存在系统性分歧:400+医生7专科多中心研究揭示评估标准不可互换
← 行业趋势一、研究背景大语言模型LLM在医疗领域的应用正从实验室走向临床一线然而一个根本性问题始终悬而未决谁来评估AI的临床能力如何评估当前主流的评估范式存在三重偏差。其一多数基准测试依赖选择题或合成病例synthetic vignettes将复杂的临床推理压缩为单一正确选项这种考试思维与实际床旁决策之间存在深刻鸿沟。其二评估者往往是少数几位临床专家其判断未必能代表更广泛医生群体的观点。其三随着AI智能体技术的兴起越来越多研究开始用AI评估AI——但这种方式是否可靠此前从未被系统验证。2026年7月2日首都医科大学附属北京友谊医院放射介入科金龙/栗荐团队联合北京同仁医院王宁利团队、复旦大学附属中山医院葛均波/李晨光团队以及英国帝国理工学院、伦敦大学学院、香港中文大学、香港科技大学等17家国内外机构在Nature旗下数字医学顶刊npj Digital MedicineIF15.1发表了一项里程碑式研究DOI: 10.1038/s41746-026-02942-6首次以大规模实证数据揭示了医生与AI智能体在评估LLM时存在的系统性认知分歧。二、研究创新点这项研究的突破性体现在三个层面第一规模空前。研究纳入超过400名执业医生跨越7个医学专科心内科、神经内科、肝胆外科、眼科、放射科、介入放射科等覆盖中国从东部沿海到西部高原的多个地理区域是迄今为止规模最大的LLM临床评估研究。第二真枪实弹。不同于选择题或合成病例研究使用的是2024年多中心收集的真实、去标识化临床病例。5个通用LLMGPT-4o、Claude 3.5、Qwen-Max、DeepSeek-R1、OpenAI o1需要对病例生成自然语言解读医生再从全面性、连贯性、准确性、有用性、无害性和结构性六个维度进行盲法评分。第三人机对账。研究部署了与医生数量相等的AI评估智能体作为平行对照组使用完全相同的病例材料和评估维度。这种配对设计使得人机评估差异得以被精确量化这在既往文献中尚无先例。三、技术原理本研究的核心设计是双轨评估框架其架构如下图所示。人类评估轨Human Evaluation Track400余位医生按年资分为初级、中级、高级三组按执业地域分为平原地区组和高原地区组每位医生对LLM输出在6个维度上进行Likert量表评分采用盲法设计医生不知晓输出来自哪个模型AI评估轨Agentic Evaluation Track部署等量的AI评估智能体智能体被配置为模拟特定医生特征年资、专科等使用相同的评估提示词和评分标准所有评估输出被记录用于一致性分析数据分析层组内一致性采用Kendall’s W系数人机一致性采用跨组比较排名稳定性通过Bootstrap重采样验证亚组分析按年资、地域、专科分层该设计的精妙之处在于它不仅回答了哪个LLM最好的问题更追问了谁的标准才算数——这一通常被AI评估研究所忽视的元问题。四、实验结果研究结果呈现出一幅远比AI赢或人类赢更为复杂的图景。发现一年资塑造评估偏好。初级医生最青睐Qwen-Max而高年资专家在连贯性、准确性和临床有用性维度上对GPT-4o和DeepSeek-R1给予更高评价。最受青睐的模型在不同年资组之间并不稳定提示临床经验的积累深刻改变了医生对AI输出的判断标准。发现二地域导致排名逆转。高原地区与平原地区医生的评估模式存在显著差异——部分模型的相对排名甚至出现方向性逆转。这一发现表明临床实践环境资源可及性、疾病谱差异、转诊模式等可能深刻影响医生对LLM生成内容的判断标准未来LLM评估研究应将执业环境作为重要的分层变量。发现三AI评估者高度自洽但与人不同。在平行评估中AI智能体在所有六个维度上均将OpenAI o1视为最优解而人类医生则更青睐DeepSeek-R1和GPT-4o。虽然人机之间存在中等程度的整体一致性Kendall’s W0.798但AI智能体在不同模拟经验水平下产生的排名高度一致76.7%而人类医生中这一比例仅为3.3%。发现四AI评估者无法捕获人类判断的异质性。人类医生的评估呈现出丰富的异质性——不同年资、不同地域、不同专科的医生有着不同的判断标准。这种异质性不是噪声而是临床多样性的真实反映。AI智能体虽然高效但输出的整齐划一恰恰暴露了其无法模拟人类临床判断结构化差异的根本局限。五、应用前景这项研究的结论对医疗AI产业有三个直接启示对AI开发者而言评估标准不可一刀切。一个在选择题基准上表现优异的模型可能在真实临床环境中被不同医生群体给出截然不同的评价。未来的医疗LLM评测应纳入多中心、多专科、多年资的医生评估而非仅依赖自动化基准测试。对医院采购决策者而言AI评估工具不应替代医生试用。本研究明确显示AI评估者与人类医生的偏好存在系统性偏差——如果医院仅凭自动化评测选择LLM产品可能选到一个AI认为好但临床医生实际用不上的系统。对AI智能体研究者而言这项研究提示了一个深层问题我们究竟希望AI评估者模拟人类平均判断还是人类判断的多样性从临床安全角度看后者才是正确答案——但当前技术显然还做不到。这也为下一代专科AI智能体的开发指明了方向不是追求一个万能评估器而是开发能够适配不同临床场景的分层评估体系DOI: 10.1038/s41746-026-02942-6。六、结论当医疗AI从能不能用走向好不好用的阶段评估问题就不再是技术问题而是认识论问题。金龙/栗荐团队的这项研究用超过400位医生的真实声音告诉我们LLM的临床价值不存在唯一答案它取决于谁来问、在哪里问、为谁而问。AI智能体可以作为高效的辅助筛选工具帮助在数以千计的LLM输出中初步分诊——但临床相关性、安全性和实用性的最终判断仍必须锚定于真实医生的多样化视角。临床评估需要的不是一个标准答案裁判而是一个能够包容并反映临床异质性的多维框架。论文原文详细信息https://www.simoagent.com/blog/2026-08-01-llm-evaluation-divergence/参考文献Shi P, Li J, Yang Z, et al. Physicians and artificial intelligence diverge in evaluating large language models on real clinical cases.npj Digital Medicine, 2026. PMID: 42393197 DOI: 10.1038/s41746-026-02942-6Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents.Nature, 2026. PMID: 42310457 DOI: 10.1038/s41586-026-10675-5Liu Y, Carrero ZI, Jiang X, et al. Benchmarking large language model-based agent systems for clinical decision tasks.npj Digital Medicine, 2026. PMID: 41708802 DOI: 10.1038/s41746-026-02443-6

相关新闻

XSS攻击与JavaScript免杀技术:水坑钓鱼攻防实战解析

XSS攻击与JavaScript免杀技术:水坑钓鱼攻防实战解析

1. 项目概述:从“水坑”到“鱼获”的攻击链剖析“水坑钓鱼”这个名字听起来有点野外生存的意味,但在网络安全领域,它描述的是一种极具针对性和隐蔽性的攻击手法。想象一下,在干旱的季节,动物们会不约而同地前往少数几个…

2026/8/2 9:23:08 阅读更多 →
LibreOffice无头模式:命令行批量转换Office文档为PDF的完整指南

LibreOffice无头模式:命令行批量转换Office文档为PDF的完整指南

1. 项目概述:为什么需要LibreOffice进行文档转换?在日常办公和文档处理中,PDF格式因其跨平台、格式固定、不易被随意编辑的特性,几乎成了文件交换和归档的“硬通货”。无论是提交报告、发布通知,还是分享设计稿&#x…

2026/8/2 9:23:08 阅读更多 →
深入理解计算机系统:程序员必备的系统思维与底层知识框架

深入理解计算机系统:程序员必备的系统思维与底层知识框架

1. 为什么这本书被奉为“神书”? 如果你在计算机专业领域待过一段时间,或者在网上搜索过“计算机专业必读书籍”,那么《深入理解计算机系统》(Computer Systems: A Programmer‘s Perspective, 简称CSAPP)这…

2026/8/2 9:23:08 阅读更多 →

最新新闻

Remio:为AI工具打造持续工作记忆,告别重复对话

Remio:为AI工具打造持续工作记忆,告别重复对话

最近在折腾各种 AI 工具时,我遇到了一个非常具体且恼人的问题:每次和 Claude、GPT 或者本地部署的模型对话,聊到项目细节、代码片段或者某个特定偏好时,都得从头解释一遍。昨天刚告诉它我的项目结构,今天再问个新问题&…

2026/8/2 10:09:27 阅读更多 →
I2C LCD驱动全解析:从协议原理到多平台实战与故障排查

I2C LCD驱动全解析:从协议原理到多平台实战与故障排查

1. 项目概述:I2C LCD的入门与精要如果你玩过单片机,尤其是像Arduino、STM32或者树莓派Pico这类开发板,大概率会接触过一种叫“LCD1602”或“LCD2004”的小屏幕。它们能显示两行或四行字符,是调试信息、状态显示的神器。但传统的并…

2026/8/2 10:09:27 阅读更多 →
AI绘画中逗号分隔问题的解决方案

AI绘画中逗号分隔问题的解决方案

1. 问题背景与核心痛点在AI绘画Web UI中使用自然语言描述生成图像时,许多用户发现一个令人困扰的现象:当输入描述中包含逗号时,系统会自动将逗号识别为标签分隔符(tag separator)。这导致原本流畅的自然语言描述被强行…

2026/8/2 10:09:27 阅读更多 →
Wazuh部署实战:Ubuntu 22.04上构建开源SIEM/XDR平台

Wazuh部署实战:Ubuntu 22.04上构建开源SIEM/XDR平台

1. 为什么现在部署Wazuh需要一份“超详细”指南?如果你最近在搜索Wazuh的安装教程,可能会发现一个现象:很多一两年前的“保姆级”教程,照着做大概率会卡在某个环节,不是依赖包版本冲突,就是配置文件格式对不…

2026/8/2 10:09:27 阅读更多 →
企业微信API报错60020排查指南:IP白名单配置与网络架构实战

企业微信API报错60020排查指南:IP白名单配置与网络架构实战

1. 项目概述:当企业微信通讯录同步“罢工”时 在企业应用集成和自动化流程中,企业微信的通讯录同步API扮演着至关重要的角色。无论是将HR系统的新员工信息自动推送到企业微信,还是将企业微信的组织架构拉取到内部CRM进行权限映射,…

2026/8/2 10:09:27 阅读更多 →
网盘直链下载助手:终极免费提速方案,8大网盘下载速度提升10倍!

网盘直链下载助手:终极免费提速方案,8大网盘下载速度提升10倍!

网盘直链下载助手:终极免费提速方案,8大网盘下载速度提升10倍! 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / …

2026/8/2 10:08:27 阅读更多 →

日新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/2 0:00:38 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/2 0:00:38 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/2 0:00:38 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/2 0:00:38 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/2 0:00:38 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/2 0:00:38 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/2 6:34:16 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/2 2:47:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/2 0:23:22 阅读更多 →