AAAI 2026 | PulseMind:面向真实临床诊断的多模态医疗模型
引言现有医疗多模态模型多聚焦于皮肤、病理或影像等单一专科图像分析难以应对真实临床中多源异构信息与多轮医患交互的复杂性。为此该团队提出了PulseMind一个整合了大规模多轮诊疗数据集MediScope、四维评估基准PulseMind Benchmark以及基于相对偏好信号的CRPO训练框架的医疗多模态诊断模型在真实诊断咨询与公开医疗基准上均展现出竞争力。基本信息文章标题PulseMind: A Multi-Modal Medical Model for Real-World Clinical Diagnosis期刊AAAI 2026研究单位大连理工大学、蚂蚁集团、北京大学、香港大学、香港城市大学Github地址https://github.com/AQ-MedAI/PulseMind论文地址https://arxiv.org/abs/2601.07344研究内容与方法数据集构建MediScope数据来源与规模从真实临床环境中采集了98,000轮多轮问诊对话涵盖10个主要临床科室和超过200个亚专科方向。共包含601,500张医学图像覆盖多种成像模态如CT、MRI、X光、超声、病理切片、皮肤镜等体现了真实临床中成像模态的高度异质性。数据结构设计每条样本以完整的医患多轮对话为基本单元而非孤立的单轮问答对。每轮对话中患者可能上传多张不同模态的图像医生则基于图像与既往对话上下文给出诊断意见或追问。对话文本与图像按时间顺序交错排列完整保留临床推理过程中的上下文依赖关系。数据特性分析科室分布呈长尾特征常见科室如内科、皮肤科样本量大罕见专科如遗传咨询样本量小但同样覆盖。多轮对话长度分布广泛从2轮到20轮以上不等平均轮数显著高于现有医疗VQA数据集。同一对话中常出现多模态图像交替上传的情况例如患者先发送皮肤照片再补充超声报告要求模型具备跨模态的信息整合能力。基准构建PulseMind Benchmark评测任务设计从MediScope中划分出独立的测试子集确保与训练集无重叠。每个测试样本包含完整的真实临床对话历史含图像要求模型在给定当前对话状态的情况下生成下一步的医生回复。评测过程要求模型主动提出追问、给出初步判断或建议检查方案而非简单的图像分类或描述。四维评测协议主动性评估模型是否能在信息不足时主动追问关键信息而非被动等待或直接下结论。准确性评估模型给出的诊断意见、检查建议与真实临床结论的一致性。实用性评估模型的回复对患者是否具有实际指导意义如用药建议、就诊科室推荐等。语言质量评估回复的流畅性、专业术语使用的恰当性以及表达的清晰度。评测执行方式采用两种评分策略绝对评分对每个维度独立打分和相对评分两个模型针对同一病例进行对比。使用GPT-4作为裁判模型同时验证了裁判评分与人类专家评分的一致性确保评测可靠性。训练框架CRPOComparison-based Reinforcement Policy Optimization阶段一多模态监督微调SFT输入表示将对话历史中的每张图像通过视觉编码器转换为视觉特征序列。文本指令与视觉特征拼接后输入语言模型以自回归方式生成医生回复。训练目标采用标准的交叉熵损失最大化真实医生回复的似然概率。在MediScope数据集上进行全参数微调使模型初步掌握多模态临床对话的基本模式。阶段二基于比较的强化学习CRPO动机分析传统的强化学习方法如GRPO依赖绝对分数作为奖励信号但绝对分数存在两个问题不同裁判的打分尺度不一致且分数本身难以精确反映回复质量的细微差异。相比之下人类专家更擅长判断“哪个回复更好”而非给出精确的绝对分数。因此CRPO将奖励建模为相对偏好信号。偏好数据构建对同一临床病例由当前模型与一个对照模型Counterpart Model分别生成回复。将两个回复与原始对话历史拼接交由GPT-4裁判进行成对比较输出“哪个回复更优”的偏好判断。偏好判断同样遵循四个评测维度但以相对比较的形式呈现。优化目标其中为被判定为更优的回复为较差的回复为奖励模型为温度系数。CRPO的优化目标为最大化偏好概率的期望策略优化其中为SFT阶段的参考策略。使用近端策略优化PPO风格的目标函数更新策略网络但将奖励替换为基于偏好的排序信号。引入KL散度约束防止策略更新过快导致语言能力退化稳定性设计与绝对分数奖励相比相对偏好信号天然具有尺度不变性不易受裁判评分漂移影响。在训练过程中定期使用SFT阶段的验证集监控策略漂移确保模型在提升诊断能力的同时不丧失通用语言能力。模型架构设计视觉编码器采用预训练的ViT-L/14作为基础视觉编码器支持224×224至448×448的输入分辨率。对每张输入图像提取patch-level特征序列并通过一个线性投影层映射到语言模型的嵌入空间。跨模态连接器使用两层感知器MLP将视觉特征序列与文本token序列对齐确保视觉信息能够被语言模型有效解读。连接器支持任意数量的图像输入通过特殊的图像边界token分隔不同图像的视觉特征。语言骨干网络基于Qwen2-VL架构采用约7B或72B参数的Transformer解码器。支持交错的图像-文本输入序列在每一层自注意力中同时处理视觉与文本token。通过旋转位置编码RoPE保持长对话历史中的位置信息。多轮对话处理机制对话历史以“用户轮”和“助手轮”交替拼接每轮前添加角色标记token。图像在对应轮次中插入模型通过因果注意力掩码确保只关注当前及之前的对话内容。训练时采用动态批处理根据对话长度自动调整批次大小以提升训练效率。实验结果分析多维度诊断对话能力对比为验证PulseMind在真实临床诊断场景中的综合能力我们在PulseMind Benchmark上与六种基线模型进行了系统对比。该基准涵盖多轮对话、多模态输入以及四维评估协议主动性、准确性、有用性、语言质量能够全面反映模型在实际诊疗交互中的表现。我们采用GPT-based自动评估框架进行评分并辅以人工专家评估验证一致性。整体胜率优势显著PulseMind在基准测试中取得了76%的平均胜率显著优于所有基线模型。其中在与通用多模态模型如InternVL系列的对比中优势尤为明显表明医学领域专用训练的必要性。各维度表现均衡且领先在四个评估维度上PulseMind均排名前两位。特别是在主动性和有用性两个维度上表现突出说明模型不仅能够准确回答患者问题还能主动追问关键信息、提供切实可行的诊疗建议更贴近真实医生的行为模式。多模态理解能力突出在涉及医学影像解读的对话轮次中PulseMind能够准确结合图像信息与文本上下文进行推理而基线模型尤其是纯文本模型在此类场景中表现明显下降凸显了多模态融合在临床诊断中的关键作用。消融实验与训练策略验证为深入分析各组件对模型性能的贡献我们设计了一系列消融实验分别验证数据集质量、训练策略以及强化学习方法的有效性。实验通过控制变量法在相同评估协议下对比不同配置的模型表现。MediScope数据集的核心作用仅使用公开数据集训练的模型PublicSFT在基准测试上的得分显著低于使用MediScope训练的模型MediScopeSFT平均得分差距超过15个百分点。这表明MediScope中真实世界多轮诊疗对话和多样化医学影像数据对于提升模型临床诊断能力至关重要。强化学习阶段的增益在SFT基础上引入强化学习阶段后模型性能进一步提升。特别是使用CRPO方法的模型MediScopeSFTCRPO在各项指标上均优于使用GRPO的模型验证了相对偏好信号相比绝对分数奖励在训练稳定性和人类对齐方面的优势。CRPO vs. GRPO的对比在相同数据和SFT条件下CRPO相比GRPO在四个维度上均取得更高得分尤其在准确性和有用性维度上提升明显分别提升3.2和2.8个百分点证实了基于成对比较的相对偏好学习机制更符合人类医生的评价方式。泛化能力与评估可靠性分析为验证PulseMind在更广泛医学场景中的泛化能力我们在11个公开医学问答数据集上进行了性能测试涵盖病理学、放射学、皮肤科等多个专科领域。同时我们对GPT-based自动评估框架与人类专家判断之间的一致性进行了验证确保评估结果的可靠性。公开基准上的竞争性表现PulseMind在11个公开医学问答数据集上均取得了有竞争力的结果其中在8个数据集上排名前两位。特别是在PathVQA和PMC-VQA等需要深度医学知识推理的任务中PulseMind的表现优于同量级的通用多模态模型展现了良好的知识迁移能力。评估框架可靠性验证在绝对评分策略下GPT评估与人类专家判断的一致性系数为0.71而在相对评分策略下一致性系数提升至0.84。这一结果验证了CRPO方法中采用相对偏好信号的设计动机——人类更擅长判断两个回答的相对优劣而非给出绝对分数同时也证明了PulseMind Benchmark评估框架的有效性。案例展示通过典型的诊断对话案例可以看出PulseMind能够主动询问病史细节、结合影像特征给出鉴别诊断并在后续轮次中根据新信息调整建议展现出类似真实医生的渐进式诊断思维。相比之下基线模型往往给出笼统或偏离主题的回答缺乏临床实用性。优势与局限优势数据规模与多样性突出MediScope包含98,000段真实多轮问诊对话和601,500张医学图像覆盖10余个临床科室与200多个亚专科支持多模态异构信息的整合贴近真实临床场景。评估框架贴近实践PulseMind Benchmark引入多轮、多模态诊断对话评估并采用GPT-based自动评估协议从主动性、准确性、有用性和语言质量四个维度全面衡量模型表现。训练方法稳定且对齐人类偏好提出的CRPO方法基于相对偏好信号而非绝对分数奖励通过多维度成对比较提供更稳定的训练指导有效提升诊断响应的可靠性和质量。局限数据来源与质量依赖人工审核尽管经过匿名化、扩展和校对但真实对话数据的噪声和标注偏差仍可能影响模型在极端或罕见病例上的表现。评估依赖自动协议GPT-based评估虽能模拟临床场景但仍可能无法完全捕捉真实医患互动中的细微语义和情感维度存在评估偏差风险。训练框架复杂度较高CRPO需要多模型对比和偏好信号构建增加了训练成本和实现难度对计算资源和工程部署要求较高。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

扫描混合件搞崩 RAG?4 步把解析拉回正轨

扫描混合件搞崩 RAG?4 步把解析拉回正轨

你以为 RAG 召回差是 Embedding 模型不行?如果喂进去的是扫描混合件——一页里图文表公式全挤在像素里——问题压根不在向量层:整条解析链路从第一步就走歪了。 我见过最离谱的一次:一份带表格的财务扫描件进库后,模型被问"Q…

2026/9/24 16:08:20 阅读更多 →
Wyn嵌入式BI实战(一):JSON API带参数接入,多租户数据源配置指南

Wyn嵌入式BI实战(一):JSON API带参数接入,多租户数据源配置指南

系列导读:本系列带你打通 JSON API 带参数数据源的全链路——从数据接入、数据准备,到仪表板/报表的参数联动。 第 1 篇(接入篇):配置带参数的 JSON API 数据源第 2 篇(准备篇):直连…

2026/9/24 1:27:40 阅读更多 →
如何在15分钟内为SAP ABAP配置专业Excel生成神器abap2xlsx

如何在15分钟内为SAP ABAP配置专业Excel生成神器abap2xlsx

如何在15分钟内为SAP ABAP配置专业Excel生成神器abap2xlsx 【免费下载链接】abap2xlsx Generate your professional Excel spreadsheet from ABAP 项目地址: https://gitcode.com/gh_mirrors/ab/abap2xlsx 还在为SAP报表导出格式单调而烦恼吗?想要在ABAP中直…

2026/9/20 18:50:08 阅读更多 →

最新新闻

OpenClaw安全排查与卸载指南:本地Agent常驻进程风险全解析

OpenClaw安全排查与卸载指南:本地Agent常驻进程风险全解析

最近后台收到不少关于 OpenClaw 的提问,问题高度统一:"我电脑上是不是装了一个叫 OpenClaw 的东西?该不该卸载?它对我的系统安全到底做了什么?"上周帮朋友排查一台 Ubuntu 服务器,发现系统里躺着…

2026/9/26 4:55:24 阅读更多 →
JS蛇簧联轴器源头厂家怎么选?选型安装维护避坑指南

JS蛇簧联轴器源头厂家怎么选?选型安装维护避坑指南

常年混迹各类机械加工厂和成套设备项目的人,应该都听过“蛇簧联轴器”这个名字。它在卷扬、破碎机、皮带机这些重载场合几乎是标配。但你真要去选一家JS蛇簧联轴器口碑好的源头厂家时,会发现水挺深的。市面上挂“源头”牌子的企业不少,真正有…

2026/9/26 4:55:24 阅读更多 →
干了五年后端,我为什么转行了

干了五年后端,我为什么转行了

提交完最后一行代码,我盯着屏幕上闪烁的光标,像是在与一位老友做最后的告别。五年前,我满怀憧憬地踏入后端开发的世界,以为找到了可以奋斗终身的职业方向。然而今天,我却要转身离开。促使我做出这个决定的,…

2026/9/26 4:55:24 阅读更多 →
内核协议解析的C++模糊测试:从环境搭建到崩溃追踪

内核协议解析的C++模糊测试:从环境搭建到崩溃追踪

1. 协议解析代码:为什么它是内核模糊测试的最佳目标1.1 协议解析器比想象中更脆弱如果你在内核开发里待过一段时间,一定见过这种场景:一段解析外部输入的代码,长度字段做了检查,边界条件好像也写了判断,单元…

2026/9/26 4:55:24 阅读更多 →
高并发缓存架构设计与性能优化

高并发缓存架构设计与性能优化

ok,话不多说直接上架构图:缓存击穿避免大量缓存失效,失效时间随机分布。单个缓存失效,并发请求,热点缓存永不过期。redis与mysql数据不一致:读写锁,canal订阅binlog。缓存穿透:布隆过…

2026/9/26 4:55:24 阅读更多 →
具身智能遇上嵌入式操作系统:实时性、异构算力与混合部署实战解析

具身智能遇上嵌入式操作系统:实时性、异构算力与混合部署实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/26 4:54:23 阅读更多 →

日新闻

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、…

2026/9/26 0:00:25 阅读更多 →
学校官网模拟全流程实践:从页面布局到后端接口与部署

学校官网模拟全流程实践:从页面布局到后端接口与部署

如果你正在找一门 Web 大作业的题目,或者刚开始接触 Web 前端开发想做点能拿来展示的东西,“学校官网模拟”几乎是最稳的选择。题目看着简单,但要把导航、新闻列表、轮播 Banner、二级页面、后台数据都串起来,其实已经把前端布局、…

2026/9/26 0:00:25 阅读更多 →
超级玛丽游戏源码C++:从零搭建横版跳跃游戏工程

超级玛丽游戏源码C++:从零搭建横版跳跃游戏工程

简介:这是一份面向游戏开发初学者与C进阶学习者的超级玛丽(超级马里奥)游戏源码,基于C面向对象编程实现,适合想通过经典项目理解游戏主循环、角色类设计、地图关卡加载与物理碰撞检测的读者参考。压缩包共49个文件&…

2026/9/26 0:00:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/25 19:27:14 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/25 20:29:09 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/25 20:29:43 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/25 20:29:31 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/25 19:27:26 阅读更多 →