CVPR 2026 | DIQ:只用1%精选微调数据,让医学推理更高效,媲美全量数据
引言大语言模型在医疗推理中展现出巨大潜力但现有微调方法往往依赖海量标注数据不仅计算成本高昂且大量冗余、低质量的样本反而会稀释模型的临床推理能力。如何在有限数据下实现高效、精准的医学推理成为亟待解决的核心难题。近日发表于CVPR的一项研究中来自华东师范大学、MBZUAI等机构的研究团队提出了一个名为DIQDifficulty-Influence Quadrant的数据选择框架。不同于传统方法仅基于样本难度或梯度影响单一维度进行筛选DIQ创新性地将二者结合优先选取“高难度-高影响力”的样本。实验表明仅用1%的DIQ精选数据微调性能即可媲美全量数据使用10%数据时则持续超越现有基线方法为构建高效、可扩展的医学推理模型提供了全新路径。基本信息•文章标题Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data•发表时间2026年3月14日•研究单位华东师范大学、穆罕默德·本·扎耶德人工智能大学MBZUAI、莫纳什大学、上海人工智能实验室•Github地址https://github.com/mihara-bot/DIQ•论文地址https://arxiv.org/abs/2508.01450v3•算力描述所有训练在搭载4块NVIDIA A800 GPU的Ubuntu 22.04服务器上进行采用LoRA微调LoRA目标模块包含query、key、value投影LoRA秩设为8最大上下文长度为8192 tokens学习率为1×10−4并使用余弦衰减调度训练3个epoch。研究内容与方法一、医疗推理数据集预处理针对现有医疗推理数据集如Huatuo、FineMed、MedReason等进行统一格式转换将样本处理为包含问题文本、推理过程与答案的结构化数据确保后续难度评估与影响力计算的输入一致性。代码片段来自process_data.pydefprocess_medical_data(raw_data):processed_samples[]foriteminraw_data:sample{text:item[question]\nitem[reasoning],answer:item[answer]}processed_samples.append(sample)returnprocessed_samples二、DIQ框架概述DIQ是一种面向医疗推理的高效数据选择框架通过联合评估样本的难度得分与Dot影响力得分在二维空间划分象限并优先选择兼具临床复杂度与优化效用的样本实现小样本微调下的高效医疗推理。框架流程分为三步样本得分标注、象限划分、优先级选择。【DIQ框架流程图】三、难度得分计算1. 核心目的评估医疗样本的知识复杂度、推理复杂度与整体难度筛选具有临床价值的复杂推理样本。2. 实现逻辑难度分类器训练采用BiomedBERT作为基础模型在标注了知识Knowledge、推理Reasoning、整体Overall三个维度难度的医疗样本上微调每个维度难度为1-5分对应不同临床复杂度层级。代码片段来自difficulty.pydefpredict_difficulty(model,tokenizer,text):inputstokenizer(text,return_tensorspt,paddingTrue,truncationTrue)outputsmodel(**inputs)logitsoutputs.logits scorestorch.softmax(logits,dim1).tolist()[0]# 返回知识、推理、整体三个维度的得分returnscores[0],scores[1],scores[2]难度得分提取从分类器输出中选择指定维度默认选择Overall作为样本的最终难度得分公式为D(z)Dϕ(z),ϕ∈{K,R,O}D(z) D_\phi(z), \phi \in \{K, R, O\}D(z)Dϕ​(z),ϕ∈{K,R,O}其中ϕ\phiϕ为选择的难度维度K知识、R推理、O整体。代码片段来自selection.pydefget_difficulty_scores(difficulty_model,tokenizer,samples,dimensionoverall):difficulty_scores[]forsampleinsamples:k_score,r_score,o_scorepredict_difficulty(difficulty_model,tokenizer,sample[text])ifdimensionknowledge:difficulty_scores.append(k_score)elifdimensionreasoning:difficulty_scores.append(r_score)else:difficulty_scores.append(o_score)returndifficulty_scores四、Dot影响力得分计算1. 核心目的评估样本对模型验证损失的优化效用筛选能有效降低验证损失的高价值训练样本。2. 实现逻辑梯度内积计算计算每个训练样本的梯度与验证集平均梯度的内积作为Dot影响力得分公式为Dot(z)1∣Dval∣∑z′∈Dvalg(z;θ^)⊤g(z′;θ^)\text{Dot}(z) \frac{1}{|D_{val}|} \sum_{z \in D_{val}} g(z; \hat{\theta})^\top g(z; \hat{\theta})Dot(z)∣Dval​∣1​z′∈Dval​∑​g(z;θ^)⊤g(z′;θ^)其中g(z;θ^)g(z; \hat{\theta})g(z;θ^)是样本zzz在预训练模型参数θ^\hat{\theta}θ^下的梯度DvalD_{val}Dval​为验证集。高效降维优化采用随机投影降低梯度维度减少计算成本同时保留梯度排序信息确保大规模数据集下的计算效率。代码片段来自influence.pydefcompute_dot_influence(model,train_samples,val_samples,tokenizer,proj_dim4096):# 计算验证集平均梯度val_grads[]forsampleinval_samples:inputstokenizer(sample[text],return_tensorspt)outputsmodel(**inputs,labelsinputs[input_ids])lossoutputs.loss loss.backward()gradtorch.cat([p.grad.flatten()forpinmodel.parameters()ifp.gradisnotNone])val_grads.append(grad)model.zero_grad()avg_val_gradtorch.stack(val_grads).mean(dim0)# 随机投影矩阵降低梯度维度proj_matrixtorch.randn(avg_val_grad.shape[0],proj_dim)/np.sqrt(proj_dim)# 计算训练样本的Dot得分dot_scores[]forsampleintrain_samples:inputstokenizer(sample[text],return_tensorspt)outputsmodel(**inputs,labelsinputs[input_ids])lossoutputs.loss loss.backward()gradtorch.cat([p.grad.flatten()forpinmodel.parameters()ifp.gradisnotNone])# 投影后计算内积proj_gradgrad proj_matrix proj_avg_val_gradavg_val_grad proj_matrix dot_scoretorch.dot(proj_grad,proj_avg_val_grad).item()dot_scores.append(dot_score)model.zero_grad()returndot_scores五、象限划分与优先级选择1. 核心目的结合难度与影响力得分筛选兼具临床推理复杂度与模型优化效用的样本子集。2. 实现逻辑象限划分设定难度阈值τd\tau_dτd​训练集难度得分的百分位数和Dot得分中位数mdotm_{dot}mdot​将样本分为四个象限Q1高难度高影响力D(z)≥τdD(z) \geq \tau_dD(z)≥τd​且Dot(z)≥mdot\text{Dot}(z) \geq m_{dot}Dot(z)≥mdot​Q2低难度高影响力D(z)τdD(z) \tau_dD(z)τd​且Dot(z)≥mdot\text{Dot}(z) \geq m_{dot}Dot(z)≥mdot​Q3高难度低影响力D(z)≥τdD(z) \geq \tau_dD(z)≥τd​且Dot(z)mdot\text{Dot}(z) m_{dot}Dot(z)mdot​Q4低难度低影响力D(z)τdD(z) \tau_dD(z)τd​且Dot(z)mdot\text{Dot}(z) m_{dot}Dot(z)mdot​代码片段来自selection.pydefpartition_quadrants(difficulty_scores,dot_scores,tau_d0.7,m_dotNone):ifm_dotisNone:m_dotnp.median(dot_scores)# 难度阈值取tau_d对应的百分位数tau_d_valnp.percentile(difficulty_scores,tau_d*100)quadrants{Q1:[],Q2:[],Q3:[],Q4:[]}foridx,(d,dot)inenumerate(zip(difficulty_scores,dot_scores)):ifdtau_d_valanddotm_dot:quadrants[Q1].append(idx)elifdtau_d_valanddotm_dot:quadrants[Q2].append(idx)elifdtau_d_valanddotm_dot:quadrants[Q3].append(idx)else:quadrants[Q4].append(idx)returnquadrants优先级样本选择按照Q1→Q2→Q3→Q4的优先级顺序选择样本每个象限内按Dot得分降序排序若Dot得分相同则按难度得分降序排序直到达到目标样本比例rrr。代码片段来自selection.pydefselect_samples(quadrants,difficulty_scores,dot_scores,target_ratio):total_samplessum(len(q)forqinquadrants.values())target_numint(total_samples*target_ratio)selected[]# 优先级顺序Q1 Q2 Q3 Q4forq_namein[Q1,Q2,Q3,Q4]:iflen(selected)target_num:breakq_indicesquadrants[q_name]# 按Dot降序、难度降序排序sorted_indicessorted(q_indices,keylambdax:(-dot_scores[x],-difficulty_scores[x]))take_nummin(len(sorted_indices),target_num-len(selected))selected.extend(sorted_indices[:take_num])returnselected实验结果分析1. DIQ数据选择策略的总体性能表现DIQ方法在多个数据集和保留比例下均显著优于随机选择和基线方法。实验表明仅使用1%-10%的DIQ选择数据即可匹配甚至超越全量数据微调的性能。数据效率极高在FineMed数据集上仅1%的DIQ选择数据约170个样本就使Llama3.1-8B-Instruct的平均准确率AvgA达到41.46%远超全量数据训练的38.57%提升2.89个百分点。持续超越基线在Huatuo数据集上10%的DIQ选择数据约1,900个样本达到44.04%的AvgA超过所有基线方法如LESS的40.54%、Similarity的41.73%甚至优于全量数据训练的43.44%。标准任务提升显著在FineMed数据集1%保留比例下DIQ在标准任务平均准确率AvgS上达到58.14%相比全量数据训练的42.52%提升15.62个百分点。【Llama3.1-8B-Instruct在不同数据集和保留比例下的下游任务性能对比DIQ方法在多数设置下取得最佳结果】2. 临床推理质量与专家对齐评估DIQ选择的数据不仅提升了模型性能还显著改善了临床推理质量使其更贴近专家实践。通过LLM-as-a-judge评估DIQ在鉴别诊断、安全检查、证据引用三个关键维度均表现优异。数据层面质量提升DIQ-1%选择的数据子集在鉴别诊断DDx评分上达到4.39远高于全量数据剩余的3.59提升0.80证据引用EC评分4.77 vs 4.31提升0.46。模型推理对齐增强使用DIQ-1%数据训练的模型在鉴别诊断3.71 vs 3.66、安全检查3.30 vs 3.14和证据引用4.90 vs 4.75上均优于全量数据训练模型。案例验证在MedBullets-option5的临床病例中DIQ-1%训练的Qwen3-8B模型能够系统性地进行鉴别诊断DDx、安全检查SC和证据引用EC其推理过程与专家临床思维高度一致。【DIQ-1%数据与剩余数据、DIQ-1%模型与全量数据模型的临床价值对比DDx、SC、EC三个指标均按5分制评分】3. 消融实验与泛化能力验证DIQ的二维选择策略难度影响力优于任何单一维度的选择并且在不同模型规模和模型家族间展现出良好的泛化能力。二维策略优于单维度在1%保留比例下DIQ42.78% AvgA优于仅使用影响力42.67%、仅使用总体难度41.36%、仅使用知识难度41.59%和仅使用推理难度40.70%的单维度选择方法。10%保留比例下同样保持优势44.04% vs 43.16%/40.01%/41.89%/40.70%。跨模型家族泛化使用Llama3.1-8B计算的影响力分数应用于Qwen3-8B时在10%保留比例下仍取得47.62%的AvgA优于随机选择的45.51%提升2.11个百分点。跨模型规模泛化使用Qwen3-8B计算的影响力分数应用于Qwen3-14B时在1%/10%/50%保留比例下分别提升1.42/1.89/1.56个百分点应用于Qwen3-32B时提升0.45/2.41/2.64个百分点。【不同消融设置下Llama3.1-8B-Instruct的平均准确率对比DIQ在1%和10%保留比例下均优于单一维度选择方法】【使用不同来源影响力分数的DIQ在Qwen3系列模型上的下游任务性能DIQ能够跨模型规模和模型家族泛化】优势与局限优势高效数据选择DIQ通过联合评估样本难度与梯度影响仅需1%–10%的精选数据即可匹配或超越全量微调性能显著降低训练成本。临床推理对齐DIQ优先选择高难度-高影响力样本提升模型在鉴别诊断、安全检查和证据引用上的表现生成更贴近专家实践的推理过程。跨模型泛化性强DIQ在不同规模8B–32B和不同家族Llama、Qwen的模型上均有效且支持跨模型迁移和偏好学习DPO扩展。局限计算资源依赖DIQ需要为每个训练样本计算梯度内积尽管已采用随机投影降维但对大规模模型≥70B的计算开销仍需进一步验证。验证集依赖DIQ的性能受验证集大小影响较小验证集可能导致影响力估计不稳定需在成本与稳定性间权衡。跨家族迁移有限DIQ的跨家族迁移如Llama→Qwen在极低数据预算下可能表现不稳定需结合模型特定影响力或难度重加权来弥补差距。参考文献Supervised Fine-tuning (SFT) of the language backbone plays a pivotal role in adapting Vision-Language Models to specialized domains such as medical reasoning.Zhuang et al., 2025该论文提出了DIQ框架通过联合评估样本难度与梯度影响实现了仅用1%-10%精选数据即可匹配或超越全量微调性能是本研究数据高效微调策略的核心方法。Huatuogpt-o1, towards medical complex reasoning with llms.Chen et al., 2024该论文构建了大规模医学推理数据集HuatuoGPT-o1是本研究训练与评估所使用的核心数据来源之一为验证DIQ的数据选择有效性提供了基准。Lima: Less is more for alignment.Zhou et al., 2023该论文证明了少量高质量数据即可有效激发大模型的对齐能力启发了本研究“少即是多”的数据选择理念并作为DIQ框架的理论基础之一。LESS: Selecting influential data for targeted instruction tuning.Xia et al., 2024该论文提出了基于TracIn影响分数的数据选择方法LESS是本研究在实验部分对比的主要基线方法之一用于验证DIQ在医学推理场景下的优越性。Disentangling reasoning and knowledge in medical large language models.Thapa et al., 2025该论文提出解耦医学推理中的知识与推理难度是本研究DIQ框架中难度评估维度的直接来源为样本难度的多维度量化提供了方法论支持。

相关新闻

脉冲快速充磁机是什么?

脉冲快速充磁机是什么?

脉冲快充磁机是什么?① 脉冲快速充磁机利用电容器储存电能,通过充磁线圈瞬间放电产生强脉冲磁场,使永磁体一次性饱和充磁。 ② 适用于钕铁硼/铁氧体/钐钴永磁体、电机转子、扬声器磁钢、微波器件和自动产线连续充磁。 ③ 力田PFD系列电压精度…

2026/9/2 7:29:16 阅读更多 →
谷歌SEO助力出海企业精准获客

谷歌SEO助力出海企业精准获客

谷歌SEO优化对于出海型企业具有核心优势和重要性,主要体现在以下几个方面:核心优势描述技术/方法提升品牌可见度通过优化关键词排名,提高企业在谷歌搜索结果中的曝光率增强用户信任度高排名内容通常被视为更可信,有助于建立品牌权…

2026/9/3 9:55:25 阅读更多 →
Linux基础指令上

Linux基础指令上

pwd指令与linux文件结构pwd指令指令:pwd功能:查看别人所处工作目录-bash-4.2# pwd /root -bash-4.2# linux文件结构Linux的文件是一颗多叉树非叶子节点:非空目录。叶子节点:空目录或者普通文件ls指令与常用选项以及linux中的文件1…

2026/9/2 7:28:15 阅读更多 →

最新新闻

终极指南:10款高效macOS键盘增强工具提升你的工作效率

终极指南:10款高效macOS键盘增强工具提升你的工作效率

终极指南:10款高效macOS键盘增强工具提升你的工作效率 在现代数字化工作环境中,键盘是我们与电脑交互的核心工具。对于macOS用户而言,善用键盘增强工具不仅能大幅提升操作速度,还能减少鼠标依赖,让工作流程更加流畅高…

2026/9/3 10:03:12 阅读更多 →
GigaPath-Flash如何用视觉Transformer优化降低数字病理大模型算力门槛

GigaPath-Flash如何用视觉Transformer优化降低数字病理大模型算力门槛

大模型往下走,瓶颈往往是算力太贵,尤其在数字病理这类场景里,一张全切片图像动辄上万像素,直接套用常规 Vision Transformer,token 数量能把显存撑爆。GigaPath-Flash 这类命名出现,核心目标就一句话&#…

2026/9/3 10:03:12 阅读更多 →
终极macOS开发工具指南:12款开源IDE推荐

终极macOS开发工具指南:12款开源IDE推荐

终极macOS开发工具指南:12款开源IDE推荐 对于macOS开发者来说,找到合适的集成开发环境是提高工作效率的关键。serhii-londar/open-source-mac-os-apps项目汇集了众多优秀的开源macOS应用程序,其中IDE分类包含了12款功能强大的开发工具&#…

2026/9/3 10:03:12 阅读更多 →
用Python量化Billboard榜单统治力:多维度指标分析与可视化实战

用Python量化Billboard榜单统治力:多维度指标分析与可视化实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/3 10:03:12 阅读更多 →
下载工具哪家强?serhii-londar/open-source-mac-os-apps 下载器对比

下载工具哪家强?serhii-londar/open-source-mac-os-apps 下载器对比

下载工具哪家强?serhii-londar/open-source-mac-os-apps 下载器对比 你是否还在为寻找一款高效、可靠的macOS下载工具而烦恼?面对App Store中琳琅满目的下载软件,如何选择最适合自己的那一款?本文将带您深入探索serhii-londar/op…

2026/9/3 10:03:12 阅读更多 →
垂直领域目标检测实战:从数据集解构到YOLOv8模型训练与优化

垂直领域目标检测实战:从数据集解构到YOLOv8模型训练与优化

简介:本资源是面向自动驾驶、生态监测与智能安防领域的道路及野外动物目标检测专用数据集,适用于YOLO系列模型(v3/v5/v7/v8等)的目标检测算法研发与落地验证。数据集共1071张真实场景图像,覆盖昼夜光照、多视角&#x…

2026/9/3 10:02:11 阅读更多 →

日新闻

AI智能体辅助JS逆向:从V8环境搭建到补环境实战

AI智能体辅助JS逆向:从V8环境搭建到补环境实战

先别急着点开,这不是劝退文,而是想讲清楚一件事:用 AI 做逆向值不值得学?如果要用,怎么搭一套“V8 环境 AI 智能体”来提升效率。最近逆向圈、爬虫圈都在聊 AI Agent、AST 工程逆向、JS 逆向这些词,很多新手…

2026/9/3 0:00:29 阅读更多 →
安卓设备通过修改机型信息解锁游戏高帧率:原理、操作与风险指南

安卓设备通过修改机型信息解锁游戏高帧率:原理、操作与风险指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/3 0:00:29 阅读更多 →
ARM版OpenJDK 11安装部署全攻略:下载、配置与避坑指南

ARM版OpenJDK 11安装部署全攻略:下载、配置与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/3 0:00:29 阅读更多 →

周新闻

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

2026/9/3 4:22:22 阅读更多 →
数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

2026/9/3 4:22:01 阅读更多 →
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

2026/9/3 4:22:59 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/3 4:17:49 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/3 4:18:56 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/3 4:21:44 阅读更多 →