会议MICCAI年份2025英文名字CLIP-KOA: Enhancing Knee Osteoarthritis Diagnosis with Multi-Modal Learning and Symmetry-Aware Loss Functions中文译为CLIP-KOA基于多模态学习与对称性感知损失的膝骨关节炎诊断增强方法一、摘要KLKellgren-Lawrence分级是目前膝骨关节炎严重程度评价中最常用的影像学标准之一将 OA 分为KL0, KL1, KL2, KL3, KL4但是传统 KL 分级高度依赖医生经验存在明显的主观性医生间差异相邻等级难区分。论文指出特别是 KL1↔KL2这种相邻等级由于影像差异非常轻微更容易产生误判。现有深度学习方法通常采用 X-ray→CNN/Transformer→KL也就是只利用图像。作者认为KL 0–4 不只是五个数字每一级实际上还有相应的文字定义和疾病严重程度描述。因此提出 CLIP-KOA将图像信息 文本分级描述进行联合建模。同时膝关节 X 光在左右翻转以后OA 的严重程度本身不应该发生改变。所以作者进一步加入Symmetry LossConsistency Loss让 I和水平翻转后的 IH得到一致的预测结果。最终 CLIP-KOA 在五级 KOA 分类中达到 71.86% Accuracy相比标准 CLIP 69.50%提升2.36个百分点并在 KL 2 等中间等级上表现出更明显的改善。二、创新点1 将 KL 分级从“数字标签”变成“图像-文本语义匹配”传统方法通常Image→0/1/2/3/4也就是说 KL 只是一个数字类别。作者认为这种方式没有真正利用每一个 KL 等级背后的医学含义。因此使用 CLIP Image Encoder和 Text Encoder分别编码X 光影像KL 等级的文字描述。例如不是简单使用 Class2而是让模型学习类似这一等级对应怎样的关节间隙、骨赘和 OA 严重程度描述。于是模型做的实际上是 Image Embedding↔KL Text Embedding哪个文本与影像最相似就预测为哪个 KL 等级。因此相较普通 CNN模型不仅学习“KL2 是类别 2”还学习“KL2 具体代表怎样的 OA 状态”。3.2 提出 Symmetry Loss膝关节 X 光左右翻转以后 I→IH虽然解剖方向发生变化但 KL(I)KL(IH)应该成立。因此作者同时计算原图S以及翻转图SH与文本标签之间的相似度。然后分别计算交叉熵最终也就是说原图要分类正确翻转后的图也必须分类正确。3.3 提出 Consistency LossSymmetry Loss 只要求最终类别正确。但可能出现原图 P[0.1,0.1,0.7,0.08,0.02]翻转图 Q[0.01,0.20,0.45,0.30,0.04]虽然两者可能最终都预测 KL2但概率分布差异仍然很大。因此作者进一步要求 P≈Q使用Jensen-Shannon Divergence计算 LconsistencyJSD(P∣∣Q)其中 PSoftmax(S) QSoftmax(SH)于是模型不仅要预测类别相同还要预测置信度分布也尽可能相似。因此完整思想是 Prediction SymmetryDistribution Consistency三、方法1、 图像编码输入一张膝关节 X 光通过 CLIP 的 Image Encoder得到影像 embedding。作者使用的是 ViT-B/16作为图像编码器。2、文本编码KL 一共有 K5个等级。每一个等级对应一个文字描述 T{t0,t1,t2,t3,t4}这些文本经过 CLIP Text Encoder 得到对应 embedding。因此模型最终有 5个 KL 文本语义原型。4.3 Image-Text Similarity然后计算图像 embeddingxi 与不同 KL 文本 embedding tj之间的 cosine similarity于是得到S∈RN×K例如某个病例 S[0.10,0.20,0.60,0.08,0.02]则模型认为 KL2与该 X 光最匹配。因此 KL ClassificationImage-Text Matching4、水平翻转同时对图像Ii进行Horizontal Flip得到然后也经过 Image Encoder计算翻转图与五个 KL 文本之间的相似度因此每一张训练图像都会产生 S和两套预测。5、Symmetry Loss对原图 CE(S,Y)对翻转图两者加起来确保I与 IH都能预测成正确 KL。6、Consistency Loss将两个 similarity 转化为概率计算均值然后Lconsistency21DKL(P∣∣M)21DKL(Q∣∣M)也就是JSD 越小 P≈Q意味着左右翻转前后的模型预测越稳定。7、最终损失完整 Loss作者设定 λ10因此模型同时受到分类监督 正确识别KL一致性监督 翻转前后保持一致四、实验4.1 数据集作者采用公开的Knee Osteoarthritis Severity Grading Dataset包含来自 4796 participants的膝关节 X 光。最终处理后共有 8260 images所有影像统一 resize 为 224×224共五个KL等级论文并不是使用患者自己的医学报告。而是使用KL等级的标准文字描述作者利用 Kaggle 中给出的 KL grading description分别为 Grade 0–4 构造对应文本标签。所以这里的多模态实际上是 患者X光类别级KL描述而不是 患者X光患者临床报告4.2 结果五、结论作者提出CLIP-KOA用于膝骨关节炎 X 光 KL 分级。与传统 X-ray→CNN→KL不同它采用 X-rayKL文本描述建立图像-语言多模态表示。同时利用膝关节 X 光左右翻转后疾病等级应该保持不变这一先验设计 Symmetry LossConsistency Loss保证 I与IH不仅预测类别相同而且预测概率分布也保持一致。最终达到 71.86% Accuracy相比 Standard CLIP 69.50%提高 2.36%并且对于 KL2 等中间等级的分类能力明显改善。作者同时指出未来还可以继续使用更加丰富的 KOA 文本描述对不同 KL 等级进行自适应损失加权引入患者纵向数据引入真实临床文本报告进一步提高早期 KOA特别是 KL1 的识别能力。