1.工业质检的两道坎▍坎一数据各管各的现成的工业缺陷数据集几乎都窝在单一行当里。VisA、3CAD 盯着 3C 电子PKU-GoodsAD 盯着包装Real-IAD、MulSen-AD 盯着材料。覆盖面稍宽些的 VISION、MVTec AD、MMAD又卡在样本量上而且无一例外是闭集设定——类别写死测试时冒出来的缺陷一定是训练时见过的那一批。闭集上刷得再漂亮也答不了「来了个新缺陷怎么办」。▍坎二提示得靠人喂SAM 这类模型的玩法是「用户给点、给框、给掩码」。放在自然图像上没毛病可放到噪声满地的工业图上提示好不好全看操作者懂不懂这个缺陷——点歪一点带进来的就是背景噪声。后来出现的自动化方案CPT、ReCLIP、FGVP、VRP-SAM改用伪掩码或模板顶替人工代价是伪掩码自带假阳性提示质量还没法迭代优化而纯文本提示那一挂GroundingDINO、YOLO-World又把细粒度的视觉线索给丢了。工业场景与自然场景在特征空间里隔得很远硬把自然场景的知识搬过来判别边界是歪的。(a) 传统「点 / 框 / 掩码」提示 vs. 本文的精炼文图提示(b) 工业与自然场景在特征空间里的距离2.MMIOC-1M把「地基」浇出来MMIOC-1M 的体量是这样指标数值图文样本1,000,000超类Super-category14 个工业场景Scene29 个缺陷子类Sub-category351 类模态RGB 文本任务支持开集检测 / 闭集检测 / 视觉定位 / VQAMMIOC-1M 的类别骨架14 个超类 → 29 个场景 → 351 个子类摆在一起看更有说服力MMAD 8,366 张、Defect Spectrum 5,438 张、MVTec AD 5,354 张样本量最大的 Real-IAD 也才 15 万张。MMIOC-1M 是 100 万而且是唯一一个开集、闭集同时支持的工业缺陷基准。团队自己的前序工作 MMIO-80K规模是 2.2 万张、100 类。▍三层分类骨架团队没把 351 个类平铺成一排而是搭了「超类 → 场景 → 缺陷子类」三层14 个超类各自挂 1–3 个场景Metal 下面分出 Steel 和 Aluminum场景下面再挂具体缺陷比如钢带上的 broken、dirty。这么做的实际意义在于语义接近的类在嵌入空间里挨得近闭集上学出来的判别边界才有机会迁移到开集的陌生类别上。构建路线上也有取舍——先由专家筛出类别名与少量图像特征再交给 GPT-4V 做语义检索、把子类归进超类最后人工严格复核聚合结果。▍一百万张标注怎么扛下来全靠人不可能。团队只挑了 15% 做专家精细标注剩下的走「对抗式自动标注」开集支路用 GroundingDINO 抽语义向量、按 0.5 阈值筛图文配对闭集支路用 YOLOv8 出预测框和类别再用标签过滤器合并去冗最后由专家对 351 个类逐类复核、纠错接着把整个流程再跑一遍。标签校准流水线开集与闭集两条检测路线联合校准省下大量人力▍标注质量核验数字比口号管用团队从 29 个场景里随机抽 6,000 张交给三位工业检测专家把 351 类缺陷重标一遍结果如下指标数值含义Cohens k351 类0.972自动与专家类别标签一致性PrecisionIoU≥0.950.998自动标注准确率RecallIoU≥0.950.997自动标注召回率5% 标签噪声ΔAP50 −0.006351 类平均ANOVA29 个场景p 0.12各场景标注质量无系统性差异另外往 RTVPNet-S 的训练里掺 5% 随机标签噪声AP 只掉 0.006。这组数字比任何「我们标注很准」的声明都更可信。3.这个基准难在哪体量只是表象。MMIOC-1M 真正难为模型的是三件事。▍类间相似与类内差异同时存在同一块 PCB 上会挤着好几种相似却不同的缺陷布匹上看着千差万别的缺陷反倒归在同一类。判别信息本身就是含糊的。▍尺度跳变同一套模型要同时对付铁轨厘米级缺陷和 PCB微米级缺陷不同工业场景下缺陷的样子差得太远。▍长尾分布单类图像数在 [1000, 30000] 这个区间里上下浮动少数类撑起大批量、多数类样本稀疏。要在这种分布上追求均衡的检测效果并不轻松。图(a) 类别数与样本量的对比(b) 各工业缺陷类别上的覆盖优势4.RTVPNet三把武器地基有了接下来是怎么用。RTVPNet 建在 Mobile-SAM 之上把视觉定位、目标检测、视觉问答三类任务并到一起核心是三个模块。RTVPNet 框架(a) 专家辅助域投影 (b) 精炼视觉提示 (c) 文→图交互 (d) 图→文交互▍第一把专家带路的域投影思路是「找个懂行的老师带」。先在工业数据上预训练一个专家模型C2F即 YOLOv8 的 C2F 主干再把它的多尺度特征当监督信号灌进 Mobile-SAM对 Mobile-SAM 的特征做多尺度分块、随机掩码然后去重构专家特征而不是重构原始输入——这正是跟 MAE 的关键分野让 Mobile-SAM 学的是「工业域长什么样」重构误差由多尺度域优化函数 L_opt 约束。更关键的一笔是专家模型不冻结。训练中按 γ2×10⁻³ 的耦合学习率持续更新跟 Mobile-SAM 形成共同优化而不是老一套的「冻结老师、只训学生」。▍第二把把视觉提示洗干净粗粒度掩码直接拿去当提示会捎进一大堆背景噪声边界会飘。团队的办法分三步能量激活。借神经科学里的特征抑制理论构造能量函数量化每个空间位置的不确定性再用两层 MLP 滤出关键特征。稀疏采样。工业缺陷天生稀疏于是只在 patch 内挑出高于均值的像素高频信息拿到的正好是轮廓与细节顺带压掉无关特征的冗余。IoU 迭代修正。稀疏选择本身缺监督个别特征点会飘出目标区域因此再加一个检测头做回归预测用 CIoU 迭代优化特征激活效果。图精炼视觉提示可视化背景杂乱或光照突变时提示依然能贴住缺陷边缘▍第三把文图双向交互注意「双向」两个字。文 → 图Text-Visual Mutual用文本引导的多尺度最大 Sigmoid 注意力把关键词压到缺陷对应的空间位置上生成一致的文图特征图压住无关区域的响应。图 → 文Visual-Text Mutual反过来用图像特征的通道与空间维度给文本特征做相似度打分拿相似度当权重做像素级对齐给「crack」这类偏粗的文本补上空间细节。消融结果很能说明问题开集 AP 上只用文 → 图是 13.3只用图 → 文是 13.7双向都上是 17.4——不是简单相加。一句话总结 RTVPNet让通用分割模型「懂行」域投影让提示自动变干净精炼视觉提示让文字与图像互相补台双向交互。5.实测开集、闭集、LVIS、COCO▍开集场景94 个可见类 / 64 个不可见类方法APAP50参数GFLOPsYOLO-World-S12.223.377M297YOLO-UNIOW-L16.630.395M70Mamba-YOLO-World-M14.827.194M324Grounding DINO-T12.021.9172M—DOSOD-S11.422.676M15RTVP前作14.025.1131M39Qwen2.5-VL 3B15.928.13B—DefectGLM 7.2B13.824.77.2B—★ RTVPNet-S本文14.926.776M17★ RTVPNet-L本文17.430.7110M89RTVPNet-S 的 AP 比同量级的 YOLO-World-S 高 2.7 个点14.9 对 12.2参数量基本持平76M 对 77M算力却只有人家的 1/1717 对 297 GFLOPs。RTVPNet-L 把 AP50 顶到 30.7。再看 LVLM 那一栏3–8B 参数的模型表现跟 76M 的 RTVPNet-S 打个平手甚至更差——参数差了约 40 倍。所有对比方法在开集上的 mAP 都低于 20%也印证了这个基准的难度。▍闭集场景方法APAP50参数GFLOPsYOLOv8L21.938.144M165YOLO-PCB缺陷专用12.524.815M20LF-YOLO-1.2523.541.28M25YOLOv12L37.858.426M89RTVP前作33.055.9131M39Qwen3-VL 4B38.961.84B—LLaVA-OV 7B36.660.27B—★ RTVPNet-S本文36.760.776M17★ RTVPNet-L本文41.364.9110M89长尾分布下 RTVPNet 依然是 SOTARTVPNet-S 的 AP 比 YOLOv8L 高出近 15 个点RTVPNet-L 的 AP5064.9也压过了 Qwen3-VL 4B 的 61.8。▍泛化到通用基准LVIS 与 COCO把专家模型换成 YOLOv11s、在 Objects365 上预训练RTVPNet 在 LVIS 上的 AP 达到 25.2高于 YOLO-World-v1 的 23.5加上 GoldG 后升到 29.4超过 Grounding-DINO-T25.6与 Mamba-YOLO-World-S27.7。闭集方面COCO 上 RTVPNet(YOLOv11s) 为 48.2 AP对比同主干 YOLOv11-S 的 46.9大版本 54.2对比 YOLOv11-L 的 53.3。这说明精炼提示与文图交互的收益并不只在工业域里成立。联系我们有课设/论文指导需求或图像算法开发、商务合作欢迎联系并注明来意。