IDM-VTON 数据准备指南:Detectron2 内置数据集的目录结构与 DETECTRON2_DATASETS 环境变量配置
计算机视觉深度学习媒体生成【免费下载链接】IDM-VTON[ECCV2024] IDM-VTON : Improving Diffusion Models for Authentic Virtual Try-on in the Wild项目地址https://gitcode.com/GitHub_Trending/id/IDM-VTON点击查看免费下载导读本篇技术指南聚焦于 IDM-VTON 仓库中人像解析Human Parsing预处理模块所内置的 Detectron2 框架如何组织训练与评测所需的公开数据集。仓库在preprocess/humanparsing/mhp_extension/下完整携带了一份 Detectron2 源码含docs/tutorials/builtin_datasets.md数据准备文档用于人像解析模型的训练与推理。阅读本文后你将掌握DETECTRON2_DATASETS环境变量的设置方式、COCO / PanopticFPN / LVIS / Cityscapes / Pascal VOC 五类内置数据集的精确目录结构以及如何借助仓库源码中的注册逻辑定位与校验数据路径从而为 IDM-VTON 的人像解析、DensePose 等预处理链路正确准备数据。内置数据集机制总览Detectron2 对常见公开数据集提供了开箱即用的内置支持builtin support即无需编写额外的数据加载器只要把数据集按照约定好的目录结构摆放并在环境变量DETECTRON2_DATASETS指向的根目录下组织好文件框架就能自动识别并注册这些数据。这套约定的核心证据在 builtin.py 的末尾# Register them all under ./data _root os.getenv(DETECTRON2_DATASETS, data) register_all_coco(_root) register_all_lvis(_root) register_all_cityscapes(_root) register_all_pascal_voc(_root)可以看到所有内置数据集在导入detectron2.data.datasets.builtin时即被注册数据根目录取自环境变量DETECTRON2_DATASETS若该环境变量未设置则默认使用当前工作目录下的./datasets。也就是说文档中./datasets相对当前工作目录的默认值与源码中的data兜底值一致——两者本质是同一套回退逻辑。设置数据集根目录在 Bash 环境中设置export DETECTRON2_DATASETS/path/to/datasets设置后所有内置数据集的注册路径都会拼接在该根目录之下。例如注册 COCO 的coco_2017_train时builtin.py 会通过os.path.join(root, json_file)与os.path.join(root, image_root)把根目录与相对路径组合成最终路径并调用register_coco_instances完成注册。COCO 实例检测 / 关键点检测的数据结构COCO 是 Detectron2 最核心的数据集之一支持实例检测instance detection、实例分割instance segmentation与关键点检测keypoint detection。预期目录结构如下coco/ annotations/ instances_{train,val}2017.json person_keypoints_{train,val}2017.json {train,val}2017/ # 对应 json 中提到的图片文件instances_*.json实例级标注文件用于检测与分割任务person_keypoints_*.json人体关键点标注文件用于 keypoint 任务图片目录train2017/、val2017/中存放与 json 标注对应的图片文件。同样支持 2014 版本的 COCO 数据集。从注册代码可见_PREDEFINED_SPLITS_COCO中同时预定义了 2014 与 2017 两套分片包括coco_2014_train、coco_2014_minival、coco_2017_train、coco_2017_val以及各类*_100小样本分片人体关键点任务则使用keypoints_coco_*系列分片见 builtin.py。内置测试用的小型 COCO 数据集部分内置测试dev/run_*_tests.sh使用一个微型版 COCO 数据集可通过./prepare_for_tests.sh脚本下载。这类微型分片如coco_2017_val_100、keypoints_coco_2017_val_100同样在_PREDEFINED_SPLITS_COCO中预注册便于快速验证训练与评测流程是否打通。COCO 注册的底层实现register_coco_instances是理解 COCO 数据流的关键函数定义于 register_coco.py。它完成两件事通过DatasetCatalog.register(name, lambda: load_coco_json(json_file, image_root, name))将数据集注册到目录Catalog中读取时惰性调用load_coco_json通过MetadataCatalog.get(name).set(...)写入元数据包括json_file、image_root与evaluator_typecoco供评测与可视化使用。这也解释了为什么只需要摆放好目录 设置环境变量即可使用内置数据集——路径拼接与元数据绑定都在注册阶段由框架完成。PanopticFPN全景分割的数据结构若使用 PanopticFPN 模型需要在 COCO 目录下额外准备全景分割标注以及从全景标注转换而来的语义分割标注coco/ annotations/ panoptic_{train,val}2017.json panoptic_{train,val}2017/ # png 格式的全景标注 panoptic_stuff_{train,val}2017/ # 由脚本生成的语义标注安装 panopticapi 依赖pip install githttps://github.com/cocodataset/panopticapi.git随后运行转换脚本从全景标注中提取语义标注python prepare_panoptic_fpn.py从源码看_PREDEFINED_SPLITS_COCO_PANOPTIC中coco_2017_train_panoptic这类分片的三元组分别是全景标注目录、全景 json、语义标注目录builtin.py。注册时使用register_coco_panoptic_separated该函数在 register_coco.py 中定义注册{name}_separated数据集通过merge_to_panoptic将实例标注与语义标注按file_name字段合并额外注册{name}_stuffonly纯语义分割数据集直接由load_sem_seg加载语义标注目录。需要说明的是prepare_panoptic_fpn.py与prepare_cocofied_lvis.py等脚本位于 Detectron2 上游仓库的detectron2/data/目录本仓库携带的 vendored detectron2 中未包含该脚本文件但注册代码builtin.py中明确注明了其用法可据此准备语义标注目录。LVIS 实例分割的数据结构LVIS 是一个大规模词汇表实例分割数据集其图片复用 COCO 2017 的图片标注单独存放coco/ {train,val,test}2017/ lvis/ lvis_v0.5_{train,val}.json lvis_v0.5_image_info_test.json安装 lvis-api 依赖pip install githttps://github.com/lvis-dataset/lvis-api.git运行python prepare_cocofied_lvis.py可生成cocofied版本的 LVIS 标注用于评测那些在 COCO 数据集上训练的模型此时 COCO 与 LVIS 的类别体系需要对齐。从源码看_PREDEFINED_SPLITS_LVIS同时注册了lvis_v0.5与lvis_v0.5_cocofied两套分片builtin.py其图片根目录均指向coco/train2017与coco/val2017标注则位于lvis/目录下通过register_all_lvis完成注册。Cityscapes 的数据结构Cityscapes 面向城市街景的语义分割与实例分割任务结构如下cityscapes/ gtFine/ train/ aachen/ color.png, instanceIds.png, labelIds.png, polygons.json, labelTrainIds.png ... val/ test/ leftImg8bit/ train/ val/ test/安装 cityscapes 官方脚本工具包pip install githttps://github.com/mcordts/cityscapesScripts.git其中labelTrainIds.png需要使用 cityscapesScripts 生成仅训练语义分割时需要实例分割不需要CITYSCAPES_DATASET$DETECTRON2_DATASETS/cityscapes python cityscapesscripts/preparation/createTrainIdLabelImgs.py从注册代码看Cityscapes 的注册方式与 COCO/LVIS 不同——它没有预先生成{name}: (image_root, json)映射而是在register_all_cityscapes中直接根据_RAW_CITYSCAPES_SPLITS的模板拼出训练/验证/测试三个分片并分别为实例分割load_cityscapes_instances与语义分割load_cityscapes_semantic注册两套数据集builtin.py。Pascal VOC 的数据结构Pascal VOC 检测数据集的结构如下VOC20{07,12}/ Annotations/ ImageSets/ Main/ trainval.txt test.txt # 若使用这些 split还需要 train.txt 或 val.txt JPEGImages/Annotations/存放各图片的标注 xml 文件ImageSets/Main/存放训练/验证/测试的图片名列表trainval.txt、test.txt等JPEGImages/存放图片文件。从源码看register_all_pascal_voc预注册了 2007 与 2012 两个年份的trainval、train、val、test共 8 个分片并设置evaluator_type pascal_vocbuiltin.pyregister_pascal_voc则在 pascal_voc.py 中实现。在配置中引用数据集DATASETS 配置项数据集注册完成后训练与评测配置通过DATASETS.TRAIN与DATASETS.TEST引用已注册的分片名称。相关默认值定义于 defaults.pyDATASETS.TRAIN默认空元组指定训练数据集名称列表DATASETS.TEST默认空元组指定测试/评测数据集名称列表另有PROPOSAL_FILES_TRAIN/TEST与PRECOMPUTED_PROPOSAL_TOPK_TRAIN/TEST用于预计算候选框proposal场景。例如在训练配置中写DATASETS.TRAIN: (coco_2017_train,)即可让框架从$DETECTRON2_DATASETS/coco/下读取对应数据。实际构建数据集字典时build.py 会根据cfg.DATASETS.TRAIN依次调用DatasetCatalog.get(name)获取已注册的加载函数。在 IDM-VTON 项目中的应用上下文本仓库的核心用途是虚拟试穿Virtual Try-on。其中人像解析Human Parsing是预处理的关键一环用于从模特图中提取人体部位掩码mask其代码位于preprocess/humanparsing/而本文介绍的 Detectron2含builtin_datasets.md正是该模块在preprocess/humanparsing/mhp_extension/detectron2/下携带的依赖源码。人像解析相关的训练与推理配置见preprocess/humanparsing/mhp_extension/detectron2/projects/DensePose/与configs/中的各类 yaml例如 CIHP 数据集微调配置Misc/parsing_finetune_cihp.yaml与推理配置Misc/parsing_inference.yaml。数据准备自查清单在训练或评测前建议按以下清单核对数据环境设置根目录export DETECTRON2_DATASETS/path/to/datasets或在当前工作目录下创建datasets/源码默认值。按任务摆放目录根据目标任务对照上文五类数据结构确保 json、图片、标注 png 与目录名完全一致如coco/annotations/instances_train2017.json、coco/train2017/。安装对应依赖PanopticFPN 需要 panopticapiLVIS 需要 lvis-apiCityscapes 需要 cityscapesScripts。执行转换脚本如prepare_panoptic_fpn.py生成panoptic_stuff_*语义标注、prepare_cocofied_lvis.py生成 cocofied LVIS 标注。核对配置中的数据集名确保DATASETS.TRAIN/DATASETS.TEST使用的是builtin.py中已注册的分片名称如coco_2017_train、lvis_v0.5_train、voc_2007_trainval、cityscapes_fine_instance_seg_train。快速自检可在 Python 中导入detectron2.data后调用DatasetCatalog.get(coco_2017_train)验证数据能否被正确加载。总结Detectron2 通过环境变量约定 硬编码路径注册的方式让 COCO、PanopticFPN、LVIS、Cityscapes、Pascal VOC 五类公开数据集可以被开箱即用。理解DETECTRON2_DATASETS的语义、每类数据集的精确目录结构以及builtin.py中的注册逻辑是在 IDM-VTON 人像解析模块上顺利完成数据准备与模型训练的关键前提。更多内置数据集注册细节可继续查阅 builtin.py、register_coco.py 与 pascal_voc.py。赞分享计算机视觉深度学习媒体生成【免费下载链接】IDM-VTON[ECCV2024] IDM-VTON : Improving Diffusion Models for Authentic Virtual Try-on in the Wild项目地址https://gitcode.com/GitHub_Trending/id/IDM-VTON点击查看免费下载相关推荐PDF补丁丁 PDFPatcher30 分钟给 300 页 PDF 批量生成书签、统一页面、解除打印限制PDF补丁丁 PDFPatcher30 分钟给 300 页 PDF 批量生成书签、统一页面、解除打印限制 上周五收到一份 300 页的扫描电子书左侧书签栏是桌面应用文档Detectron2 内置数据集完全指南目录结构、环境变量与准备脚本详解Detectron2 内置数据集完全指南目录结构、环境变量与准备脚本详解 导读 Detectron2 为对象检测、实例分割、全景分割Panoptic Seg人工智能计算机视觉深度学习机器学习Detectron2 内置数据集使用指南目录结构、环境变量与注册原理全解析Detectron2 内置数据集使用指南目录结构、环境变量与注册原理全解析 Detectron2 为 COCO、LVIS、Cityscapes、Pascal人工智能计算机视觉深度学习机器学习上一篇RuoYi-Vue前端路由动态路由与菜单生成下一篇JSAT模型评估与验证10个指标衡量机器学习模型性能的终极指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Mole:一条命令找回几十 GB 的 Mac 终端清理与磁盘分析工具

Mole:一条命令找回几十 GB 的 Mac 终端清理与磁盘分析工具

Mole:一条命令找回几十 GB 的 Mac 终端清理与磁盘分析工具 【免费下载链接】Mole 🐹 Clean, uninstall, analyze, optimize, and monitor your Mac. Free open-source CLI, plus a native Mac app. 项目地址: https://gitcode.com/GitHub_Trending/mol…

2026/10/3 17:28:30 阅读更多 →
NodeBB CHANGELOG 全解读:从 v1.15 到 v4.16 的六年技术演进与版本升级体系

NodeBB CHANGELOG 全解读:从 v1.15 到 v4.16 的六年技术演进与版本升级体系

后端社交即时通讯 【免费下载链接】NodeBB Node.js based forum software built for the modern web 项目地址: https://gitcode.com/gh_mirrors/no/NodeBB 点击查看 免费下载 本指南以 CHANGELOG.md(19138 行、约 110 个版本条目、926 个分类小节&…

2026/10/3 17:28:30 阅读更多 →
OpenCore 安装 macOS 11 Big Sur 完全指南:SMBIOS 兼容性、启动参数与故障排查

OpenCore 安装 macOS 11 Big Sur 完全指南:SMBIOS 兼容性、启动参数与故障排查

文档教程 【免费下载链接】OpenCore-Install-Guide Repo for the OpenCore Install Guide 项目地址: https://gitcode.com/gh_mirrors/op/OpenCore-Install-Guide 点击查看 免费下载 macOS 11 Big Sur 是苹果自 macOS 10.15 Catalina 之后的一次重大版本换代&#…

2026/10/3 17:28:29 阅读更多 →

最新新闻

从0到1自建用户增长核心系统:广告投放与全渠道触达闭环复盘

从0到1自建用户增长核心系统:广告投放与全渠道触达闭环复盘

做用户增长的人,大概都经历过这种分裂感:一边是广告投放预算花得肉疼,另一边触达工具发出去的消息用户根本不点。我在上一家公司从0到1带队搭过一套用户增长核心系统,把广告投放和全渠道触达收拢到同一个平台上,部门从…

2026/10/3 18:14:07 阅读更多 →
Maven 4 内核重构指南:从架构升级到迁移避坑全解析

Maven 4 内核重构指南:从架构升级到迁移避坑全解析

Maven 4 最近动静不小,alpha 版本一路迭代到 RC,Java 圈子里的讨论度明显上来了。这个统辖 Java 项目构建整整 15 年的老牌工具,终于要迎来一次真正意义上的"内核重构"。作为一个从 Maven 2 时代用过来的老 Java 开发,我…

2026/10/3 18:14:06 阅读更多 →
软考数据库系统工程师:关系代数核心考点与解题全攻略

软考数据库系统工程师:关系代数核心考点与解题全攻略

距离软考数据库系统工程师考试还有一段时间的时候,总有人问我:关系代数到底怎么学?教材翻来翻去就那几页,选择、投影、连接、除运算看起来也不复杂,可一到真题就懵,尤其是那些带“全部”“至少”“没有”字…

2026/10/3 18:13:06 阅读更多 →
多目标优化驱动冷热电联供系统运行:CCHP调度实战解析

多目标优化驱动冷热电联供系统运行:CCHP调度实战解析

“这个电价下,光靠燃气轮机跟吸收式溴化锂配合,很可能比不过‘电制冷燃气锅炉’的常规路子!”——这是我第一次把完整冷热电联供(CCHP)模型跑通、拿到初步帕累托前沿时,对着合伙人说的第一句话。做综合能源…

2026/10/3 18:13:06 阅读更多 →
冷热电联供系统多目标优化实战:NSGA-II建模与调参全记录

冷热电联供系统多目标优化实战:NSGA-II建模与调参全记录

做综合能源系统优化这几年,冷热电联供(CCHP)一直是我觉得最有嚼头的方向。单个设备的热力计算不难,但把燃气轮机、余热锅炉、吸收式制冷机、电制冷机、储能装置捏成一个整体,再让它同时满足冷、热、电三种负荷的需求&a…

2026/10/3 18:13:06 阅读更多 →
MySQL连接与SQL查询优化:从握手到执行计划的完整排查指南

MySQL连接与SQL查询优化:从握手到执行计划的完整排查指南

干后端这几年,MySQL 的日常工作中我听到最多的两句话,一句是“连不上数据库了”,另一句是“这条 SQL 怎么这么慢”。表面上看这是两个独立的问题,一个发生在连接阶段,一个发生在查询阶段,但如果你把从连接数…

2026/10/3 18:13:05 阅读更多 →

日新闻

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南 【免费下载链接】ex-skill 前任 skill 项目地址: https://gitcode.com/gh_mirrors/exsk/ex-skill 前任.skill 是一个运行在 Claude Code 上的开源 Skill:导入微信、iMessage、短信、…

2026/10/3 0:00:27 阅读更多 →
45个经典Linux面试题:从命令到网络排障的完整考点解析

45个经典Linux面试题:从命令到网络排障的完整考点解析

刚开始带应届生的时候,我最头疼的就是他们拿着一摞Linux面试题背得滚瓜烂熟,一上机全露馅。后来自己从被面的人变成面别人的人,才慢慢摸清楚:Linux面试题考的根本不是答案本身,而是你面对一个不确定的系统问题时&#…

2026/10/3 0:01:28 阅读更多 →
SAP生产预留实战指南:MB21/MB23/MB25协同与MRP集成

SAP生产预留实战指南:MB21/MB23/MB25协同与MRP集成

简介:本资源是一份面向SAP ABAP开发人员、生产计划专员及ERP实施顾问的实操型操作指南,聚焦SAP生产预留核心业务场景,系统解决物料预留创建、查询、校验与批量处理等高频问题。文档以结构化方式覆盖预留背景原理、OMC2编码规则、工厂级参数配…

2026/10/3 0:01:28 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/3 9:14:33 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/3 9:47:50 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/3 9:42:31 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:35 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:36 阅读更多 →