DEep MOdel GENeralization dataset(DEMOGEN):用 756 个真实训练模型研究深度网络泛化差距
人工智能深度学习NLP计算机视觉强化学习【免费下载链接】google-researchGoogle Research项目地址https://gitcode.com/gh_mirrors/go/google-research点击查看免费下载DEMOGENDEep MOdel GENeralization dataset是 Google Research 公开的一个模型泛化数据集它提供 756 个在 CIFAR-10 / CIFAR-100 上真实训练好的深度模型及其完整的训练/测试性能记录用于支撑 ICLR 2019 论文《Predicting the Generalization Gap in Deep Networks with Margin Distributions》的研究复现。读完本文你将掌握如何在当前仓库中下载并加载这批预训练模型、通过ModelConfig精确索引任意模型变体、复现论文中的 margin边际分布与 total variation总变差两类泛化指标计算以及如何批量评估模型精度来验证泛化差距实验。数据集概述什么是 DEMOGENDEMOGEN 的核心思想是把泛化研究从理论推导向实证数据集转变与其从零训练大量模型来观察它们的泛化行为不如直接提供一批已经训练完毕、覆盖多种超参数组合的模型让研究者聚焦于分析什么因素与泛化差距相关。该数据集包含756 个训练好的深度模型每个模型附带其在训练集与测试集上的完整性能记录准确率与交叉熵两个经典基准数据集CIFAR-1010 类与CIFAR-100100 类两类网络架构变体结构类似Network-in-NetworkNIN的 CNN以及ResNet-32每种模型使用不同的正则化技术与超参数设置从而在泛化行为上产生宽谱分布。正如 demogen/README.md 所述NIN 模型在 CIFAR-10 上训练后测试准确率从 60% 一直延伸到 90.5%泛化差距训练与测试准确率之差从 1% 到 35% 不等——这为研究什么预测了泛化差距提供了足够大的观测空间。变体空间覆盖实践中最常见的正则化手段DEMOGEN 的 756 个模型并不是随机生成而是围绕研究者日常最常用的调参手段系统化构建的。根据 model_config.py 中的ALL_MODEL_SPEC常量可以精确还原每个实验族的参数网格实验族变体维度取值NIN_CIFAR10宽度倍率wide_multiplier1.0 / 1.5 / 2.0批归一化batchnormTrue / FalseDropout 概率dropout_prob0.0 / 0.2 / 0.5数据增强augmentationTrue / FalseL2 权重衰减decay_fac0.0 / 0.001 / 0.005副本copy1 / 2RESNET_CIFAR10宽度倍率1.0 / 2.0 / 4.0归一化方式batch / group数据增强True / FalseL2 权重衰减0.0 / 0.02 / 0.002初始学习率0.01 / 0.001副本1 / 2 / 3RESNET_CIFAR100宽度倍率1.0 / 2.0 / 4.0归一化方式batch / group数据增强True / FalseL2 权重衰减0.0 / 0.02 / 0.002初始学习率0.1 / 0.01 / 0.001副本1 / 2 / 3这些变化手段包括不同强度的权重衰减与 dropout、是否使用批归一化ResNet 额外提供组归一化、是否使用数据增强、隐层宽度或隐藏单元数量、以及针对 ResNet 的不同初始学习率。宽泛的超参数扫描保证了数据集中模型之间存在可量化的泛化行为差异。模型目录命名即超参数索引DEMOGEN 的一个巧妙设计是每个模型的存储目录名直接编码了它的全部超参数因此无需任何数据库即可按配置精确寻址。在 model_config.py 的get_model_dir_name中可以看到两种命名规则NIN 模型目录形如NIN_CIFAR10/nin_wide_1.5x_bn_dropout_0.2_aug_decay_0.001_1各片段依次为模型类型、宽度、是否 BN、dropout 概率、是否增强、衰减系数与副本序号ResNet 模型目录形如RESNET_CIFAR100/resnet_wide_2.0x_groupnorm_aug_decay_0.002_2且仅当学习率不等于默认值 0.01 时才追加lr_xxx片段。快速上手加载与评估一个预训练模型仓库提供了开箱即用的示例脚本 example.py通过python -m demogen.example即可运行运行前需设置好数据集根目录。该脚本演示了完整的加载—推理—评估链路model_config mc.ModelConfig( model_typenin, datasetcifar10, root_dirroot_dir) load_and_run(model_config, root_dir) eval_result evaluate_model(model_config, root_dir) print(Test Accuracy: {}.format(eval_result)) print(Stored Test Accuracy: {}.format(model_config.test_stats())) print(Stored Train Accuracy: {}.format(model_config.training_stats()))其中load_and_run展示了最基本的用法由配置生成 checkpoint 路径 → 构建模型函数 → 建立 Session → 灌入输入张量 → 恢复参数 → 前向推理evaluate_model则以 batch_size500 循环 20 个 batch在 10000 张测试图上统计准确率并把实测结果与数据集自带的eval.json/train.json中的存档精度model_config.test_stats()/training_stats()进行对照。ModelConfig数据集的门面接口ModelConfig是访问整个数据集的核心入口其构造参数与前述变体空间一一对应见 model_config.py。需要留意几个实现细节model_type仅支持nin与resnetdataset仅支持cifar10/cifar100传入组合必须存在于ALL_MODEL_SPEC中否则断言失败data_format由模型类型自动决定NIN 使用HWC通道在最后ResNet 使用CHW通道在前每个模型目录下都存有train.json与eval.json通过training_stats()/test_stats()可直接读取存档的训练/测试 Accuracy 与 CrossEntropy无需自己跑一遍推理checkpoint 文件统一命名为model.ckpt-150000见 model_config.py 的CKPT_NAME常量。从底层实现看get_model_fn()会将配置转换为tf.contrib.training.HParams再交给 models/get_model.py 分发NIN 的宽度按192 × wide_multiplier计算ResNet-32 的过滤器数按16 × wide_multiplier计算、并按(32-2)/6推导出每组 5 个 block。参数恢复则通过 load_parameters 在模型 scope 内收集变量并用tf.train.Saver恢复实现。依赖与运行环境根据 requirements.txt本仓库基于TensorFlow 1.x≥1.11 且 2.0、tensor2tensor ≥ 1.11.0与 numpy数据输入层通过 tensor2tensor 的 problems 接口加载 CIFAR见 data_util.py。仓库还提供了 run.sh展示基于 Python 2 virtualenv 的完整安装运行流程virtualenv -p python2 . source ./bin/activate pip install -r demogen/requirements.txt python -m demogen.example注意代码大量使用tensorflow.compat.v1且依赖已迁移至 contrib 模块因此建议在 TensorFlow 1.x 或提供 compat 兼容层的环境中运行。计算边际分布Margin线性逼近到决策边界的距离论文的核心指标是边际分布margin distribution对每个样本测量从该样本到决策边界在指定隐层激活空间内的距离。仓库在 margin_utils.py 中实现了这一指标的线性近似其文档字符串给出了标准用法input_fn data_util.get_input( datamodel_config.dataset, data_formatmodel_config.data_format) margins compute_margin(input_fn, root_dir, model_config) input_margins margins[inputs] h1_margins margins[h1] h2_margins margins[h2] h3_margins margins[h3]compute_margin会遍历整个训练集默认dataset_size50000、batchsize50同时计算inputs、h1、h2、h3四个层的边际并存入字典返回。margin 的实现原理margin()函数margin_utils.py的计算逻辑值得细读它分四步完成构造对抗类对每个样本取 logits 的 top-2若最高分类别就是真实标签则第二高类别作为竞争类indices_c否则用最高类别。梯度方向由one_hot(labels) - one_hot(indices_c)决定——即把样本推向竞争类的方向计算分子真实类 logit 与竞争类 logit 之差values_true - values_c一次求出各层梯度用tf.gradients(logits, layer_activations, grad_ys)同时得到 logits 对inputs/h1/h2/h3四个激活的梯度归一化得距离用梯度范数支持 L2、L1 与无穷范数由dist_norm控制对分子归一化numerator / ||g||即该层激活空间下到决策边界的线性逼近距离。实现还内置了数值稳定性保护epsilon1e-6被加入梯度范数避免除零所有用于归一化的梯度都经过tf.stop_gradient截断确保只对 logits 求导而不影响梯度本身的计算。支持dist_norm为 0无穷范数、1L1、2L2其他取值会抛出ValueError。计算总变差Total Variation度量隐层响应的离散程度另一个辅助指标是总变差它刻画某个隐层在整个训练集上的响应activation分布形态由 total_variation_util.py 实现。文档字符串给出的典型用法h1_total_variation compute_total_variation(input_fn, root_dir, h1, model_config)其计算过程与 margin 类似同样支持inputs/h1/h2/h3作为layer参数但在数据收集上一次只计算一个层——注释明确说明这是出于内存限制的考虑。算法步骤如下见 total_variation_util.py遍历训练集把指定层在全部样本上的激活拼接为一个大张量将激活展平为[样本数, 特征数]沿特征维度计算标准差response_std对标准差的平方求和再开方得到未归一化的总变差最后除以样本总数完成归一化。由于总变差本质上是层响应对输入变化的敏感程度与 margin 结合使用可以分别从决策边界距离与特征响应方差两个角度刻画模型这正是论文中 margin distribution 系列分析所需的两类底层统计量。数据集下载与引用用于本代码库的完整模型数据集约15.57GB可以从 Google Cloud Storage 公开地址下载https://storage.googleapis.com/margin_dist_public_files/demogen_models.tar.gz下载地址与大小以 demogen/README.md 为准。解压后将其根目录作为ModelConfig的root_dir传入即可。该数据集源自论文《Predicting the Generalization Gap in Deep Networks with Margin Distributions》ICLR 2019作者 Yiding Jiang、Dilip Krishnan、Hossein Mobahi、Samy Bengio。若你的研究使用了这一数据集建议按论文作者给出的 BibTeX 条目引用inproceedings{ jiang2018predicting, title{Predicting the Generalization Gap in Deep Networks with Margin Distributions}, author{Yiding Jiang and Dilip Krishnan and Hossein Mobahi and Samy Bengio}, booktitle{International Conference on Learning Representations}, year{2019}, url{https://openreview.net/forum?idHJlQfnCqKX}, }同时本代码库并非 Google 官方产品README 中明确声明 This is not an official Google product使用过程中如遇问题可通过 GitHub issue 反馈。结语DEMOGEN 的价值在于把泛化差距预测这一课题从零散的独立实验沉淀为一个可复现、可检索、可批量化的研究基础设施756 个真实训练的模型覆盖了主流正则化手段的完整参数网格目录命名即超参数索引ModelConfig一行代码即可定位任意模型margin 与 total variation 工具则直接复现了论文核心指标。对于任何想要在泛化理论上做实证验证的研究者这套代码库提供了从数据到指标的完整闭环。赞分享人工智能深度学习NLP计算机视觉强化学习【免费下载链接】google-researchGoogle Research项目地址https://gitcode.com/gh_mirrors/go/google-research点击查看免费下载相关推荐如何突破大模型训练瓶颈annotated_deep_learning_paper_implementations 可扩展性研究指南如何突破大模型训练瓶颈annotated_deep_learning_paper_implementations 可扩展性研究指南 annotated_dee人工智能深度学习大模型NLP计算机视觉强化学习LoRA为什么只有语言模型被量化解读 GOT-OCR2_0-4bit 的混合精度设计智慧为什么只有语言模型被量化解读 GOT OCR2_0 4bit 的混合精度设计智慧 当我们打开 mlx community/GOT OCR2_0 4bit 这个Gradle Kotlin DSL Samples最佳实践总结避免常见陷阱的20个技巧Gradle Kotlin DSL Samples最佳实践总结避免常见陷阱的20个技巧 Gradle Kotlin DSL Samples是Gradle官方提上一篇终极指南如何用foobox美化配置打造专业级foobar2000音乐播放器下一篇终极Magicast问题解决方案从入门到精通的常见问题解决指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

树莓派跨大版本升级指南:原地升级、备份重装与双系统过渡

树莓派跨大版本升级指南:原地升级、备份重装与双系统过渡

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 11:43:10 阅读更多 →
Vue3+Vite从零创建项目到打包配置全指南

Vue3+Vite从零创建项目到打包配置全指南

简介:面向初学者的Vue3与Vite项目创建指南,以傻瓜式步骤讲解从环境准备到项目部署的完整流程,无需深厚基础即可上手,适合刚接触前端工程化、希望快速搭建项目的开发者。内容涵盖开发工具安装、项目初始化、本地服务器启动、组合式…

2026/9/20 11:42:10 阅读更多 →
Hermes记忆机制源码解析:分层设计与检索调优实战

Hermes记忆机制源码解析:分层设计与检索调优实战

1. 从“失忆”说起:Hermes 记忆机制到底在解决什么问题做过智能体开发的人大概率都经历过这种尴尬:上一轮对话里用户明明说了“我叫老张,做跨境电商的”,下一轮再问“帮我写个选品建议”,模型却像第一次见面一样&#…

2026/9/20 11:42:10 阅读更多 →

最新新闻

CANN ops-transformer FlashAttn 性能建模:D=256 下基本块 (M, N) 的选择与 Cube Bound 达成分析

CANN ops-transformer FlashAttn 性能建模:D=256 下基本块 (M, N) 的选择与 Cube Bound 达成分析

CANN ops-transformer FlashAttn 性能建模:D256 下基本块 (M, N) 的选择与 Cube Bound 达成分析 【免费下载链接】ops-transformer 本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。 项目地址: https://gitcode.com/cann/ops-t…

2026/9/21 12:04:03 阅读更多 →
VSS横向扩展指南:如何把视频AI处理规模从单机扩展到生产级

VSS横向扩展指南:如何把视频AI处理规模从单机扩展到生产级

VSS横向扩展指南:如何把视频AI处理规模从单机扩展到生产级 【免费下载链接】video-search-and-summarization NVIDIA AI Blueprint for video search and summarization (VSS) is a GPU-accelerated reference architecture for building video analytics agents wi…

2026/9/21 12:02:56 阅读更多 →
MCP Python SDK 依赖注入实战:用 `Resolve` 让工具参数脱离模型幻觉

MCP Python SDK 依赖注入实战:用 `Resolve` 让工具参数脱离模型幻觉

MCP Python SDK 依赖注入实战:用 Resolve 让工具参数脱离模型幻觉 【免费下载链接】python-sdk The official Python SDK for Model Context Protocol servers and clients 项目地址: https://gitcode.com/gh_mirrors/pythonsd/python-sdk 在 MCP&#xff08…

2026/9/21 12:02:56 阅读更多 →
Foam for VS Code 深度指南:用 Markdown + Wikilinks 构建本地优先的个人知识库

Foam for VS Code 深度指南:用 Markdown + Wikilinks 构建本地优先的个人知识库

Foam for VS Code 深度指南:用 Markdown Wikilinks 构建本地优先的个人知识库 【免费下载链接】foam A personal knowledge management and sharing system for VSCode 项目地址: https://gitcode.com/gh_mirrors/fo/foam Foam 是一款运行在 VS Code 之内的…

2026/9/21 12:02:56 阅读更多 →
Nix 1.11 发布说明深度解读:确定性构建验证、Nix 表达式预取与沙箱命名统一

Nix 1.11 发布说明深度解读:确定性构建验证、Nix 表达式预取与沙箱命名统一

Nix 1.11 发布说明深度解读:确定性构建验证、Nix 表达式预取与沙箱命名统一 【免费下载链接】nix Nix, the purely functional package manager 项目地址: https://gitcode.com/gh_mirrors/ni/nix 导读 本文基于 Nix 官方发布说明 rl-1.11.md,系…

2026/9/21 12:01:54 阅读更多 →
Torchvision 内部代码同步脚本 fbcode_to_main_sync.sh 使用指南:将 fbsync 分支变更批量落地为开源 PR

Torchvision 内部代码同步脚本 fbcode_to_main_sync.sh 使用指南:将 fbsync 分支变更批量落地为开源 PR

计算机视觉深度学习图像处理数据集 【免费下载链接】vision Datasets, Transforms and Models specific to Computer Vision 项目地址: https://gitcode.com/gh_mirrors/vi/vision 点击查看 免费下载 本篇文章围绕 scripts/README.rst 所记载的唯一实用脚本 fbcode…

2026/9/21 12:01:54 阅读更多 →

日新闻

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程 【免费下载链接】agentic-awesome-skills AAS Core is the local, agent-first control plane for complete catalog discovery, agent-owned selection, stack validation, and …

2026/9/21 0:00:01 阅读更多 →
gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析 【免费下载链接】gin-vue-admin 🚀ViteVue3Gin拥有AI辅助的基础开发平台,企业级业务AI开发解决方案,内置mcp辅助服务,内置skills管理,…

2026/9/21 0:00:01 阅读更多 →
Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

桌面应用AI 应用插件系统 【免费下载链接】Wox A cross-platform launcher that simply works 项目地址: https://gitcode.com/gh_mirrors/wo/Wox 点击查看 免费下载 全功能插件(Full-featured Plugin)是 Wox 三类插件实现方式中能力最完整的…

2026/9/21 0:00:01 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →