人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载PP-HGNetHigh Performance GPU Net是 PaddleCV 团队为 NVIDIA GPU 平台设计的图像分类骨干网络本指南以其在 benchmark_en.md 中定义的训练与推理 Benchmark 评测流程为核心结合仓库内模型配置、下载清单与推理部署实现完整说明评测环境、数据集、指标口径与复现路径。读完本文你将掌握 PP-HGNet 系列模型的延迟评测标准V100 TensorRT FP32、ImageNet1k 精度基准以及从 whl 推理、FastDeploy 部署到 PPCV 配置化推理的完整验证方案。1. 模型背景为什么 PP-HGNet 值得做 Benchmark根据 info.yaml 的描述PP-HGNet 是面向 Nvidia GPU 端的高性能卷积神经网络A High-performance Convolutional Neural Network for Nvidia GPU任务类型为图像分类Image Classification评测数据集为 ImageNet1k模型源自 PaddleClas 仓库License 为 Apache 2.0。PP-HGNet 英文介绍 进一步说明其设计动机作者系统分析了当前对 GPU 友好的网络结构尽可能使用计算密度最高的 3×3 标准卷积以 VOVNet 为基线引入可学习下采样层LDS Layer融合 ResNet_vd、PPHGNet 等模型优势。结论是在相同延迟下PP-HGNet 相比其他 SOTA 模型精度更高在相同精度下其延迟远小于主流 VisionTransformer 模型。理解这个设计背景对读懂 Benchmark 至关重要——PP-HGNet 的评测指标延迟 精度正是围绕GPU 上延迟受限场景这一核心诉求设计的。2. 训练 Benchmark基于 PaddleClas-TIPC 的评测流程根据 benchmark_en.md 第 1 节PP-HGNet 系列模型的训练 Benchmark 评测流程参考 PaddleClas-TIPCTest Infrastructure and Pipeline for CI中的 benchmark 训练文档训练 Benchmark 的核心是衡量在固定训练配置batch size、学习率策略、迭代轮数、分布式策略等下模型在目标硬件上的吞吐samples/s与收敛精度评测过程按 PaddleClas-TIPC 的基准训练规范执行包括环境准备、数据准备、训练启动、日志解析与指标汇总等标准步骤PP-HGNet 系列模型基于 PaddleClas 实现因此训练、评估与推理的完整细节均以 PaddleClas 的 PP-HGNet 模型文档为准。需要说明的是训练 Benchmark 与推理 Benchmark 是两套独立口径前者关心训练侧的吞吐与收敛后者关心部署侧的延迟两者环境与指标定义均不相同评测时不应混用。3. 推理 Benchmark评测环境与数据集口径推理 Benchmark见 benchmark_en.md 第 2 节的硬性评测条件是硬件平台NVIDIA® Tesla® V100且开启 TensorRT 引擎加速精度类型FP32不做 INT8/FP16 量化保证精度基准的通用可比性数据集ImageNet1k validation 数据集50000 张验证图片评估 Top-1/Top-5 分类精度。这一环境口径在 introduction_en.ipynb 的 Notes 一节被再次重申The test machine is NVIDIA® Tesla® V100, the TensorRT engine is turned on, and the precision type is FP32.——两次文档互相印证说明该评测条件是该系列模型所有官方延迟数据的统一前提。任何复测或横向对比都必须先对齐这一环境基线否则延迟数据不可直接比较。4. 推理延迟指标官方基准数据表benchmark_en.md 第 2.3 节给出了 PP-HGNet 系列 5 个模型在 V100 TensorRT FP32 下的推理延迟单张图片推理耗时单位 msModelLatency(ms)PPHGNet_tiny1.77PPHGNet_tiny_ssld1.77PPHGNet_small2.52PPHGNet_small_ssld2.52PPHGNet_base_ssld5.97从数据可以看出两个规律同一规格下是否使用 SSLD 蒸馏不影响推理延迟——tiny与tiny_ssld均为 1.77mssmall与small_ssld均为 2.52ms。这是因为 SSLDSemi-supervised Large-scale Distillation知识蒸馏策略只改变模型权重精度提升不改变网络结构因此部署时计算量、参数量与延迟保持一致延迟随模型规格近似线性增长tiny1.77ms→small2.52ms→base5.97ms规格越大延迟越高为按算力预算选型提供了直接依据。5. 精度基准同一评测条件下补充 Top-1/Top-5 指标虽然 benchmark_en.md 的指标表只列出延迟但同一评测环境下ImageNet1k validation的精度数据在 introduction_en.ipynb 中完整给出二者组合才是完整的 Benchmark 结果ModelTop-1 Acc(%)Top-5 Acc(%)Latency(ms)PPHGNet_tiny79.8395.041.77PPHGNet_tiny_ssld81.9596.121.77PPHGNet_small81.5195.822.52PPHGNet_small_ssld83.8296.812.52PPHGNet_base_ssld85.0097.355.97_ssld后缀代表使用 SSLD 蒸馏策略后的模型。对比可见SSLD 蒸馏带来的精度收益显著tiny提升约 2.1 个点79.83 → 81.95small提升约 2.3 个点81.51 → 83.82且完全免费——不增加任何推理延迟这正是 PP-HGNet 系列推荐使用 ssld 版本的原因。5.1 与主流模型同延迟横向对比为了说明GPU 友好的设计目标introduction_en.ipynb 给出了 V100 TensorRT FP32 条件下与主流模型的对比选取关键行ModelTop-1 Acc(%)Latency(ms)ResNet3474.571.97EfficientNetB077.381.96PPHGNet_tiny79.831.77ResNet5076.502.54ResNet50_vd79.122.60SwinTransformer_tiny81.26.59PPHGNet_small81.512.52PPHGNet_small_ssld83.822.52SwinTransformer_base85.213.53PPHGNet_base_ssld85.005.97解读要点与 ResNet341.97ms相比PPHGNet_tiny1.77ms延迟更低、Top-1 精度高 5 个点以上与 ResNet502.54ms相比PPHGNet_small2.52ms几乎相同的延迟下 Top-1 高约 5 个点ssld 版本83.82比 ResNet50 高约 7.3 个点与 SwinTransformer_tiny6.59ms相比PPHGNet_small_ssld2.52ms延迟仅为前者的约三分之一精度反而更高与 SwinTransformer_base13.53ms相比PPHGNet_base_ssld5.97ms精度接近85.00 vs 85.2延迟不到一半。这些对比印证了文档中的结论在同延迟下 PP-HGNet 精度超越其他 SOTA CNN相比 SwinTransformer 快 2 倍以上且精度更高——但注意这是基于 V100 TensorRT 特定环境下的官方自测数据在不同硬件/推理引擎上相对关系可能变化。6. 复现与验证仓库内可用的实测路径Benchmark 数据需要在真实环境复现才有参考价值。本仓库围绕 PP-HGNet 提供了多条可实际运行的推理链路可用于验证上述延迟与精度指标6.1 模型权重获取download_en.md 列出了全部 5 个模型的下载清单每个模型均提供**推理模型Inferencepdmodel/pdiparams与预训练权重Pretrained.pdparams**两种产物输入尺寸统一为 224ModelIntroductionInput sizePPHGNet_tinyImage classification224PPHGNet_tiny_ssldImage classification224PPHGNet_smallImage classification224PPHGNet_small_ssldImage classification224PPHGNet_base_ssldImage classification224复现推理 Benchmark 时请下载对应模型的 Inference 版本推理模型包含推理时所需的模型结构与参数文件。6.2 方式一PaddleClas whl 快速推理这是最快的验证路径来自 introduction_en.ipynb 的 Quick Start。先按环境安装 PaddlePaddle# 有 CUDA9/10/11 的 GPU 环境 pip install paddlepaddle-gpu # 无 GPU 环境 pip install paddlepaddle然后安装并调用 paddleclaspip install paddleclas paddleclas --model_namePPHGNet_small --infer_imgs./whl_demo.jpg官方示例输出whl_demo.jpgclass_ids: [8, 7, 86, 82, 81], scores: [0.71479, 0.08682, 0.00806, 0.0023, 0.00121], label_names: [hen, cock, partridge, ruffed grouse, partridge, Bonasa umbellus, ptarmigan], filename: docs/images/inference_deployment/whl_demo.jpg Predict complete!--model_name可替换为 PPHGNet_tiny、PPHGNet_tiny_ssld、PPHGNet_small_ssld、PPHGNet_base_ssld 等模型名即可逐一体验各规格模型的分类效果。6.3 方式二FastDeploy 高性能部署如需在部署环境复测延迟TensorRT 场景fastdeploy_en.md 给出了 FastDeploy 的三步部署流程安装 FastDeploy 预编译包GPU 版默认已具备 CUDA ≥ 11.2 的 GPU 环境安装源为 PaddlePaddle 官方 FastDeploy 预编译 wheel 索引获取 FastDeploy 仓库中的 paddleclas 分类部署示例代码下载PPHGNet_tiny_ssld_infer推理模型与一张 ImageNet 测试图片下载入口见 download_en.md 对应模型行执行推理# CPU 推理 python infer.py --model PPHGNet_tiny_ssld_infer --image ILSVRC2012_val_00000010.jpeg --device cpu --topk 1 # GPU 推理 python infer.py --model PPHGNet_tiny_ssld_infer --image ILSVRC2012_val_00000010.jpeg --device gpu --topk 1 # GPU TensorRT 推理首次运行会序列化模型耗时较长需耐心等待 python infer.py --model PPHGNet_tiny_ssld_infer --image ILSVRC2012_val_00000010.jpeg --device gpu --use_trt True --topk 1 # IPU 推理首次运行同样有序列化耗时 python infer.py --model PPHGNet_tiny_ssld_infer --image ILSVRC2012_val_00000010.jpeg --device ipu --topk 1运行完成后的示例输出PPHGNet_tiny_ssld cpu_label: 153, cpu_score: 0.536040 ipu_label: 153, ipu_score: 0.536039 PPHGNet_tiny_ssld注意官方延迟 Benchmark 对应的是--device gpu --use_trt True的 TensorRT 路径FP32复测延迟时请务必以该路径为准。6.4 方式三PPCV 配置化推理仓库内置本仓库的 PPCV 工具链也为 PP-HGNet 提供了开箱即用的推理配置。查看 PP-HGNet.yml 可以看到完整的预处理与后处理流水线MODEL: - ClassificationOp: name: cls param_path: paddlecv://models/PPHGNet_small_infer/inference.pdiparams model_path: paddlecv://models/PPHGNet_small_infer/inference.pdmodel batch_size: 8 PreProcess: - ResizeImage: resize_short: 256 - CropImage: size: 224 - NormalizeImage: scale: 0.00392157 mean: [0.485, 0.456, 0.406] std: [0.229, 0.224, 0.225] order: channel_num: 3 - ToCHWImage: - ExpandDim: axis: 0 PostProcess: - Topk: topk: 5 class_id_map_file: paddlecv://dict/classification/imagenet1k_label_list.txt该配置使用的正是 PPHGNet_small 的推理模型PPHGNet_small_infer预处理参数resize_short256、center crop 224、ImageNet 均值/方差归一化与 PaddleClas 官方评测口径一致输入通道数为 3后处理输出 Top-5 结果并映射 ImageNet1k 标签。可通过 GETTING_STARTED.md 中记录的 predict 命令直接运行python -u tools/predict.py --configconfigs/single_op/PP-HGNet.yml --inputdemo/ILSVRC2012_val_00020010.jpegPPCV 还配套了单元测试 test_classification.py通过ConfigParser解析配置后调用分类算子分别以单图与双图 batch 输入验证算子输出可作为配置正确性的自动化校验参考。此外APP/app.py 提供了基于 Gradio 的在线演示应用封装PaddleClas(model_namePPHGNet_tiny)推理配合 app.yml 的 CPU 环境声明可快速搭建交互式分类 Demo 用于功能验证。7. 评测注意事项与适用前提环境强绑定所有官方延迟数据均基于 NVIDIA Tesla V100 TensorRT 引擎 FP32 精度。更换 GPU 型号、推理引擎如改用 Paddle Inference、ONNX Runtime或精度FP16/INT8后延迟与精度数据都会变化不可直接套用本基准数据集口径精度指标基于 ImageNet1k validation 全量验证集复测时应使用同一数据集版本与预处理流程224×224 resize/crop 参数与上述 PPCV 配置一致蒸馏模型延迟等同ssld 版本与基础版延迟一致选型时可直接优先选择 ssld 权重以获得免费精度提升训练 Benchmark 另设口径训练吞吐与收敛性评测请遵循 PaddleClas-TIPC 的 benchmark 训练流程与本文推理延迟口径相互独立不要混用。综上所述PP-HGNet 的 Benchmark 体系以V100 TensorRT FP32 ImageNet1k validation为统一评测基线通过延迟-精度双指标展示了其面向 GPU 场景的高性价比特性仓库内从权重下载、PaddleClas whl、FastDeploy 到 PPCV 配置化推理的多条链路均可作为复现与验证该基准的落地手段。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐closure-compiler与星际飞船技术突破优化工程Web应用closure compiler与星际飞船技术突破优化工程Web应用 在Web开发领域性能优化是永恒的追求。就像星际飞船需要最先进的引擎技术突破物理极限W人工智能深度学习计算机视觉NLP语音PaddleClas PP系列骨干网络终极对比PP-HGNet、PP-LCNet、PP-LCNetV2性能深度解析PaddleClas PP系列骨干网络终极对比PP HGNet、PP LCNet、PP LCNetV2性能深度解析 PaddleClas是飞桨 PaddleP人工智能深度学习计算机视觉PP-HGNet 图像分类模型 FastDeploy 高性能部署实战CPU、GPU、TensorRT 与 IPU 全流程指南PP HGNet 图像分类模型 FastDeploy 高性能部署实战CPU、GPU、TensorRT 与 IPU 全流程指南 本篇技术指南围绕 PaddleP人工智能深度学习计算机视觉NLP语音上一篇OpenCL-Headers配置秘籍CL_TARGET_OPENCL_VERSION宏的终极应用指南下一篇终极指南如何用Glow在终端优雅渲染Markdown文档创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考