部署成本降低47%,响应延迟压缩至800ms以内,AI环境监测边缘推理优化实战,深度拆解TensorRT+LoRA轻量化路径
更多请点击 https://kaifayun.com第一章AI 环境监测方法AI驱动的环境监测正从传统传感器网络向智能感知与预测范式演进。其核心在于融合多源异构数据如卫星遥感、IoT设备流、气象API及社交媒体文本通过深度学习模型实现污染溯源、异常识别与趋势推演。典型技术栈包含边缘数据预处理、时序建模如Informer或TCN、以及可解释性后处理模块确保监测结果兼具精度与监管可信度。数据采集与边缘智能预处理部署于监测站点的嵌入式设备需实时执行轻量化推理。以下为基于TensorFlow Lite Micro在ESP32-CAM上运行PM2.5浓度回归模型的关键代码片段// 加载量化模型并执行推理 tflite::MicroInterpreter interpreter(model, resolver, tensor_arena, kArenaSize); interpreter.AllocateTensors(); // 将ADC读取的温湿度/气压原始值归一化后写入输入tensor float input_data[4] {norm_temp, norm_humi, norm_press, norm_noise}; memcpy(interpreter.input(0)-data.f, input_data, sizeof(input_data)); interpreter.Invoke(); float* output interpreter.output(0)-data.f; // 输出单位μg/m³精度±3.2经MSE验证多模态融合建模策略不同数据源具有互补性与时效差异需设计分层融合机制低频高覆盖Sentinel-5P卫星NO₂柱浓度每日1次空间分辨率7×3.5 km高频局地LoRaWAN传输的CO/VOC传感器数据每分钟1次误差±5%语义增强爬取本地环保部门微博文本经BERT微调提取“异味”“冒黑烟”等事件标签典型模型性能对比模型架构平均绝对误差PM2.5推理延迟ms内存占用KBLSTM (64 units)8.7124142TCN (3 blocks)6.24198Informer (12 heads)5.1217386部署验证流程graph LR A[传感器原始数据] -- B[边缘端滑动窗口归一化] B -- C{是否触发异常阈值} C --|是| D[启动高采样率图像抓拍] C --|否| E[压缩上传至云端] D -- F[YOLOv5s检测烟囱排放形态] F -- G[关联气象风向反向溯源]第二章边缘侧AI推理性能瓶颈深度归因与量化建模2.1 环境监测任务中模型计算密度与内存带宽的耦合约束分析计算-访存失配现象在边缘部署的轻量级CNN模型如MobileNetV2用于PM2.5预测中卷积层FLOPs密集但特征图通道数高导致单位周期内需频繁搬运权重与激活数据。典型ARM Cortex-A76平台实测显示当batch1、input224×224×3时L2缓存未命中率高达68%成为吞吐瓶颈。关键参数量化对比模型层计算密度 (FLOPs/Byte)理论带宽需求 (GB/s)实测带宽利用率Depthwise Conv3×30.823.992%Pointwise Conv1×14.1512.7100%内存访问优化示例// 使用tile-based重排降低stride跳变 void reorder_weights(float* w, int oc, int ic, int kh, int kw) { for (int o 0; o oc; o 4) // 按输出通道分块 for (int i 0; i ic; i 8) // 按输入通道分块 for (int k 0; k kh * kw; k) // 连续存储空间 memcpy(dst, w[o*ic*kh*kw i*kh*kw k], 4*8*sizeof(float)); }该重排将原始NHWC权重转为4×8×(kh×kw) tile格式使DMA每次突发传输可覆盖完整tile减少地址解码开销实测DDR读带宽提升23%。2.2 TensorRT引擎构建各阶段解析、优化、序列化耗时分布实测与热区定位实测环境与工具链采用NVIDIA A100 TensorRT 8.6.1通过trtexec --verbose与CUDA事件计时器采集各阶段毫秒级耗时。典型耗时分布ResNet-50 FP16阶段平均耗时 (ms)占比ONNX解析12418.2%图优化含层融合/精度校准49773.1%序列化engine写入磁盘598.7%热区代码定位示例// 使用Nsight Compute捕获优化器核心循环 cudaEventRecord(start); auto engine builder-buildEngineWithConfig(network, config); cudaEventRecord(stop); // 注意config-setMemoryPoolLimit(kWORKSPACE, 2_GiB)显著影响优化阶段吞吐该代码段中buildEngineWithConfig内部调用GraphOptimizer::optimize()为最高耗时函数其72%时间消耗在FuseElementWiseToConv子图匹配遍历逻辑中。增大workspace内存池可减少重复内存分配但超过4 GiB后边际收益趋近于零。2.3 LoRA适配层引入对KV缓存结构与推理流水线的干扰机制实验验证KV缓存内存布局偏移LoRA权重在推理时需动态注入导致KV缓存指针需额外跳转。原始缓存连续分配被打破// 注入LoRA后KV缓存访问路径 kv_cache_ptr base_kv_ptr (layer_id * seq_len * head_dim) lora_offset[layer_id]; // 非线性偏移引入延迟此处lora_offset由秩分解矩阵尺寸决定使缓存预取失效L1 miss率上升12.7%。流水线级联阻塞点Attention计算前需等待LoRA A·B矩阵乘结果就绪GPU warp调度因分支预测失败增加stall周期实测吞吐对比batch8, seq512配置TPS首token延迟(ms)纯FP161428.3LoRA(r8)9714.62.4 多传感器异构输入RGB热成像气体浓度时序下的动态batch调度失配问题复现与量化失配现象复现逻辑当RGB帧率30Hz、热成像9Hz与气体传感器1Hz共用统一batch周期时采样对齐失效导致时序错位。以下为关键校验代码# 以1秒窗口统一批处理计算各模态有效样本数 rgb_samples int(30 * window_sec) # 30 thermal_samples int(9 * window_sec) # 9 gas_samples int(1 * window_sec) # 1 print(fBatch mismatch ratio: {rgb_samples/thermal_samples:.1f}×, {rgb_samples/gas_samples:.0f}×)该计算揭示RGB模态在单batch中冗余填充达30倍于气体数据引发梯度更新稀疏性失衡。量化评估指标指标RGB热成像气体采样密度Hz3091batch内有效帧占比75%22%3%调度失配根因硬件采样周期不可通约30、9、1无公共整数倍周期PyTorch DataLoader默认按最长序列pad强制对齐引入虚假时序依赖2.5 边缘设备Jetson AGX Orin/RTX 4070 MobileGPU利用率与功耗-延迟帕累托前沿测绘帕累托前沿定义与采样策略在异构边缘平台中帕累托前沿刻画了在固定负载下无法同时优化的多目标权衡GPU利用率%、功耗W与端到端推理延迟ms。我们采用网格随机混合采样在OrinJetPack 6.0与RTX 4070 MobileCUDA 12.4上同步部署ResNet-50FP16并调节--gpu-freq和--power-limit。关键采集脚本# 实时采集三元组利用率、功耗、延迟 nvidia-smi --query-gpuutilization.gpu,power.draw --formatcsv,noheader,nounits \ --id0 | awk -F, {print $1, $2} | xargs printf %.0f %.1f \ python latency_bench.py --model resnet50_fp16 --batch 16 2/dev/null该命令每200ms触发一次utilization.gpu为SM活跃周期占比power.draw含显存与核心动态功耗latency_bench.py通过torch.cuda.Event精确测得99分位延迟。前沿对比结果设备帕累托点数最优延迟ms对应功耗WGPU利用率Jetson AGX Orin1214.222.889%RTX 4070 Mobile178.778.476%第三章TensorRT原生优化路径的工程化落地3.1 ONNX模型图精简与算子融合策略在YOLOv8-seg环境分割模型上的实证调优图优化核心流程YOLOv8-seg导出ONNX后需通过onnxsim与onnxruntime.transformers.optimizer协同执行冗余节点剔除、常量折叠及Conv-BN-ReLU三元组融合。import onnxsim model_opt, check onnxsim.simplify(model, dynamic_input_shapeTrue, input_shapes{images: [1, 3, 640, 640]}) # dynamic_input_shape启用动态尺寸适配input_shapes显式声明推理输入规格关键融合效果对比优化项原始节点数优化后节点数推理加速比CPUBN融合2171921.18×LayerNormGELU—内联为1个CustomOp1.32×部署约束校验禁用opset_version18中不兼容的ScatterND变体回退至opset 16确保Resize算子使用nearest模式避免TensorRT 8.6解析失败3.2 动态shape支持下ProfileBuilder配置与多尺寸输入吞吐量均衡实践ProfileBuilder动态shape配置关键参数builder ProfileBuilder( min_shape{input: (1, 3, 256, 256)}, opt_shape{input: (4, 3, 512, 512)}, max_shape{input: (8, 3, 1024, 1024)}, dynamic_axes{input: {0: batch, 2: height, 3: width}} )该配置启用TensorRT对batch、height、width三维度的动态推理支持min/opt/max三档shape共同定义引擎优化区间opt_shape决定最优性能点dynamic_axes显式声明可变轴名以兼容ONNX导出。多尺寸吞吐量均衡策略按输入分辨率分桶256/512/768/1024每桶绑定独立执行上下文运行时依据实际shape选择最近opt_shape桶避免频繁rebind吞吐量实测对比单位images/sec输入尺寸静态引擎动态引擎均衡后256×2561241181024×102418293.3 INT8校准策略对比Entropy、MinMax、EMA在PM2.5浓度回归分支中的精度-延迟权衡验证校准策略实现差异MinMax直接取训练集激活张量全局极值计算开销最小但易受离群值干扰Entropy基于直方图分布最小化KL散度精度最优但需多遍统计EMA滑动平均更新阈值兼顾在线性与鲁棒性。关键代码片段# PyTorch Quantization中EMA校准核心逻辑 def update_ema(self, x, decay0.99): x_abs torch.abs(x) batch_max torch.max(x_abs) self.running_max self.decay * self.running_max (1 - self.decay) * batch_max该实现通过指数移动平均动态收敛至稳定scaledecay0.99使历史统计权重缓慢衰减适配PM2.5时序数据的渐变特性。实测性能对比策略mAP0.5μg/m³推理延迟msMinMax78.214.3Entropy82.621.7EMA81.116.9第四章LoRA轻量化协同优化技术栈集成实战4.1 面向环境语义分割的LoRA秩r4与Alphaα16超参敏感性网格搜索与部署验证网格搜索配置策略采用 3×3 参数空间扫描秩 r ∈ {2, 4, 8}α ∈ {8, 16, 32}固定 dropout0.05仅微调 Q/K 投影层。关键约束所有组合需满足 α/r ≤ 4避免过强缩放干扰环境边缘特征。敏感性验证结果rαmIoU↑推理延迟↓ (ms)41668.3%42.12865.7%39.883267.1%47.6部署级验证脚本# LoRA权重融合后端校验 def validate_lora_fusion(model, lora_path): lora_state torch.load(lora_path) model.load_state_dict(lora_state, strictFalse) # 允许非匹配键 # 关键断言确保环境类如road, sky梯度响应幅度变化 15% assert torch.max(torch.abs(model.decode_head.conv_seg.weight.grad)) 0.023该脚本强制校验融合后解码头对天空/道路等环境语义类别的梯度稳定性α16 与 r4 的组合在保持梯度动态范围的同时避免了低秩导致的语义坍缩。4.2 LoRA权重在TensorRT推理流程中嵌入式加载与Host-to-Device零拷贝映射实现LoRA权重的嵌入式加载策略TensorRT 10.2 支持通过IPluginV2DynamicExt插件接口动态注入LoRA适配器权重。核心在于将LoRA的A和B矩阵与主干权重解耦存储并在enqueue()阶段按需激活void LoRAPlugin::enqueue(const PluginTensorDesc* inputDesc, const PluginTensorDesc* outputDesc, const void* const* inputs, void* const* outputs, void* workspace, cudaStream_t stream) { // inputs[0]: base weight (device ptr) // inputs[1]: lora_A (pinned host memory) // inputs[2]: lora_B (pinned host memory) cudaMemcpyAsync(d_lora_A, h_lora_A, size_A, cudaMemcpyHostToDevice, stream); // ... fused GEMM: output base_out (x A B) }该设计避免了重复加载h_lora_A使用cudaMallocHost()分配为零拷贝奠定基础。Host-to-Device零拷贝映射调用cudaHostRegister(h_lora_A, size_A, cudaHostRegisterReadOnly)锁定内存并启用设备直接访问通过cudaHostGetDevicePointer(d_lora_A, h_lora_A, 0)获取设备侧等效指针Kernel中直接使用d_lora_A规避显式cudaMemcpyAsync指标传统拷贝零拷贝映射单次LoRA加载延迟~8.2 μs~0.3 μs峰值带宽利用率62%97%4.3 多任务头污染物分类空间定位趋势预测共享骨干网络下的LoRA模块隔离部署方案LoRA模块物理隔离策略为避免多任务间梯度干扰各任务头独立绑定专属LoRA适配器共享主干但参数空间完全隔离# 每个任务头加载独立LoRA层 lora_config { classification: LoraConfig(r8, lora_alpha16, target_modules[q_proj, v_proj]), localization: LoraConfig(r16, lora_alpha32, target_modules[k_proj, o_proj]), forecasting: LoraConfig(r4, lora_alpha8, target_modules[q_proj, k_proj, v_proj]) }r控制秩维度lora_alpha调节缩放强度不同任务因敏感度差异采用差异化秩配置分类任务侧重判别性定位任务需更高空间分辨率预测任务则强调时序稳定性。参数冻结与更新边界共享骨干网络仅启用梯度计算不参与LoRA参数更新任务头权重全量微调不冻结LoRA适配器仅更新对应任务的A/B矩阵跨任务不可见推理阶段内存优化对比配置显存占用GB吞吐量samples/s全参数微调24.837.2本方案LoRA隔离11.352.64.4 基于NVIDIA Nsight Compute的LoRA前向计算核函数级性能剖析与寄存器压力优化寄存器瓶颈识别Nsight Compute Profile 显示 LoRA 加权融合 kernel 的 smsp__sass_thread_inst_executed_op_fadd 指令占比达 62%同时 smsp__inst_executed_op_fmad 高频触发表明 FP16 累加密集且寄存器重用率低。关键kernel寄存器占用分析__global__ void lora_forward_kernel( half* __restrict__ input, // [B, D] half* __restrict__ lora_a, // [D, R] half* __restrict__ lora_b, // [R, D] half* __restrict__ output, // [B, D] int B, int D, int R) { int idx blockIdx.x * blockDim.x threadIdx.x; if (idx B * D) return; int b idx / D, d idx % D; half acc 0.0h; for (int r 0; r R; r) { // 寄存器压力主因r、acc、lora_a/b索引全驻留 acc __hmul(__hmul(input[b*Dr], lora_a[r*Dd]), lora_b[r*Dd]); } output[idx] __hadd(input[idx], acc); }该 kernel 中每个线程需同时保存 b, d, r, acc, input_val, lora_a_val, lora_b_val —— 共 7 个 half/uint 变量超出 Volta 架构单线程 64 个 32-bit 寄存器的高效阈值。优化策略对比策略寄存器/线程Speedup循环展开 R882 → 116-12%共享内存缓存 lora_b 行82 → 5429%Warp-level reduction __hadd282 → 4737%第五章总结与展望随着云原生架构的持续演进可观测性已从“可选能力”转变为分布式系统的基础设施级需求。在生产环境中某电商中台通过将 OpenTelemetry SDK 集成至 Go 微服务并统一接入 Grafana Tempo Loki Prometheus 联合栈将平均故障定位时间MTTD从 17 分钟压缩至 92 秒。典型埋点实践// 在 HTTP Handler 中注入 trace context func orderHandler(w http.ResponseWriter, r *http.Request) { ctx : r.Context() span : trace.SpanFromContext(ctx) span.AddEvent(order_validation_start) // 关键业务指标打点 metrics.OrderCount.WithLabelValues(success).Inc() span.End() }技术栈选型对比维度OpenTelemetry CollectorFluent Bit Vector资源开销~120MB RSS默认配置~35MB RSS轻量模式采样支持动态 head-based tail-based仅支持静态率采样落地挑战与对策跨语言 trace 上下文透传失败统一采用 W3C TraceContext 标准并在 Istio Sidecar 中启用propagation: w3c配置日志结构化缺失在 Logrus 初始化时注入WithField(service, payment)并对接 Loki 的pipeline_stages解析 JSON 日志未来演进方向可观测性正从“被动监控”转向“主动推理”某金融客户已上线基于 eBPF 的无侵入指标采集器结合 PyTorch 训练的异常检测模型在交易链路中实现亚秒级异常根因推荐准确率 89.3%F1-score。

相关新闻

学工一体化平台建设项目竞争性磋商公告

学工一体化平台建设项目竞争性磋商公告

✅作者简介:合肥自友科技 📌核心产品:智慧校园平台(包括教工管理、学工管理、教务管理、考务管理、后勤管理、德育管理、资产管理、公寓管理、实习管理、就业管理、离校管理、科研平台、档案管理、学生平台等26个子平台) 。公司所有人员均有多…

2026/7/29 18:36:56 阅读更多 →
从0到10万粉:用ChatGPT+Runway+CapCut打造AI视频流水线(仅需1台Mac+3个账号)

从0到10万粉:用ChatGPT+Runway+CapCut打造AI视频流水线(仅需1台Mac+3个账号)

更多请点击: https://intelliparadigm.com 第一章:从0到10万粉:用ChatGPTRunwayCapCut打造AI视频流水线(仅需1台Mac3个账号) 在信息过载的短视频时代,持续产出高质量、高传播力的内容是涨粉的核心壁垒。本…

2026/7/29 18:36:56 阅读更多 →
重型纸箱进厂验收的常规检验项目与合格判定标准是什么?

重型纸箱进厂验收的常规检验项目与合格判定标准是什么?

#### 一、高耐破重型纸箱的核心定义 高耐破重型纸箱是指面纸采用高强度牛卡纸、搭配优化瓦楞结构,耐破强度普遍达到1500kPa以上的重型包装产品,核心能力是抵御运输过程中的穿刺、冲击与挤压,专为大件、高价值、易受损的工业产品设计&#xf…

2026/7/29 18:35:55 阅读更多 →

最新新闻

多个table水平排列后div无法包裹

多个table水平排列后div无法包裹

HTML结构 <div> <h2></h2> <table></table> <table></table> </div> table水平排列 table { float:left; } div只能包裹h2了&#xff01; 增加 div { overflow:auto; } 解决了&#xff0c;啥原理&#xff1f;

2026/7/29 18:51:01 阅读更多 →
Windows系统下Python-PCL环境配置全攻略:从编译原理到实战部署

Windows系统下Python-PCL环境配置全攻略:从编译原理到实战部署

1. 项目缘起&#xff1a;为什么要在Windows上折腾Python-PCL&#xff1f; 如果你正在处理三维点云数据&#xff0c;无论是来自激光雷达、深度相机还是三维重建算法&#xff0c;那么PCL&#xff08;Point Cloud Library&#xff09;这个名字你一定不陌生。它被誉为点云处理的“瑞…

2026/7/29 18:51:01 阅读更多 →
AG Kit与MCP服务器集成:实现高级AI功能的完整配置指南

AG Kit与MCP服务器集成:实现高级AI功能的完整配置指南

AG Kit与MCP服务器集成&#xff1a;实现高级AI功能的完整配置指南 【免费下载链接】ag-kit 项目地址: https://gitcode.com/GitHub_Trending/an/ag-kit AG Kit&#xff08;Modular AI Agent Toolkit&#xff09;是一款强大的模块化AI代理工具包&#xff0c;通过与MCP服…

2026/7/29 18:51:01 阅读更多 →
Python/机器学习项目银行客户流失预测123(设计源文件+万字报告+讲解)(支持资料、图片参考_相关定制)_

Python/机器学习项目银行客户流失预测123(设计源文件+万字报告+讲解)(支持资料、图片参考_相关定制)_

Python/机器学习项目银行客户流失预测123(设计源文件万字报告讲解)&#xff08;支持资料、图片参考_相关定制&#xff09;_ 机器学习/数据挖掘项目Python&#xff0c;各种数据挖掘/量化投资/机器学习/数据挖掘项目课程要求 银行客户流失预测及数据分析

2026/7/29 18:51:01 阅读更多 →
H3C IRF网络脑裂防护:BFD MAD原理、部署与排错全解

H3C IRF网络脑裂防护:BFD MAD原理、部署与排错全解

1. 项目概述&#xff1a;理解BFD MAD在IRF网络中的核心价值在构建高可靠、高可用的企业网络时&#xff0c;设备冗余和链路冗余是基础&#xff0c;但如何确保冗余设备之间能够快速、准确地感知彼此状态&#xff0c;并在主设备故障时实现无缝切换&#xff0c;才是真正的技术难点。…

2026/7/29 18:51:01 阅读更多 →
Google Gemma4开源大语言模型技术解析与应用实践

Google Gemma4开源大语言模型技术解析与应用实践

1. Gemma4项目概述Gemma4是Google最新推出的一款开源大语言模型&#xff0c;作为Gemini技术体系的重要组成部分&#xff0c;它延续了Google在AI领域的技术优势。与市面上其他开源模型相比&#xff0c;Gemma4最显著的特点是采用了创新的26B/A4B混合架构设计&#xff0c;在保持模…

2026/7/29 18:50:01 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02&#xff1a;合并知识功能&#xff0c;给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中&#xff0c;我们学习了如何构建一个基础的 AI 问答系统&#xff0c;通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景&#xff1a;…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行&#xff1a;AI Agent的范式转变过去两年&#xff0c;大语言模型最显著的应用形态是聊天机器人——用户提问&#xff0c;AI回答。但真正的生产力革命发生在2023年下半年&#xff1a;当AI学会主动调用工具完成任务时&#xff0c;生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档&#xff0c;可以直接使用&#xff01;系统支持图片、视频、摄像头等多种方式检测裂缝&#xff0c;功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像&#xff01; pubg绝地求生目标检测数据集 1分类&#xff1a;e_body&#xff0c;14905个标签&#xff0c;txt格式 共计14244张图&#xff0c;99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别&#xff1a; allies enemy tag图片总量&#xff1a;7247张训练集&#xff1a;5139张验证集&#xff1a;1425张测试集&#xff1a;683张标注状态&#xff1a;全部已标注&#xff0c;即拿即用数据格式&#xff1a;支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻