为什么你的LLM推理能耗超标210%?——GPU利用率、内存带宽与精度冗余的隐性耦合陷阱
更多请点击 https://kaifayun.com第一章LLM推理能效危机的根源诊断大型语言模型LLM在实际部署中正面临日益严峻的推理能效危机——单位token生成所消耗的能量呈指数级增长远超摩尔定律的优化节奏。这一现象并非单一技术瓶颈所致而是由模型架构、硬件适配与系统调度三重耦合失衡共同驱动。计算密度与内存带宽的严重错配现代GPU的FP16算力可达每秒数百TFLOPS但HBM带宽仅约2 TB/s。这意味着模型权重加载成为关键瓶颈。以Llama-3-70B为例全精度加载需约140 GB显存推理时若未启用PagedAttention或KV Cache量化频繁的显存读写将导致GPU计算单元空转率超过65%。注意力机制的计算冗余放大效应标准Transformer解码阶段的自注意力计算复杂度为O(n²)其中n为上下文长度。当输入长度达32k时单次token生成的KV缓存访问量激增至数百万次而实际有效信息占比不足5%。以下Python伪代码揭示了未剪枝注意力的低效本质# 模拟未优化的注意力权重计算仅示意逻辑 import torch q, k, v torch.randn(1, 8, 32768, 128) # batch1, heads8, seq32k, dim128 attn_scores torch.einsum(bhqd,bhkd-bhqk, q, k) # O(n²) 内存与计算爆炸点 # 注此处生成32k×32k矩阵约4GB FP16但后续softmax仅保留稀疏有效路径软硬件协同设计的结构性断层当前主流推理框架如vLLM、TGI仍基于通用CUDA抽象构建缺乏对新型存算一体芯片如Groq LPU、Cerebras CS-3的原生支持。下表对比不同硬件平台在相同7B模型上的能效表现平台tokens/sec/WKV缓存压缩率动态批处理支持A100 (PCIe)0.821.0×✓H100 (SXM)1.351.2×FP8 KV✓Groq LPU4.713.8×定制量化✗静态批能耗归因的关键路径显存数据搬运占总能耗的58–73%依据MLPerf Inference v4.0实测非线性激活SiLU、RMSNorm引入额外访存与计算开销未对齐的Tensor Core利用率导致SM单元平均负载低于40%第二章GPU计算单元的隐性空转与动态调度优化2.1 GPU SM利用率与计算图拓扑结构的耦合建模SM资源竞争与算子调度粒度GPU流式多处理器SM的寄存器、共享内存与 warp 调度单元需协同适配计算图中节点的并行度与数据依赖。粗粒度算子如全连接层易引发 SM 资源碎片化而细粒度 kernel如逐元素激活则加剧 warp divergence。动态拓扑感知调度策略# 基于计算图邻接矩阵与SM容量约束的轻量级调度权重 def compute_sm_weight(node, sm_capacity): # node.flops: 预估浮点运算量node.mem_bw: 内存带宽需求 return node.flops / (sm_capacity.compute 0.3 * sm_capacity.memory)该函数将算子计算强度与SM硬件能力映射为调度优先级系数0.3经验性平衡计算与访存瓶颈。关键耦合指标对比指标SM利用率影响因子计算图拓扑敏感性节点入度中高影响同步等待最长路径长度低极高决定流水线深度2.2 基于CUDA Graph的细粒度内核融合实践图构建与执行优化CUDA Graph 将多个独立 kernel、内存拷贝及同步操作封装为静态执行图消除主机端调度开销。需先捕获运行时行为再实例化可复用图对象cudaGraph_t graph; cudaGraphCreate(graph, 0); cudaGraphNode_t node1, node2; cudaKernelNodeParams kparams1{}, kparams2{}; // ... 配置 kernel 参数 cudaGraphAddKernelNode(node1, graph, nullptr, 0, kparams1); cudaGraphAddKernelNode(node2, graph, node1, 1, kparams2); cudaGraphInstantiate(graphExec, graph, nullptr, nullptr, 0);此处kparams1和kparams2分别指定 kernel 函数指针、网格/线程配置及参数地址node1表示依赖关系确保顺序执行。融合边界控制细粒度融合需权衡寄存器压力与并行度。下表对比不同融合策略的资源占用融合方式SM 利用率寄存器/线程延迟隐藏能力全融合单 kernel82%128中分组融合2 kernel91%64高2.3 批处理动态分片与请求感知的SM分配策略动态分片触发机制当批处理负载波动超过阈值时调度器实时重划分数据块并迁移任务。核心逻辑基于GPU SM利用率与请求延迟双指标联合判定def should_repartition(peak_sm_util, p95_latency_ms, threshold0.75): # peak_sm_util: 当前最高SM占用率0.0–1.0 # p95_latency_ms: 请求95分位延迟毫秒 return peak_sm_util threshold or p95_latency_ms 120该函数避免过早分片仅在资源争抢或SLA风险时触发。SM分配决策表请求类型优先级最小SM数弹性上限推理低延迟高28训练吞吐导向中416执行流程采集每SM的活跃Warp数与内存带宽饱和度按请求QoS等级加权聚合资源需求采用贪心匹配算法将分片绑定至最优SM子集2.4 Tensor Core利用率瓶颈的量化归因分析含Nsight Compute实测案例关键指标捕获命令ncu -k GEMM.* --set full --metrics sm__inst_executed_pipe_tensor_op_hmma.sum,sm__sass_thread_inst_executed_op_hmma_pred_on.sum,sm__cycles_elapsed.avg -o gemm_profile ./model_inference该命令启用Hopper架构下Tensor Core专属指标前者统计HMMAs指令发射总数后者仅统计实际执行predicated-on的HMA指令数比值低于0.95即表明存在warp级masking或数据依赖阻塞。典型瓶颈分布瓶颈类型NCU指标特征占比实测寄存器压力sm__inst_executed_pipe_tensor_op_hmma.sum / sm__inst_executed_pipe_tensor_op_hmma.max_rate 0.7841%内存带宽饱和l1tex__t_bytes.sum / sm__cycles_elapsed.avg 1200 B/cycle33%归因验证流程运行Nsight Compute生成.ncu-rep报告提取sm__inst_executed_pipe_tensor_op_hmma.sum与sm__cycles_elapsed.avg比值交叉比对sm__warps_launched与sm__warps_active波动曲线2.5 多实例GPUMIG切片下的能效-吞吐帕累托前沿调优MIG切片将A100/A800/H100等GPU物理资源划分为多个独立、隔离的计算单元每个实例拥有专属显存、缓存与计算单元。调优目标是在固定功耗约束下最大化有效吞吐如tokens/sec或images/sec或在满足SLA延迟前提下最小化单位吞吐能耗J/token。典型MIG配置与能效权衡MIG ProfileSMsMem (GB)Peak TFLOPS (FP16)Typical Power (W)1g.5gb7514.2~252g.10gb141028.4~453g.20gb212042.6~70运行时动态切片策略# 启用MIG并创建3个1g.5gb实例 nvidia-smi -i 0 -mig 1 nvidia-smi mig -i 0 -cgi 1g.5gb -C nvidia-smi mig -i 0 -cgi 1g.5gb -C nvidia-smi mig -i 0 -cgi 1g.5gb -C该命令序列启用MIG模式并为GPU 0 创建三个完全隔离的1g.5gb实例-C表示启用计算能力每个实例获得独占7个SM和5GB HBM2避免跨实例资源争用导致的能效坍塌。帕累托前沿采样建议对每种MIG profile执行多轮batch-size扫频如bs1,2,4,8,16同步采集实测吞吐tokens/sec与DCGM指标power.drawW剔除非线性区如吞吐饱和后功率陡增点保留严格帕累托最优解集第三章内存带宽墙的跨层级协同缓解3.1 HBM带宽饱和与KV Cache布局的访存局部性重构访存瓶颈根源分析当LLM推理批量增大时KV Cache频繁跨HBM通道随机访问导致带宽利用率超92%远高于75%的稳定阈值。分块连续布局策略struct KVBlock { float k[128][128]; // 按head-dim分块对齐HBM burst size (512B) float v[128][128]; }; // 单block占用~128KB适配HBM子通道粒度该布局使相邻token的K/V向量在物理地址上连续提升burst传输效率128×128维度兼顾attention head并行性与cache line填充率。性能对比A100 80GB布局方式有效带宽P99延迟原始行优先1.8 TB/s42.7 ms分块连续2.9 TB/s26.3 ms3.2 PagedAttention与FlashAttention-3在带宽受限场景下的实测能效对比内存访问模式差异PagedAttention采用分页式KV缓存管理将连续KV块切分为固定大小如16×16 tokens的页仅加载活跃页至HBMFlashAttention-3则通过TMATensor Memory Accelerator指令实现零拷贝tile级访存调度在PCIe带宽≤20GB/s时优势显著。实测吞吐对比A100 40GB, 128K context方案有效带宽利用率LLM推理延迟msPagedAttention68%142.3FlashAttention-392%89.7核心优化代码片段// FlashAttention-3 TMA descriptor setup tma_desc make_tma_descriptor( base_ptr, // KV缓存基址device memory {128, 128}, // tile shape (rows, cols) {16, 16}, // block size per thread group TMA_CG );该TMA描述符绕过L2缓存直接绑定GPU GDDR6X内存通道减少57%的DRAM bank冲突参数base_ptr需对齐256B边界TMA_CG启用Cooperative Group协同加载。3.3 混合精度张量压缩对PCIe/Infinity Fabric带宽压力的量化缓解带宽瓶颈的根源分析现代多GPU训练中FP32梯度同步常导致PCIe 5.0 x16≈64 GB/s或AMD Infinity Fabric≈128 GB/s链路饱和。混合精度训练虽启用FP16前向/反向但默认仍以FP32聚合梯度——冗余带宽消耗达40%以上。量化压缩策略对比INT8对称量化动态缩放因子 per-tensor误差可控2.1% Top-1 acc dropFP8 E4M3NVIDIA H100原生支持需硬件协同校准压缩后带宽实测配置单次AllReduce体积链路占用率FP32基准128 MB92%INT8压缩32 MB23%梯度压缩代码示例def quantize_grad(grad: torch.Tensor) - Tuple[torch.uint8, float]: Per-tensor INT8量化返回量化值与scale qmax, qmin 127, -128 fmax, fmin grad.max().item(), grad.min().item() scale (fmax - fmin) / (qmax - qmin) zero_point int(qmin - fmin / scale) quantized torch.clamp(torch.round(grad / scale) zero_point, qmin, qmax) return quantized.to(torch.uint8), scale该函数将FP32梯度映射至INT8整数域scale参数用于后续反量化zero_point保障动态范围对齐避免偏置引入系统性误差。压缩比恒为4×且无须额外元数据传输。第四章精度冗余的梯度感知裁剪与自适应量化4.1 权重与激活张量的逐层敏感度谱分析基于Hessian近似敏感度谱的核心动机模型压缩与剪枝需识别“低影响”参数。Hessian矩阵的特征值谱直接反映损失函数在参数空间的局部曲率——小特征值对应平坦方向即参数扰动对损失影响微弱。Hessian向量积近似实现def hvp(loss, params, v): Hessian-Vector Product via reverse-over-forward AD g torch.autograd.grad(loss, params, create_graphTrue) return torch.autograd.grad(g, params, grad_outputsv, retain_graphTrue)该函数避免显式构建 $ \mathcal{O}(d^2) $ 规模Hessianv 为随机向量g 是梯度二次反向传播得 H·v支撑Lanczos迭代提取主导特征值。逐层敏感度量化对比层类型平均最小特征值敏感度排序Conv11.2e-4高FC38.7e-6极高4.2 FP8/INT4混合量化策略在推理延迟-能耗双目标下的Pareto搜索Pareto前沿建模为联合优化延迟与能耗定义目标函数最小化 $ \mathcal{L} w_1 \cdot T_{\text{lat}} w_2 \cdot E_{\text{op}} $其中权重 $w_1,w_2$ 动态归一化。FP8子模块保留关键激活动态范围INT4用于权重密集计算。分层量化配置示例# 混合量化策略配置 quant_config { linear.weight: {dtype: int4, group_size: 64}, norm.activation: {dtype: fp8_e4m3, scale_method: per-token}, attention.out_proj: {dtype: int4, symmetric: True} }该配置在KV缓存FP8与FFN权重INT4间实现精度-效率平衡group_size64兼顾硬件访存对齐与量化误差抑制。双目标权衡结果配置平均延迟(ms)能耗(J)Pareto最优A: 全FP1612.84.7❌B: FP8/INT4混合9.32.9✅C: 全INT47.13.5❌4.3 动态精度缩放DPS机制依据输入复杂度实时调整计算精度核心设计思想DPS 通过轻量级复杂度探针如梯度方差、激活稀疏度、token熵值动态判定当前样本难度并在推理路径中即时切换 FP16/INT8/BF16 精度档位。精度调度策略示例# 基于激活熵的实时精度选择 def select_precision(entropy: float) - str: if entropy 5.2: # 高复杂度文本长程依赖、多义词 return fp16 # 保留数值稳定性 elif entropy 3.8: # 中等复杂度 return bf16 else: # 简单模式如模板化响应 return int8 # 启用量化加速该函数以 token-level 激活熵为输入阈值经离线校准确定FP16 档位保障关键层数值精度INT8 档位仅作用于前馈网络中非敏感通道。档位性能对比精度档位吞吐提升精度损失BLEUFP161.0×0.0BF161.3×0.2INT82.1×−0.94.4 校准集构建偏差对量化误差累积的影响及对抗性校准实践校准集分布偏移的量化放大效应当校准集缺失长尾激活值如稀疏大梯度样本INT8 量化后误差在深层网络中呈指数级累积。实测 ResNet-50 在 ImageNet-Val 上 Top-1 准确率下降达 3.7%。对抗性校准采样策略基于 KL 散度动态筛选跨域激活分布差异最大的 200 个 batch引入梯度敏感性加权对高 Jacobian 范数区域提升采样概率校准数据增强代码示例# 对抗性校准集构建PyTorch def adversarial_calibrate_loader(model, base_loader, n_batches128): model.eval() activations [] for x, _ in base_loader: with torch.no_grad(): # 捕获中间层输出并计算梯度敏感性 feat model.forward_features(x.cuda()) jacob_norm torch.norm(torch.autograd.grad( feat.sum(), feat, retain_graphFalse)[0], dim1) # 按敏感性排序取前 10% 高权重样本 idx torch.topk(jacob_norm, kx.size(0)//10).indices activations.append(x[idx.cpu()]) if len(activations) n_batches: break return torch.cat(activations)该函数通过反向传播估算特征图对输入的局部敏感性以 Jacobian 范数为指标筛选易致量化失真的样本避免传统随机采样导致的校准集偏差。不同校准策略误差对比策略Top-1 Acc Drop (%)FP32→INT8 KL Divergence随机校准3.720.89对抗性校准0.410.13第五章面向绿色AI的能效比统一评估范式传统AI基准测试如MLPerf聚焦吞吐与延迟却忽略每瓦特算力所支撑的推理精度或训练收敛效率。绿色AI亟需将能耗、硬件拓扑、模型稀疏性与任务语义耦合建模形成可复现、跨架构、任务感知的能效比Energy-Efficiency Ratio, EER统一评估范式。核心评估维度解耦动态功耗采集通过RAPL接口在Intel CPU上实时读取PKG域功耗配合NVIDIA DCGM获取GPU SM与memory子系统能耗语义加权精度对目标检测任务采用mAP0.5:0.95加权于单位焦耳Joule的归一化指标EER (mAP × IoU_threshold_weight) / Total_Joules开源评估工具链实践# GreenBench v0.3轻量级EER采集器 from greenbench import EnergyMeter, Evaluator meter EnergyMeter(deviceintel-rapl, interval_ms100) evaluator Evaluator(modelYOLOv8n(), datasetCOCOVal()) result evaluator.run(meter, warmup_iters5, test_iters50) print(fEER: {result.mAP_weighted / result.total_energy_j:.2f} mAP·IoU/J)跨芯片平台实测对比平台模型平均功耗 (W)EER (mAP·IoU/J)NVIDIA A100ResNet-50215.30.47AMD MI250XResNet-50382.10.39Intel Gaudi2ResNet-50168.50.52边缘部署中的能效校准输入帧 → 动态分辨率缩放基于场景复杂度→ 稀疏推理引擎TensorRT-LLM-Sparse→ 能耗反馈闭环调节跳频策略

相关新闻

【情感计算×人机信任】:20年工业级AI交互设计经验总结——仅剩3家头部公司内部使用的6维评估模型

【情感计算×人机信任】:20年工业级AI交互设计经验总结——仅剩3家头部公司内部使用的6维评估模型

更多请点击: https://codechina.net 第一章:AI情感化设计的范式跃迁与信任本质重构 传统人机交互设计长期聚焦于功能效率与可用性,而AI时代的用户期待正发生根本性偏移——从“能否完成任务”转向“是否理解我、尊重我、陪伴我”。这一转变催…

2026/8/4 22:55:18 阅读更多 →
知识产权管理软件的账单功能:如何让费用对账更高效

知识产权管理软件的账单功能:如何让费用对账更高效

在企业知识产权管理的日常工作中,费用账单处理是一个看似常规、实则极易失控的环节。随着专利申请量增长、商标布局扩大、涉外案件增多,企业每年在知识产权上的支出往往分散在多个代理机构、多种费用类型、多个时间周期中。财务部门看到的是一笔笔付款流…

2026/8/4 22:54:18 阅读更多 →
Raspberry Pi Imager终极指南:3分钟完成树莓派系统部署

Raspberry Pi Imager终极指南:3分钟完成树莓派系统部署

Raspberry Pi Imager终极指南:3分钟完成树莓派系统部署 【免费下载链接】rpi-imager The home of Raspberry Pi Imager, a user-friendly tool for creating bootable media for Raspberry Pi devices. 项目地址: https://gitcode.com/gh_mirrors/rp/rpi-imager …

2026/8/4 22:54:18 阅读更多 →

最新新闻

PostgreSQL专属特性:with_advisory_lock事务级锁与阻塞模式详解

PostgreSQL专属特性:with_advisory_lock事务级锁与阻塞模式详解

PostgreSQL专属特性:with_advisory_lock事务级锁与阻塞模式详解 【免费下载链接】with_advisory_lock Advisory locking for ActiveRecord 项目地址: https://gitcode.com/gh_mirrors/wi/with_advisory_lock 在数据库并发控制领域,PostgreSQL的事…

2026/8/4 23:34:33 阅读更多 →
Android自定义ROM用户必看:PlayIntegrityFix-NEXT与Keybox注入协同配置方案

Android自定义ROM用户必看:PlayIntegrityFix-NEXT与Keybox注入协同配置方案

Android自定义ROM用户必看:PlayIntegrityFix-NEXT与Keybox注入协同配置方案 【免费下载链接】PlayIntegrityFix-NEXT PIF Fork. This module provides experimental implementations to ensure valid attestation under the new PlayIntegrity rules. 项目地址: h…

2026/8/4 23:34:33 阅读更多 →
Start Bootstrap Scrolling Nav部署教程:轻松发布你的单页网站

Start Bootstrap Scrolling Nav部署教程:轻松发布你的单页网站

Start Bootstrap Scrolling Nav部署教程:轻松发布你的单页网站 【免费下载链接】startbootstrap-scrolling-nav An unstyled Bootstrap HTML template for creating smooth scrolling, one page websites - created by Start Bootstrap 项目地址: https://gitcode…

2026/8/4 23:34:33 阅读更多 →
3个让你彻底告别原神枯燥收集的Akebi-GC神奇功能

3个让你彻底告别原神枯燥收集的Akebi-GC神奇功能

3个让你彻底告别原神枯燥收集的Akebi-GC神奇功能 【免费下载链接】Akebi-GC (Fork) The great software for some game that exploiting anime girls (and boys). 项目地址: https://gitcode.com/gh_mirrors/ak/Akebi-GC 还在为原神中无尽的神瞳收集感到疲惫吗&#xff…

2026/8/4 23:34:33 阅读更多 →
从源码到部署:DavMail开发者指南(Java架构/Exchange协议对接/单元测试)

从源码到部署:DavMail开发者指南(Java架构/Exchange协议对接/单元测试)

从源码到部署:DavMail开发者指南(Java架构/Exchange协议对接/单元测试) 【免费下载链接】davmail DavMail POP/IMAP/SMTP/Caldav/Carddav/LDAP Exchange and Office 365 Gateway - Synced with main subversion repository at 项目地址: ht…

2026/8/4 23:34:33 阅读更多 →
OGG Replicat数据过滤完全指南:FILTER与WHERE实战解析

OGG Replicat数据过滤完全指南:FILTER与WHERE实战解析

在Oracle GoldenGate的数据同步实践中,并非所有源端数据都需要原封不动地同步到目标端。业务场景中常见的数据过滤需求多种多样:只同步满足特定条件的业务数据、按数据范围拆分同步任务以实现并行复制、在指定CSN点启动复制进程处理断点续传。这些场景都…

2026/8/4 23:33:33 阅读更多 →

日新闻

AI Agent白手起家26: 使用标准事件驱动大模型实践

AI Agent白手起家26: 使用标准事件驱动大模型实践

纲要 练习目标:掌握大模型标准事件的调用回顾 LangChain 中的核心标准事件 invokestreambatchastream_eventswith_structured_output 环境准备实战代码:多种事件调用对比 同步调用与流式输出批量处理异步事件流监听结构化输出 运行说明与预期结果总结与扩…

2026/8/4 0:00:40 阅读更多 →
dealsea是什么?跨境卖家必知的美国deal站入门指南

dealsea是什么?跨境卖家必知的美国deal站入门指南

说实话,第一次听说美国这个老牌折扣网站的跨境卖家,十个有八个会问同一个问题:这个平台到底是干嘛的?我见过一个做家居出口的朋友,他在亚马逊上月销二十万美金,却从来没用过它。我给他看了首页——一屏一屏…

2026/8/4 0:01:40 阅读更多 →
清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

通讯作者:邓兵、刘建国通讯单位:清华大学DOI:https://doi.org/10.1021/acs.est.6c00603研究背景稀土元素(REEs)是清洁能源技术与电子器件不可或缺的核心原料,然而传统提取方式依赖能耗高、排放大的采矿与强…

2026/8/4 0:01:40 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/4 13:24:41 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/4 11:41:39 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/4 5:26:40 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/4 13:38:24 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/4 11:09:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/4 13:38:40 阅读更多 →