从算力到智能体,面向 Agentic AI 的基础设施演进
摘要当大模型的能力边界不断扩展真正决定 AI 价值上限的已不再只是算法本身而是支撑其落地的基础设施体系。本文基于 2026 Agentic AI 超级智能体系统架构峰会演讲系统阐述了阿里云 PAI 平台如何围绕算力、推理与场景三条主线构建面向 Agentic AI 的全栈基础设施——从数十万卡集群的统一调度与训推一体到企业级 Token 服务 TokenWorks 的 KV Cache 感知调度与 SLO 保障再到 Physical AI、自动驾驶、具身智能等场景化方案的落地以及 Agentic 交互与 AI 原生数据管线的融合展现了一条从有算力到用好算力再到智能驱动的清晰演进路径。演讲人 周文超阿里云智能研究员人工智能平台PAI负责人百炼平台AI搜索负责人从算力底座到场景落地AGI不仅是模型更是千行百业的高效应用当前 AI Infra 架构可分为以下几个核心层次。最底层是算力。阿里云人工智能平台 PAI 管理着多种异构计算资源包括不同规格的 CPU 和 GPU以及高带宽网络、存储等。该平台承担着资源池化与弹性调度的职责。算力的规模和稳定供给决定了 AI 智能的上限。算力层之上是 AI 的两大核心环节——训练和推理。训练环节重点关注 GPU 资源的使用效率MFU。将 MFU 从百分之十几、二十几提升至百分之五十甚至更高直接决定了模型训练的速度和资源消耗。推理环节同样如此。近年来学术界和工业界的一个核心技术突破是如何实现更高效的 LLM Serving使大模型在算力平台上完成高效推理。过去一年该领域涌现了大量新技术PD 分离、KV Cache 的多层级利用从本机内存到跨机内存再到 SSD以及 MTP 技术提升 Acceptance Rate 等。计算效率的提升是模型生产和应用的基础。再上一层是企业 Token 服务的保障体系。有了训练和推理能力便可产出高质量的模型并生成高质量 Token。下一个目标是实现高效率的 Token 产出并提供稳定的效率保障。确定性的 SLO 至关重要尤其在 Agentic AI 时代Token 的稳定性和效率直接决定上层服务的可靠性。SLO 已从单一的 P99 延迟演变为更复杂的指标体系不仅涵盖整体延迟还包括 TTFT 和 TPOT 等具体约束条件。在此基础上需要实现 Token 成本的最小化并确保 TTFT、TPOT 及成本在较长周期内实现 99.9999% 甚至 99.99999% 的 SLO 达成率。这是企业级 Token 服务乃至 Agentic AI 落地的前提。最上层是场景化的 AI 工程。Token 产出之后仍需将其应用于具体场景以创造真正的业务价值。这需要从通用平台走向行业纵深覆盖智驾、具身智能、AI Coding、多模态探索等不同应用场景构建行业纵深的场景化 AI 工程。阿里云人工智能平台 PAI阿里云人工智能平台 PAI 的架构分为IaaS、PaaS、MaaS 和解决方案四层。最底层是 IaaS依托阿里云在云时代的深厚积淀。计算方面支持 CPU、GPU 等多种计算类型存储方面提供 CPFS 等面向 AI 工作负载的高带宽存储网络方面具备跨 Region 和 Region 内的两层高速网络保障 51.2Tbps 的高速互联。此外结合 MaxCompute、EMR、Flink 等大数据平台提供 AIData 的高效解决方案。IaaS 之上是 PaaS 层也是 PAI 投入最多精力构建的部分在 AI Infra 中具有最大的设计空间和发展潜力。PAI 拥有两个核心引擎——训练引擎 DLC 和推理引擎 EAS并在引擎之上提供多种大模型开发和应用工具IDEDSWNotebook 式开发工具支持交互式建模、Agentic 工具以 Agentic 方式与平台交互同时更好地支持 Agent 工作负载、以及多模态 AI 和 Physical AI 等场景化工具。最终目标是让 AI 算力、智能和数据形成飞轮效应。PaaS 之上是 MaaS 层。底层的基础设施和 AI 算力平台支撑了 Model as a Service包括 ModelScope、阿里云百炼以及 OpenAI、Anthropic、Hugging Face 等第三方 MaaS 平台通过不同协议使用底层的 AI Infra。最上面是解决方案层覆盖 Agent、自动驾驶、具身智能、科研智算等不同行业和场景。算力的应用效率是AI迭代和应用的关键PAI统一调度引擎训推一体的高效调度PAI 的核心能力之一是统一资源调度。资源呈现显著的异构性和多元性体现在多个维度。第一是算力的异构与多样性。CPU、GPU 以及日趋丰富的 GPU 类型——包括英伟达 GPU、阿里云 PPU 和国产生态 GPU——种类繁多。能否在统一的资源池中实现混合调度在调度时将不同卡型统一管理是关键能力所在。第二是网络的多样性。卡与卡之间可能处于同一机器、同一机架、跨机架甚至跨机房等不同拓扑位置网络带宽和延迟保障差异显著直接影响大规模训练和推理的整体效率。因此调度时需考虑网络拓扑亲和性——例如使用 Tensor Parallel 进行训练或推理时应将相关任务优先分配到高速互联的 GPU 上。PAI 的统一调度引擎综合考虑了算力多样性、网络多样性以及多种调度策略FIFO、Round Robin、是否允许抢占等。配额分配后的使用模式——固定配额还是允许闲时复用和抢占——进一步扩大了调度空间。PAI 平台将所有这些调度能力集成于统一的调度器中结合阿里巴巴训练 Qwen、Wan 等大模型积累的实践经验在管理的数十万卡算力集群中实现了 90% 以上的有效算力利用率。资源、调度和工作空间三层体系实现算力精细化管理另一个关键维度是易用性。企业中与 AI 算力相关的角色包括资源购买方决定采购规模、资源分配方管理不同团队的资源配比和资源使用方模型开发团队、数据开发团队等。不同角色需要不同的资源管理视图。资源购买阶段PAI 提供 AI 资源组的概念可统一管理 GPU、CPU、内存、存储等资源实现可观测、可管可控。资源分配阶段通过定义 Quota资源配额来保障各团队的资源互不干扰每个配额内可自由使用。资源使用阶段在 AI 工作空间内进行资源绑定例如将部分 GPU 用于训练、另一部分用于推理在使用层面实现资源管控。购买、分配、使用三层体系协同实现了算力的精细化管理这也是 PAI 平台在业界广受认可的核心能力。PAI-DLC 超大规模分布式训练服务训练服务是另一个与算力密切相关的核心领域。在调度引擎之上训练引擎针对多种训练任务和阶段进行了深度优化涵盖预训练、后训练、MoE 模型训练和多模态模型训练等。以 MoE 训练为例PAI 引入了 Chunk Flow 技术。由于训练的 Context Window 长度可变定长训练会导致大量 GPU 空跑和资源浪费。PAI 将变长训练组织为等长的 Chunk显著提升了训练效率在 MoE 模型训练中可实现约三倍的资源使用效率提升。此外PAI 集成十余种主流训练框架支持一键启动复杂的训练和 Rollout 操作。综合来看在训练方面10 万卡算力集群管理的卡数过去一年增长约三倍MoE 训练 MFU 最高超过 80%训练任务量过去一年增长超百倍每月有超过 4000 万个训练任务在平台上运行。Agentic时代的推理服务进入 Agent 时代推理服务领域发生了根本性变化。Agentic Inference 具有以下四个显著特征。单次对话如同一次长跑——可涵盖数十轮交互上下文可达数十万 Token。Prefill 和 Decode 分离已成为标配无论是 Coding 场景还是 Agentic 场景上下文日趋冗长两阶段分离势在必行。同一查询还需多个实例协作甚至在探索 Attention 与 Forward 的进一步分离AFD 分离。KV Cache 已成为核心资产。过去一年KV Cache 从一项辅助优化手段演变为核心议题。其命中率从 60%—70% 持续攀升在部分 Coding 场景下已超过 95%。每一个百分点的提升都意味着推理时 GPU 资源的节省——尤其从 95% 到 96%看似仅提升一个百分点但未命中率从 5% 降至 4%实际资源节省达 20%。在阿里内部和 PAI 平台上KV Cache 的优化是重点投入方向确保在多轮对话和 Coding Agent 环境中充分发挥其价值。网关同样至关重要。传统网关已基本失效——Round Robin 和一致性哈希等方式无法感知 KV Cache必然导致命中率下降并影响 TTFT 和 TPOT。现代网关需要实现 KV Cache-Aware Routing。网关还承担着更多职责在 MaaS 或推理场景中需要处理多种协议如 Anthropic 协议、Responses 协议同时承担翻译、调度和计费等功能。SLO 的定义也发生了根本性变化。当前工业实践中的 SLO 本质上是一个约束优化问题——约束条件涉及 TTFT 和 TPOT优化目标是单 Token 成本或百万 Token 成本。推理的服务单位也从资源快速演进到了 Token在 LLM 时代推理经历了从同步推理到异步推理再到流式推理的演进以 Token 作为服务粒度。Agent 时代由于上下文极长推理过程有时如同在 Token 中摸索前行——可能消耗大量 Token 而编码进展有限。因此需要实现高效、低成本、高质量的 Token 利用。PAI TokenWorks 企业级推理服务PAI 推出了 TokenWorks——企业级专属推理服务支持数据不出域的私有化部署提供具有 SLO 保障的推理服务。TokenWorks 针对前述每个问题都进行了专项优化。流量高效调度方面实现了 KV Cache-Aware 的网关流量调度确保 KV Cache 命中率足够高。通过从 HBM 到内存再到 SSD 的多层缓存架构命中率可稳定在 90% 以上部分场景可达 95%。引擎深度优化方面针对不同 Attention 机制从 DeepSeek V4 到 K3 等实施算子融合采用 D-Spark、D-Flash 等技术提升推理引擎效率。此外还包括模型预热缓存、用户 Token 管理等功能实现成本可核算、可治理。这些技术能力最终以 Token 形式交付——对客户而言即为具有 SLO 保障的专属 Token 服务数据可管可控、不出域、安全。场景化是AI业务价值体现的必经之路以物理 AI为例可以清晰地看到 AI Infra 的演进方向。Physical AI 是当前备受关注的领域其发展呈现双轮驱动格局一侧通过 Physical AI 模拟物理世界捕捉物理规律生成符合物理规律的世界仿真另一侧通过 LLM/VLM 提炼和抽象人类知识。两者相互促进——Physical AI 中基于仿真的反馈可用于 LLM/VLM 的强化学习训练而 LLM/VLM 在数据标注、清洗和扩增等方面也反向推动了世界模型的训练。PAI 平台构建了 Physical AI 的全栈能力。底层是算力层统一管理不同 GPU 和资源。中间层集成了 Physical AI 领域主流的仿真、训练和测试框架。上层是场景化的平台能力Notebook Gallery 组件沉淀了数百个业界最佳实践模板支持一键启动DSW 提供交互式开发环境支持自定义环境的探索验证与调试以及低延迟可视化的机器人仿真环境。模型的上线和部署则依托训练平台 DLC 和推理平台 EAS。完整的解决方案还涵盖数据合成、真机与仿真数据的联合管线、模型训练验证与上线。PAI 与 Isaac、Cosmos 等合作伙伴持续协作不断提升 Physical AI 全栈能力。Physical AI 的研发全流程包括数据生产真机采集数据如车辆和人形机器人数据不足时通过仿真进行扩增和增强、数据加工标注、筛选、画质增强等、模型训练预训练、后训练含微调和 RLHF以及模型评测。PAI 平台在该研发全流程中与客户和合作伙伴共同打造使之更贴合 Physical AI 的研发实践。Agentic PAIAI驱动的PAI操作入口AI 正加速进入千行百业PAI 平台本身也积极拥抱 Agentic 交互方式。Agentic PAI 将平台能力以自然语言交互的方式呈现从资源管理到训练、部署、运维乃至故障排查均可以 Agentic 方式进行支持 CLI 和 Chat 等交互形式。PAI 平台已沉淀了大量训练、推理和 RL 任务训练本身即是一项复杂的系统工程Agentic 方式能够帮助客户更高效地完成模型训练、部署和运维。这也便于客户将 PAI 能力快速集成到企业内部 AI 平台。大型企业通常拥有自有的 AI 部署管理和观测平台通过 Agentic 接口PAI 的能力可快速融入企业自有的 AI 平台体系。不同角色从中获得的收益各有侧重算法工程师和模型训练者关注开发效率和训练稳定性可将数百个 Worker 的日志交由 AI 分析专注于模型本身无需在海量日志中人工排查 Loss 异常部署和推理工程师关注服务上架、运维和性能部署、扩缩容、灰度发布和故障排查可一站式完成平台资源管理者和成本负责人可快速实现成本洞察查看 GPU 利用率、排名和环比趋势等。Agentic 全模态数据处理管线模型训练离不开数据。对阿里云而言AI 与 Data 紧密相连。在 Agentic 时代全模态数据处理管线同样备受关注。数据管线涵盖数据治理、资源管理、开发体验和多模态数据纳管等方面。阿里云大数据平台正从传统数仓向 AI Native 数据平台转型可将复杂的 AI 推理场景简化为一行 SQL使熟悉 SQL 的开发者将 AI 能力直接嵌入已有的开发平台和流程中。通过异构资源的灵活调度多种模型覆盖全场景。这是大数据平台与人工智能平台联合打造的成果将大数据产品从传统数仓平台到 AI Native 数据平台的转型。结语从算力到智能体作为行业从业者可以看到一条清晰的趋势——从单纯关注算力到算力如何更好地支撑智能体AI Infra 层面正在经历深刻的演进与变革。阿里云大数据AI 平台将持续助力千行百业共享 AI 红利。

相关新闻

DINOv2模型选型指南:从通用视觉到生物医学的智能视觉革命

DINOv2模型选型指南:从通用视觉到生物医学的智能视觉革命

DINOv2模型选型指南:从通用视觉到生物医学的智能视觉革命 【免费下载链接】dinov2 PyTorch code and models for the DINOv2 self-supervised learning method. 项目地址: https://gitcode.com/GitHub_Trending/di/dinov2 在当今计算机视觉领域,M…

2026/8/4 2:19:34 阅读更多 →
炉石传说脚本完全指南:3大核心功能彻底解放你的游戏时间

炉石传说脚本完全指南:3大核心功能彻底解放你的游戏时间

炉石传说脚本完全指南:3大核心功能彻底解放你的游戏时间 【免费下载链接】Hearthstone-Script Hearthstone script(炉石传说脚本) 项目地址: https://gitcode.com/gh_mirrors/he/Hearthstone-Script 还在为炉石传说每日任务耗时过长而…

2026/8/4 2:19:33 阅读更多 →
【单片机毕业设计推荐】基于 STM32 的超声波测距预警与蓝牙 APP 监测系统设计与实现,基于 STM32 的温度补偿超声波测距声光报警装置研发(014205)

【单片机毕业设计推荐】基于 STM32 的超声波测距预警与蓝牙 APP 监测系统设计与实现,基于 STM32 的温度补偿超声波测距声光报警装置研发(014205)

文章目录20 个相关毕业设计备选题目项目研究背景摘要总体方案核心功能基础功能核心功能辅助功能技术路线项目演示关于我们项目案例源码获取温馨提示:本人主页置顶文章(点我)有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶…

2026/8/4 2:18:33 阅读更多 →

最新新闻

Pygame入门:Python游戏开发核心概念与实战指南

Pygame入门:Python游戏开发核心概念与实战指南

1. 项目概述:为什么选择Pygame作为游戏开发入门如果你刚接触Python,想找个有趣又有成就感的项目来驱动学习,或者你是个有经验的开发者,想快速验证一个游戏创意,Pygame绝对是一个绕不开的名字。它不是市面上性能最强、功…

2026/8/4 3:08:05 阅读更多 →
2026年AI Agent构建指南:框架选型与工程实践

2026年AI Agent构建指南:框架选型与工程实践

# 2026年AI Agent构建指南:框架选型与工程实践## 一、背景与挑战:从“能跑”到“能跑在产线”2026年,AI Agent已经从实验室里的玩具,变成了企业级基础设施的核心组件。我最近跟几个团队聊,发现大家最头疼的事就是选型—…

2026/8/4 3:08:05 阅读更多 →
2026年AI视频生成模型深度解析:Kling 3.0与Seedance 2.0对比

2026年AI视频生成模型深度解析:Kling 3.0与Seedance 2.0对比

# 2026年AI视频生成模型深度解析:Kling 3.0与Seedance 2.0对比 ## 一、背景与挑战:从“可看”到“可用”的质变 2026年初,AI视频生成领域迎来里程碑式跃迁。2月4日发布的Kling 3.0被业界称为“年度最重要的AI视频生成突破”,而字节…

2026/8/4 3:08:05 阅读更多 →
AI Agent白手起家24: 本地大模型部署与LangChain接入实战

AI Agent白手起家24: 本地大模型部署与LangChain接入实战

纲要 闭源模型与开源本地模型的权衡硬件对推理速度的关键影响本地推理框架选择:Ollama本地部署流程 安装 Ollama拉取模型启动 API 服务 LangChain 接入本地模型 安装 langchain-ollama使用 ChatOllama 进行同步与流式调用 完整可运行代码示例 闭源模型 vs 开源本地…

2026/8/4 3:08:05 阅读更多 →
AI Agent白手起家23: 大模型速率限制应对与缓存机制实践

AI Agent白手起家23: 大模型速率限制应对与缓存机制实践

纲要 速率限制的产生背景与影响LangChain 内置速率限制器 InMemoryRateLimiter 核心参数 缓存机制的必要性与原理 短期缓存(内存)与长期缓存(持久化) 实战:速率限制与缓存结合 项目结构速率限制器配置缓存方案对比&…

2026/8/4 3:08:05 阅读更多 →
Unity AR/VR开发中UniWebView五大核心问题解决方案

Unity AR/VR开发中UniWebView五大核心问题解决方案

1. 项目概述:当AR/VR遇上WebView,为何“坑”特别多?在Unity 2020及更高版本中开发AR/VR项目,引入UniWebView来嵌入网页内容,已经成为一个越来越普遍的需求。无论是用于展示动态更新的产品手册、加载在线3D模型配置器&a…

2026/8/4 3:07:04 阅读更多 →

日新闻

AI Agent白手起家26: 使用标准事件驱动大模型实践

AI Agent白手起家26: 使用标准事件驱动大模型实践

纲要 练习目标:掌握大模型标准事件的调用回顾 LangChain 中的核心标准事件 invokestreambatchastream_eventswith_structured_output 环境准备实战代码:多种事件调用对比 同步调用与流式输出批量处理异步事件流监听结构化输出 运行说明与预期结果总结与扩…

2026/8/4 0:00:40 阅读更多 →
dealsea是什么?跨境卖家必知的美国deal站入门指南

dealsea是什么?跨境卖家必知的美国deal站入门指南

说实话,第一次听说美国这个老牌折扣网站的跨境卖家,十个有八个会问同一个问题:这个平台到底是干嘛的?我见过一个做家居出口的朋友,他在亚马逊上月销二十万美金,却从来没用过它。我给他看了首页——一屏一屏…

2026/8/4 0:01:40 阅读更多 →
清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

通讯作者:邓兵、刘建国通讯单位:清华大学DOI:https://doi.org/10.1021/acs.est.6c00603研究背景稀土元素(REEs)是清洁能源技术与电子器件不可或缺的核心原料,然而传统提取方式依赖能耗高、排放大的采矿与强…

2026/8/4 0:01:40 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/3 4:58:13 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/3 1:53:31 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/3 4:36:35 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/3 13:07:03 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/3 5:19:38 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/3 8:27:36 阅读更多 →