[AI][昇腾950]TA 学习
TATransaction Layer事务层学习笔记一、TA 在协议栈中的定位UB 协议栈自顶向下四层Transaction(TA) → Transport(TP/CTP) → Network(NL) → DataLinkPhysical(DL_PHY) ↓ H112 SerDesTA 是最上层面向软件负责JFS 队列调度、上下文维护WQE 拆解发送、RCE 回复 Rd Response / TAACKCQE / EQE 上报超时检测、RNR 重传、Jetty 注销、Function 级复位学习要点TA 之下还有 TP可靠传输/ CTP简易传输无端到端重传。TA 不直接碰链路它把软件下发的事务交给 TP 去搬运。二、三种编程接口TA 为软件提供三种编程入口接口用途说明Mailbox控制面表项创建/修改/读取/注销Doorbell通知硬件执行任务、更新指针、使能事件分硬 DB写地址空间 → TP LSAR → TA与软 DBrecord软件写内存硬件读DirectWQE低延时直接下发 WQE64B 或 128B不经 cache 访存Doorbell 方向速记软更 PI/CI 指软件维护的指针队列软件维护硬件维护JFSPICIJFCCIPIJFRPICIEQCIPI记忆JFS/JFR 软件生产PIJFC/EQ 软件消费CI。各队列对 DB 的支持JFS 仅硬 DBJFC 硬软JFR 仅软 DBEQ 仅硬 DB。三、Jetty / JFS / JFR / JFC 队列模型3.1 核心概念JettyURMA 编程接口对象绑定一对发送/接收队列JFSJetty For Send发送队列JFRJetty For Receive接收队列JFCJetty For Completion完成队列上报 CQE3.2 关键规格项规格每 Entity JFS/Jetty 数最大6553664KJFS/Jetty 队列深度1~3276832K2 的幂次方深度 1/2/4 仅 Normal SQE每 Entity JFR 数最大 65536JFR 队列深度64~32768JFR RQE 大小最大 4单位 16BJFR RQE Buffer Size2KB/4KB1 报文最多 4 RQEJetty Group 数每 Entity 最大 65536Jetty Group 内最大 Jetty 数32Jetty Group Hash按包头 Hint 选 JFRJFC 队列数最大 655361 JFC 绑多 JFS/JFR1 JFS/JFR 属 1 JFCJFC CQE 深度64~10485761MJFC CQE 大小Normal 64BRaw 固定 64BJFC inline 模式Send/SendImm/SendInv 时 Payload 写入 CQE最大 20B带立即数减 8BJFC PA 地址可 Bypass UMMU 降低 CQE 时延学习要点1 JFC 绑多 JFS/JFR但 1 JFS/JFR 只属 1 JFC多对一关系。JFC 可 Bypass UMMU 直接用 PA 地址用于降低 CQE 时延。四、URMA 操作语义4.1 支持的操作Send、Send with invalidate仅软件方案、Send with immediate dataCTP 最大 1 MTU、Send with inline data最大 208B、Write、Write with immediate、Write with Notify、Write with Reduce≤MTU、Write with inline最大 208B、Read、Read with Reduce≤MTU、CompareSwap Atomic4/8/16B、FetchAdd Atomic4/8B、User Data 上报 CQE、NOP。4.2 操作规格Normal SQE操作最小最大Send0BSGE_Num0可靠 TP 64KBCTP 1 MTUWrite0B256MB0x40000 KBRead0B256MBAtomic CAS4B16B操作数×2Atomic FetchAdd4B8BRaw SQE Payload0B4KBWrite/Send inline—208B4.3 WQE 切片规则Write/Read可切片给 Transport切片大小 Payload size不含包头可靠 TP 最大 6553664KB最小 1KB2 的幂次方Send / Read Response / Raw / Atomic不切片无 TP 时按 MTU 拆4.4 序模型模型说明No Order无序Strong Order强序Fence栅栏Relax Order宽松序均在 WQE 中配置。五、SQE 规格SQEBBSQE Base Block64B是计量单位Raw SQE最大 5 SQEBB最大 18 SGE每 SGE 16B用于传统 NICNormal SQE最大 4 SQEBBWrite/Send 最大 13 SGERead 最大 6 SGEAtomic 1 SGEJFS Context User Data最大 8B 填入 CQE记忆64B 是基本块。Raw 给传统 NIC 用5 BB / 18 SGENormal 是 URMA 主力4 BB。SGE 是 Scatter/Gather Element散集元素 的缩写。它是一种用于描述非连续或离散内存数据段Buffer的结构单元主要在传输请求WQE中指定数据的内存地址、长度和访问权限从而支持高效的向量化 I/O 与零拷贝数据搬移。SGE 的核心作用描述内存段每个SGE 包含一段物理或虚拟内存的起始地址Buffer Address以及数据长度Length。SGL多个 SGE 可以组合成一个散集列表Scatter/Gather List, SGL用来一次性处理分布在内存中不同位置的多个数据块。SGE 的核心字段硬件数据结构在硬件底层一个 SGE 通常占用 16 字节Bytes 或 32 字节 的固定内存空间主要由以下三个核心核心字段组成Addr (64-bit 地址)指向本段内存缓冲区的起始虚拟地址VA或物理地址。Length (32-bit 长度)指定该内存段的大小以字节为单位定义了硬件可以读取或写入的边界。Lkey (32-bit 局部密钥)这是硬件进行内存保护的核心机制。它是该内存区域在注册Memory Region, MR时生成的令牌。硬件通过检查 Lkey 来验证当前进程是否有权限读写该段内存防止非法内存越界。SGE 的组织与执行形式WQE ↔ SGL ↔ SGESGE它是通过工作队列Work Queue和散集列表SGL来协同工作的软件提交Gather / 发送端软件如应用层或网络协议栈要发送 3 块不连续的数据。软件构建一个 WQE工作队列元素并在 WQE 内部包含一个由 3 个 SGE 组成的 SGLScatter/Gather List。六、RC 表Remote Command 表存收到的远端Read / Atomic请求RM 模式需回 TAACK 的 Write/Send 也用。项规格每 Entity RC 表数最大 65536可配置每 VL 2 的幂次方深度RC 表大小Ring BufferRCE BB 固定 64B单命令占 1 RCE BB最小 64B最大 128B2 RCERC 表深度64 ~ 32768 RCEBB拥塞反馈RC 表达水线返回拥塞指示源端降速解除活锁非协议拥塞控制学习要点RC 表是接收侧用来暂存远端发来的 Read/Atomic 请求的环形缓冲。达水线会反压源端降速——注意这是解除活锁不是协议级拥塞控制。七、Direct WQE / WQE Lock Buffer / Stars Lock Buffer7.1 DirectWQE 机制硬件收到 DirectWQE 后按 Jetty 范围判断存入Stars Lock BufferWQE Lock BufferWQE cacheLock Buffer 模式下 SQE 只存片上无访存DSQE 源保证不溢出低延时场景。7.2 WQE Lock BufferXPUCPU/CCU/AIV/AICPU下发的 DirectWQE 存入使用此 Buffer 的 Jetty仅支持 DirectWQE不支持 doorbellFE 内连续 Jetty 范围静态配置start_jetty_id / end_jetty_id所有 FE 范围相同每 FE 配 1bit 使能 fe_start_buf_idxFE 内 jetty 深度相同2^bb_shift最大 2^12片上容量4K×64BJFS context 中wqe_lock_buffer_en1时 sqe_base_addr 为此 Jetty 在 Buffer 起始地址地址计算addr fe_start_buf_idx (jetty_id - start_jetty_id)*(2^bb_shift) sqebb_idx%(2^bb_shift)64B DWQEsqebb_idx DWQE.sqe_bb_idx - 1128B DWQE第 1 个 sqebb_idx sqe_bb_idx-2第 2 个 sqe_bb_idx-17.3 Stars Lock Buffer深度128×64B与 WQE Lock Buffer 的 Jetty 范围不交叠学习要点DirectWQE 是低延时关键路径。Lock Buffer 把 SQE 留在片上免访存但要付出Jetty 范围受限、不支持 doorbell的代价。八、Write with AtomicStoreAdd模式opcode结构说明单 WQEBB0x19仅 1 SGE1 WQEBBEID 32bitTokenValue 24bit不支持 UDFPayload 最大 64KBTP/ 4KBCTP≤MTUinline 最多 8BTA 不切片发 TPsge_num0 表 payload0两 WQEBB0x1A数据结构同 write with notify1 SGEsge_num0/1inline 最多 16BTP 0~64KB / CTP 0~4KBTA 固定不切片超切片大小不发送上报 AE九、流量管理 TM 4 层调度层级节点典型数量调度ShaperL5Queue (Q)128——L4Queue Set128固定一一映射 L5单桶 1Mbps~200Gbps精度 1%L3Function (VF/PF) Entity64最多 16 L4 → 1 L3SPDWRR双桶 CIR/PIRL2Function Group16最多 8 L3 → 1 L2SPDWRR双桶L1Network Port132 FG → 1SPDWRR单桶Jetty 流量控制最低1MbpsSL→VL 映射表同 FE 同 VL SQ 映射到同 FEVL Queue学习要点自底向上 L1端口→ L2FG→ L3FE→ L4QS→ L5Q。调度算法 SP严格优先级 DWRR加权轮询组合。L3/L2 用双桶CIR/PIRL1/L4 用单桶。十、性能指标10.1 昇腾场景操作RC 单向RC 双向RM 单向RM 双向Send/Rcv快最快慢快CTP 模式 4KB 打满带宽场景10 Jetty 对 10 Port4KB 打满context cache miss 时双向包率之和 80Mmps达成条件JFS 32~384RC 32~64单 Jetty WQE≥4CQE 非 inline4KB 打满带宽≤1KB 打满包率学习要点RC 比 RM 快约 2 倍。Cache hit/miss 对带宽影响巨大。十一、图速记软件 ──Mailbox──▶ [表项配置] ──IMP──▶ TA ──Doorbell──▶ [PI/CI更新] ──TP LSAR──▶ TA ──DirectWQE─▶ [低延时] ──┬─ Stars Lock Buffer (128×64B) ├─ WQE Lock Buffer (4K×64B, 昇腾) └─ WQE cache TA 内部: JFS(发送) ──SQE──▶ [拆解/切片] ──▶ TP ──▶ NL ──▶ DL_PHY JFR(接收) ◀──RQE── [收报文] ◀── TP RC表(远端命令暂存) ──RdResp/TAACK──▶ JFC(完成) ──CQE──▶ 软件 EQ(事件) ──EQE──▶ 软件

相关新闻

DBeaver 数据比较 + 性能监控实战指南:数据对不上、越查越慢?一篇讲透

DBeaver 数据比较 + 性能监控实战指南:数据对不上、越查越慢?一篇讲透

DBeaver 数据比较 性能监控实战指南:数据对不上、越查越慢?一篇讲透 【免费下载链接】dbeaver Free universal database tool and SQL client 项目地址: https://gitcode.com/GitHub_Trending/db/dbeaver 你是不是也遇到过这种头疼时刻&#xff…

2026/8/24 1:34:22 阅读更多 →
AI自主编程实战:Minimax Code CLI驱动M3模型完成OCR技术选型调研

AI自主编程实战:Minimax Code CLI驱动M3模型完成OCR技术选型调研

最近在 AI 编程工具领域,一个现象级的讨论是:当 AI 不仅能写代码片段,还能像人类开发者一样,通过命令行(CLI)自主执行复杂、长时间的任务时,会发生什么?Minimax 推出的 Code CLI&…

2026/8/24 1:34:22 阅读更多 →
Excel数据分析 4 大坑:Awesome Claude Skills 实战避坑指南

Excel数据分析 4 大坑:Awesome Claude Skills 实战避坑指南

Excel数据分析 4 大坑:Awesome Claude Skills 实战避坑指南 【免费下载链接】awesome-claude-skills A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows 项目地址: https://gitcode.com/GitHub_Trending/aw/aw…

2026/8/24 1:34:22 阅读更多 →

最新新闻

智能体自我进化新范式:基于多轮反馈动力学的技能学习系统

智能体自我进化新范式:基于多轮反馈动力学的技能学习系统

1. 项目概述:重新审视自我进化智能体的技能构建范式最近在折腾多轮反馈驱动的智能体系统时,我反复琢磨一个核心问题:我们是不是把“自我进化”这件事想得太简单了?市面上很多所谓的“自我进化”或“技能学习”智能体,其…

2026/8/24 2:31:52 阅读更多 →
Linux服务器硬件诊断三层工作流:系统层/固件层/物理层穿透指南

Linux服务器硬件诊断三层工作流:系统层/固件层/物理层穿透指南

1. 这不是命令列表,而是一套服务器硬件诊断工作流“Linux 查看硬件服务器命令大全”这个标题听起来像一份静态的工具手册,但实际在机房巡检、故障排查、新服务器上架或性能调优时,没人会逐条背诵lshw、dmidecode、smartctl这些命令——真正有…

2026/8/24 2:31:52 阅读更多 →
IIC总线协议详解:从硬件原理到软件调试实战

IIC总线协议详解:从硬件原理到软件调试实战

1. 项目概述:深入理解IIC总线如果你玩过单片机或者嵌入式开发,IIC这个名字大概率不会陌生。它和UART、SPI并称为嵌入式领域的“三巨头”通信协议,几乎在任何一个稍微复杂点的板子上都能找到它的身影。从读取一颗温湿度传感器,到配…

2026/8/24 2:31:52 阅读更多 →
小程序后端语言选型实战指南:Java、Node.js、PHP深度对比与决策框架

小程序后端语言选型实战指南:Java、Node.js、PHP深度对比与决策框架

1. 从“选型焦虑”到“决策框架”:聊聊小程序后端语言那点事每次看到“小程序后端用什么语言开发比较好”这个问题,我都能想起自己刚入行时,面对Java、Node.js、PHP这一堆选项,在搜索引擎和论坛里反复横跳的纠结。这感觉就像装修房…

2026/8/24 2:31:52 阅读更多 →
Windows本地部署DeepSeek-V4:从硬件选型到Agent与知识库集成全攻略

Windows本地部署DeepSeek-V4:从硬件选型到Agent与知识库集成全攻略

最近在尝试本地部署大模型时,发现很多开发者都被动辄几十GB的显存需求和复杂的Linux环境配置劝退。特别是像DeepSeek-V4这样的前沿模型,官方文档往往默认在Linux环境下运行,让不少Windows用户望而却步。本文将分享一套完整的方案,…

2026/8/24 2:31:52 阅读更多 →
从零搭建Agentic RAG系统:智能体驱动的检索增强生成实战指南

从零搭建Agentic RAG系统:智能体驱动的检索增强生成实战指南

这次我们来看一个在2026年技术栈下,被称为“目前最强的RAG实现方式”的Agentic RAG。如果你正在为传统RAG系统在复杂查询、多步推理和动态决策上的不足而头疼,那么这个结合了智能体(Agent)自主性与检索增强生成(RAG&am…

2026/8/24 2:30:52 阅读更多 →

日新闻

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践 前端安全依赖分层防护。没有任何单一配置能替代输出编码、权限校验和依赖更新。 把不可信内容当作数据 默认使用框架的转义能力;确需渲染 HTML 时,先在服务端或可信的客户端库中进行白名单过滤。避免把用户输入直接赋给 inne…

2026/8/24 1:08:15 阅读更多 →
Windows登录密码存储机制全解析:从哈希算法到安全加固实战

Windows登录密码存储机制全解析:从哈希算法到安全加固实战

1. 项目概述:Windows登录密码的“黑匣子”每次你按下CtrlAltDel,输入密码,然后看到那个熟悉的桌面,这背后发生了一系列复杂而精密的操作。作为一名长期与Windows系统打交道的从业者,我经常被问到:“我的密码…

2026/8/24 1:08:15 阅读更多 →
AI面试系统安全挑战与解决方案

AI面试系统安全挑战与解决方案

1. 项目概述:AI面试系统的安全挑战去年参与某跨国企业AI面试系统部署时,遇到一个典型案例:候选人在视频面试中无意提到竞争对手产品名称,系统竟自动将该信息关联到企业知识库并生成竞品分析报告。这个看似"智能"的功能&…

2026/8/24 1:08:15 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 0:06:02 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 0:20:20 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 0:14:11 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/23 18:47:06 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/23 12:10:44 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/22 3:22:48 阅读更多 →