长上下文旗舰同日登场,推理成本战改写产业算力格局|林伽一 · AI科技日报 | 2026年09月23日
今日 AI 产业出现一组相互印证的信号阶跃星辰发布 600B 参数的 Step 5 Preview、xAI 的 Grok 4.6 上线 Amazon Bedrock、阿里巴巴发布 7B 的 Qwen-Image-2.1同日还有 RBS-Attention 提出 20.65 倍的预填充加速方法、AWS 开源 Strands Harness 智能体框架。长上下文、多模态与推理成本的优化在同一天集中落地说明模型竞赛的焦点正从谁能做转向谁做得起。对技术从业者而言这些进展直接关系到推理服务的选型、成本结构与部署方案。技术主题 1长上下文旗舰同日发布MoE 架构与投机解码成为标配阶跃星辰发布面向智能体工作的新旗舰 Step 5 Preview目标负载为软件工程、专业知识工作与金融领域为总参数约 600B、每词元激活约 27B 的稀疏混合专家MoE模型上下文窗口达 100 万词元主要卖点是成本——团队称模型以显著更低的任务成本提供可比的智能水平[① MarkTechPost]。官方模型文档列出的规格包括模型 ID 为 step-5-preview输入支持文本、图像与视频输出为文本推理强度可选低、中、高并支持流式输出、工具调用、JSON 模式、JSON Schema 与提示缓存[① MarkTechPost]。架构上采用窄而深布局堆叠 92 层 Transformer研究团队认为更深堆叠为隐式多跳推理提供更长路径这在智能体搜索、执行代码与读取工具返回的长预填充阶段尤为重要[① MarkTechPost]。技术栈上Step 5 Preview 采用 MTP-3 投机解码、FP8 MoE 与 KV 缓存卸载训练依赖在线策略与长时程强化学习团队报告长时程强化学习端到端加速超过 3 倍[① MarkTechPost]。xAI 的 Grok 4.6 已在 Amazon Bedrock 中可用提供 50 万词元的上下文窗口支持低、中、高与超高四档可配置推理强度定位长时运行智能体、编码与知识工作[② AWS ML Blog]。两家的共同点是把长上下文与推理成本可控绑定设计而非单纯堆窗口长度。对自建推理服务的团队而言MoE 激活参数占比、投机解码深度与 KV 缓存策略正在成为评估长上下文模型可负担性的关键指标。对这类 MoE 长上下文模型的推理配置可作如下示意理解# 以下为根据公开摘要信息对[MoE长上下文模型推理配置]的理解示意 # 具体实现请查阅StepFun官方技术文档 class MoEInferenceConfig: total_params 600B # 总参数规模 active_per_token 27B # 每词元激活参数约4.5% context_window 1M # 100万词元上下文 reasoning_levels [low, medium, high] # 推理强度档位 speculative_decoding MTP-3 # 3步投机解码加速生成 fp8_moe True # FP8混合精度训练与推理对齐 kv_cache_offload True # KV缓存卸载以支撑长上下文⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。技术主题 2Qwen-Image-2.17B 统一图像生成与编辑混合粒度注意力提速阿里巴巴 Qwen 团队发布 Qwen-Image-2.1一个统一的文生图生成与图像编辑模型视觉生成部分为 7B 参数、32 层单流 DiT 结构单一检查点即覆盖文生图、多参考编辑、局部编辑与透明 RGBA 输出[① MarkTechPost]。7B 仅指扩散 Transformer流水线还会加载 8B 的 Qwen3-VL 编码器从最初的 20B 模型到 7BQwen-Image-2.1 把生成与编辑两项能力合并到一个约为原来三分之一大小的模型中团队称其为系列中最均衡、最具成本效益的模型[① MarkTechPost]。其速度主要来自注意力掩码设计文本词元使用词元级因果掩码图像词元在每张图像内使用块级双向掩码Qwen 称之为混合粒度注意力条件前缀位于噪声潜变量之前因而从不关注后者其键与值在去噪步骤间保持固定模型只在第一步计算文本与输入图像并在其余每一步复用该前缀 KV 缓存节省量随参考图像数量增加而增大这解释了多图速度主张[① MarkTechPost]。架构方面GitHub 仓库列出 4 个组件32 层 7B 单流 Transformer、Qwen3-VL 8B 文本编码器、64 通道 RGBA 自编码器16 倍空间压缩与原生透明度、Flow Matching 调度器[① MarkTechPost]。多参考编辑流程可示意如下# 以下为根据公开摘要信息对[Qwen-Image-2.1多参考编辑]流程的理解示意 # 具体实现请查阅Qwen官方技术文档 # 混合粒度注意力文本词元词元级因果掩码 图像词元块级双向掩码 # 条件前缀KV在去噪步骤间固定复用 → 多图场景显著提速 def multi_ref_edit(prompt, ref_images): cond_prefix encode_text_and_images(prompt, ref_images) # 仅第一步计算 z sample_noise() for step in denoise_steps: z transformer_block(z, cond_prefix) # 复用前缀KV缓存 return decode_rgba(z) # 原生透明度输出⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。技术主题 3RBS-Attention免训练稀疏预填充20.65 倍加速背后的双分支设计长上下文大语言模型推理日益受限于预填充阶段因为生成开始前稠密自注意力需要处理整个提示。arXiv 新论文提出免训练的稀疏预填充方法 RBS-Attention针对块质心把相关词元埋在无关词元之中、作者称为均值稀释的失效模式[③ arXiv cs.AI]。该方法包含两个互补的选择分支质心基分支捕捉平均相关性救援分支利用最大键块半径及其随提示、层与注意力头变化的分布识别存在被低估风险的块对两个分支独立设阈并合并掩码可控制救援块的贡献同时保留常规的块稀疏 FlashAttention 执行[③ arXiv cs.AI]。实测数据方面在 H100 GPU 上RBS-Attention 在 Qwen3-30B-A3B-Instruct-2507-FP8 模型的 128K 长度下实现 20.65 倍单机预填充注意力加速、11.92 倍 vLLM 预填充注意力加速与 5.97 倍端到端首词元时间加速在稠密 Qwen3-32B 模型上取得 88.65 的 RULER 总体准确率而稠密注意力为 89.52[③ arXiv cs.AI]。配套实验测量了实际保留率、在匹配密度下比较选择器并刻画了块大小、阈值与内存行为。对工程团队而言这类免训练方法与既有 FlashAttention 执行路径兼容是低改造成本接入长上下文推理的可行方向。双分支掩码合并逻辑可示意如下# 以下为根据公开摘要信息对[RBS-Attention双分支选择]的理解示意 # 具体实现请查阅arXiv论文 2609.20971 def rbs_prefill_mask(query_blocks, key_blocks, radius): # 质心基分支捕捉平均相关性按块质心相似度设阈 centroid_mask threshold_by_centroid_similarity(query_blocks, key_blocks) # 救援分支利用最大键块半径识别被低估风险的块 rescue_mask threshold_by_key_block_radius(key_blocks, radius) # 两分支独立设阈后合并掩码保留块稀疏FlashAttention执行 return merge_masks(centroid_mask, rescue_mask)⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。技术主题 4开源智能体框架与多设备推理工程侧的降本路径AWS 的 Strands Agents 团队发布 Strands Harness一个完整组装、通用型的开源智能体框架可在本地运行或部署到云厂商以 Apache 2.0 许可证提供 Python 与 TypeScript 版本一行代码即可启动[① MarkTechPost]。团队报告称在 6 个基准上运行相同的 Claude 或 GPT 模型时其成本比其他框架低 28%、精度基本相当[① MarkTechPost]。其开箱即用的 create_harness() 返回的智能体可以通过 Amazon Bedrock、Anthropic、OpenAI、Google、Ollama 或 LiteLLM 运行自带 shell、文件读、写、编辑与网页工具把体积庞大的工具结果卸载到文件并缓存重复使用部分跨运行保持长期记忆并依据会话 ID 恢复对话将开放式子任务委派给内置辅助智能体发现 Agent Skills 时自动加载[① MarkTechPost]。NVIDIA 侧则推出 TensorRT 多设备推理单个 TensorRT 网络可在 NCCL 支持的分布式集合通信上跨多张 GPU 执行同时保留 TensorRT 的推理优化自 TensorRT 11.0 起全面支持[④ NVIDIA Blog]。生成式 AI 的计算与内存需求日益超出单张 GPU 所能提供的范围多设备集成让单个模型的推理跨越 GPU 边界面向多 GPU 服务场景提供了新的部署选项[④ NVIDIA Blog]。对工程团队而言Strands Harness 解决智能体框架选型与成本、TensorRT 多设备解决单模型跨 GPU 扩展两条路径分别从软件层与硬件层压缩智能体运行与模型服务的成本。结合二者一个典型的多 GPU 长上下文服务栈可以同时利用稀疏预填充降低首词元延迟、利用 KV 缓存卸载缓解显存压力、利用跨设备集合通信突破单卡容量——这些优化叠加起来正是长上下文进入可负担区间的工程基础[③ arXiv cs.AI][④ NVIDIA Blog]。技术主题 5智能体评估与 DAPO从工具调用到任务完成的可量化进展NVIDIA 提出智能体评估视角当你上线一个 AI 智能体时关键在于它能否在真实环境中跨几十个顺序工具调用执行一整链工作并在某一步失败时恢复仅仅对模型听起来对不对打分几乎无法说明工作是否真正完成正是这一差距促使智能体评估从对单个函数调用打分演进为对整个任务打分[④ NVIDIA Blog]。这一评估框架对智能体工程有直接参考价值——衡量标准应从模型输出质量迁移到端到端任务完成率与失败恢复能力。开源侧DAPO 发布一个用于大规模大语言模型强化学习的系统基于 Qwen2.5-32B 基础模型在 AIME 2024 上取得 50 分完全开源包括算法细节、数据集与基础设施[⑤ TLDR AI]。这类可复现的强化学习基础设施为开发者提供了训练与评估智能体的开源参考实现。趋势判断趋势一长上下文与推理成本绑定设计成为旗舰模型共同主线。Step 5 Preview 以 600B 总参数、27B 激活、100 万上下文主打成本[① MarkTechPost]Grok 4.6 以 50 万上下文加四档推理强度适配长时运行智能体[② AWS ML Blog]RBS-Attention 则从预填充侧把长上下文成本墙下压 20.65 倍[③ arXiv cs.AI]。三个样本从模型设计、平台接入与算法优化三个层面共同指向把长上下文做进可负担成本区间这一主线。趋势二多模态模型走向更小、更统一、更省。Qwen-Image-2.1 把生成与编辑合并进 7B 单流 DiT较 20B 前代压缩约三分之二[① MarkTechPost]混合粒度注意力与条件前缀 KV 复用直接降低多图场景开销[① MarkTechPost]。多模态推理的硬件门槛正在随参数压缩与注意力优化同步下移。趋势三智能体工程从能做转向可评估、可降本。Strands Harness 以 28% 更低 token 成本提供可比精度[① MarkTechPost]NVIDIA 把智能体评估标准从函数调用升级到整个任务完成[④ NVIDIA Blog]DAPO 提供开源强化学习基础设施[⑤ TLDR AI]。智能体开发正进入以可度量、可复现为特征的工程化阶段。对团队而言这意味着选型标准同步变化除了模型能力本身框架的 token 成本、工具链的失败恢复能力、评估基准的覆盖度都将成为部署决策的核心变量。结尾今日的技术主线清晰长上下文旗舰同日登场、7B 图像模型统一生成与编辑、20.65 倍预填充加速、开源智能体框架与多设备推理同步落地。对开发者而言短期最值得跟进的是 Qwen-Image-2.1 的 Day 0 生态接入Diffusers、ComfyUI、vLLM-Omni、SGLang 与 LightX2V与 Strands Harness 的一行启动体验中期则需要关注 MoE 激活参数占比、投机解码与 KV 缓存策略对推理成本的影响以及智能体评估框架从单函数到全任务的迁移。在长上下文×低成本的主线下谁能把能力做进可负担的成本区间谁就更有可能赢得下一轮部署。【资讯来源】本文综合整理自以下公开信息源。 ① MarkTechPost, 2026年09月21日 14:37 北京时间 / 09月20日 23:37 美西时间 ② AWS ML Blog, 2026年09月22日 02:30 北京时间 / 09月21日 11:30 美西时间 ③ arXiv cs.AI, 2026年09月22日 12:00 北京时间 / 09月21日 21:00 美西时间 ④ NVIDIA Blog, 2026年09月22日 05:51 北京时间 / 09月21日 14:51 美西时间 ⑤ TLDR AI, 2026年09月21日 21:56 北京时间 / 2026年09月21日 06:56 美西时间【免责声明】 本日报为AI行业每日公开信息汇总整理仅供读者快速了解行业动态不构成任何投资建议。所有信息均来源于公开渠道本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速内容发布后可能发生更新请以官方最新信息为准。据此作出的任何决策全部风险自担。© 2026 林伽一 · AI科技日报#长上下文 #MoE #Qwen-Image-2.1 #RBS-Attention #智能体框架

相关新闻

第一章-导言

第一章-导言

1.1入门 咱们学习一门编程语言&#xff0c;第一个程序当然是打印"hello worlld". #include <stdio.h>int main() {printf("hello world\n");return 0; } 一个C语言程序的运行必须要有main函数&#xff0c;他是函数的入口。printf("hello world…

2026/9/24 17:54:46 阅读更多 →
从零开始用 Linux:文件与目录操作

从零开始用 Linux:文件与目录操作

先确认你在哪&#xff1a;看终端的提示符——fjxfjx:~$ → 已经在 Ubuntu 里&#xff0c;直接往下敲C:\Users\72344> → 还是 Windows 的 cmd&#xff0c;先敲 wsl 回车进去第一步&#xff1a;装 g&#xff08;三条命令&#xff0c;依次敲&#xff09;sudo —— 怎么以管理员…

2026/9/24 17:54:46 阅读更多 →
技术碎碎念01

技术碎碎念01

一、多智能体系统1.1 受控多智能体 vs 开放式多智能体开放式的多智能体稳定性太难控制&#xff0c;操作不可预期。受控多智能体是一种很好的解决方案&#xff0c;虽然会丢失一些灵活性&#xff0c;但从企业场景的稳定性来看&#xff0c;很值得考虑。先固定再谈论自由&#xff0…

2026/9/24 17:54:46 阅读更多 →

最新新闻

C#仓库管理系统课设源码解析:WinForms+SQL Server数据访问与事务实践

C#仓库管理系统课设源码解析:WinForms+SQL Server数据访问与事务实践

简介&#xff1a;基于C#的仓库管理系统毕业设计资料包&#xff0c;面向需要完成课程设计或毕业设计的计算机专业学生&#xff0c;以及希望快速搭建进销存类小型信息管理系统的开发者。系统覆盖货物入库、出库、调库等核心业务&#xff0c;并包含仓库单位、货物类别、供货商、客…

2026/9/24 18:48:27 阅读更多 →
2026网络安全入行指南:岗位分层、学习路线与证书盘点

2026网络安全入行指南:岗位分层、学习路线与证书盘点

这事儿最近一年我被人问得特别多。亲戚家的孩子、以前的老同学、甚至刚毕业的实习生&#xff0c;开口第一句基本都是“听说网络安全很缺人&#xff0c;年薪几十万&#xff1f;现在转行还来得及吗&#xff1f;”再看看网上的宣传口径&#xff0c;什么“人才缺口100万”“行业年均…

2026/9/24 18:48:27 阅读更多 →
ST-GCN动作识别全链路实战:从图构建到实时部署

ST-GCN动作识别全链路实战:从图构建到实时部署

简介&#xff1a;本资源是一套基于时空图卷积网络&#xff08;ST-GCN&#xff09;的骨骼动作识别完整毕设实现&#xff0c;面向计算机、人工智能及相关专业高年级本科生&#xff0c;专为毕业设计、课程设计及深度学习项目实战打造。代码复现了ST-GCN在NTU-RGBD与Kinetics骨骼数…

2026/9/24 18:48:27 阅读更多 →
Nginx容器化实战:从Docker部署到网关入口

Nginx容器化实战:从Docker部署到网关入口

做了这么多年后端和运维&#xff0c;我越来越觉得Nginx容器化是绕不开的一项基础技能。不管你是用docker run直接拉一个nginx镜像来跑静态站点&#xff0c;还是用docker-compose把它编排到微服务集群里做统一入口&#xff0c;容器里的Nginx和传统裸机上的Nginx在配置细节、排障…

2026/9/24 18:48:27 阅读更多 →
博物馆AR眼镜无线网络方案:AC+AP与电力猫混合部署实践

博物馆AR眼镜无线网络方案:AC+AP与电力猫混合部署实践

先聊点实际的&#xff1a;我年初接手了一个市级博物馆的AR眼镜导览项目&#xff0c;设备选型和内容制作都好说&#xff0c;真正磨人的是从进场施工那天开始就一直没消停的无线网络。AR眼镜这东西对Wi-Fi的依赖比手机高得多&#xff0c;每副眼镜都在实时拉取3D模型、播放讲解视频…

2026/9/24 18:48:27 阅读更多 →
Docker与K8s全方位对比:云原生容器化落地指南

Docker与K8s全方位对比:云原生容器化落地指南

1. 云原生到底在说什么 我经常在面试和团队交流的时候被问到同一个问题&#xff1a;“云原生是不是就是 Docker 加 K8s&#xff1f;”每次听到这种问题&#xff0c;我都能理解提问者的困惑&#xff0c;因为这个概念被各种技术文章和厂商宣传包装得太玄了。但答案其实没那么复杂…

2026/9/24 18:47:26 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介&#xff1a;这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源&#xff0c;围绕YOLOv8实现渔船作业监控系统&#xff0c;可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件&#xff0c;约24.21MB&#xff0c;以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介&#xff1a;一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码&#xff0c;针对计算机相关专业正在做毕设或需要项目实战的学习者&#xff0c;可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过&#xff0c;可直接运行&#xff0c;覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住&#xff0c;是在一个老旧的WinForms模块里&#xff1a;几十个类依赖PropertyChanged通知&#xff0c;运行时反射读属性、发通知&#xff0c;每次启动慢半拍不说&#xff0c;一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事&#xff1a;用Flutter给OpenHarmony做一款游戏集合类的App&#xff0c;说白了就是把若干小游戏塞进一个壳里&#xff0c;用统一入口分发。这个方向本身不算新鲜&#xff0c;真正让我花了不少心思的&#xff0c;是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档&#xff0c;最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事&#xff1a;今天在表后面多加了两个空白行&#xff0c;明天给客户交稿前发现整个章节的编号全部错位&#xff0c;光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年&#xff0c;说实话&#xff0c;第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年&#xff0c;流量惨淡、功能臃肿、代码自己都懒得看第二遍之后&#xff0c;我才慢慢琢磨明白一个道理&#xff1a;第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践&#xff1a;原型怎样变成可用功能分类&#xff1a;[AI/大模型]细分主题&#xff1a;AI 增强型 CI/CD 流水线自动化与 GitOps 实践&#xff1a;Agent 工作流、工具调用与任务拆解&#xff1a;从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战&#xff1a;复盘记录怎样真正派上用场分类&#xff1a;[工程技术]细分主题&#xff1a;Kubernetes 生产环境运维与排障实战&#xff1a;可复制的项目复盘模板与决策记录大部分团队的事故复盘报告&#xff0c;最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理&#xff1a;核心链路应该先拆哪一步分类&#xff1a;[工程技术]细分主题&#xff1a;Docker 容器化技术与镜像安全管理&#xff1a;核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用&#xff08;包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →