算力平权的破局者:芯展速跳出堆料内卷,用存储重构中小企业AI落地路径
2026世界人工智能大会WAIC上存储是一条绝对的主线几乎所有硬件厂商都在反复传递同一个行业共识存算协同是决定大模型推理上限的核心变量。资本持续向存储赛道倾斜技术迭代的速度肉眼可见但热闹喧嚣背后一道难以弥合的行业鸿沟正在不断拉大。过去二十年GPU算力实现了近60000倍的跨越式提升可配套显存容量仅仅增长16倍算力与存储的增速严重失衡催生了行业无法回避的“内存墙”难题。不管是消费级RTX显卡还是数据中心顶配H200、A100服务器芯片算力利用率常年卡在30%60%区间昂贵的计算单元只能长时间等待数据调度持续空转。而随着多轮对话、长文档分析、代码智能体等应用普及长上下文推理成为用户日益迫切的需求而长上下文推理阶段的KV Cache会呈指数级膨胀进一步放大显存容量不足的矛盾。行业给出的解决方案却自带天然门槛头部云厂商的标准缓存集群起步就要部署三四台服务器整套硬件投入动辄上百万即便开源社区有零散的KV Cache卸载工具也需要专业技术团队长期运维调优中小企业、高校实验室、初创研发团队根本无力承担硬件与人力的双重成本。一边是全行业加速拥抱大模型的时代浪潮一边是算力资源高度集中、中小从业者“买不起、跑不动、用不好”的现实困境。整个市场都在等待一套轻量化、低成本、可快速落地的普惠存算方案。今年WAIC成立仅三年的国产存储厂商芯展速交出了自己的答案——自研AI90 FaaS存算协同架构联合威尔创新、思腾合力两家服务器厂商完成全链路实机验证仅凭消费级RTX 5090显卡就跑出对标企业级高端服务器的推理性能引来了我们的关注。展会间隙我们与芯展速产品副总裁许玮、高级FAE总监杨泽宏展开深度对话试图读懂这家由行业老兵组建的新锐企业如何跳出行业堆料内卷用一套朴素务实的技术路线打通中小企业使用AI的最后一道门槛。三年新锐二十载积淀一家不走寻常路的全栈存储厂商当下市场里的AI硬件玩家大多有着清晰的业务边界很少有厂商能同时打通存储介质、连接芯片、AI调度软件三条技术链路芯展速是国内为数不多的“存-连-管”全栈厂商。2023年才成立的时间节点很容易让人误以为芯展速是跟风入局的创业团队但深挖团队背景便能发现这家年轻公司的内核是一群深耕存储、服务器行业二十年的老兵经历了多代PCIe接口、企业级SSD产品的迭代周期常年扎根数据中心与边缘工作站一线亲眼见证了算力资源分配失衡带来的行业痛点。杨泽宏坦言大厂成熟的KV Cache分层方案技术上完全可行但从诞生之初就注定与中小客户无缘。“一套标准缓存集群至少需要三四台服务器搭配使用硬件采购、机房部署、专人运维整套成本压下来初创公司、高校实验室根本没有落地的条件。芯展速最核心的初衷就是把大型数据中心成熟的分层缓存技术压缩到单台工作站中让普通团队也能用上。”不同于市面上单纯售卖硬件的厂商芯展速从底层实现全链路自研企业级SSD主控、固件、PCIe Retimer/Redriver信号连接芯片全部自主开发本次配套AI90方案亮相的PT200Z AI SSD采用自研pSLC存储介质颗粒分测、模组设计环节完全自主把控仅硬件组装交由代工厂完成从根源上摆脱了对外媒、进口芯片的依赖。许玮补充道芯展速从成立之初就定下了差异化的市场路线避开行业扎堆争夺的万卡级大型数据中心赛道将核心目标客群锁定中小企业研发团队、私有化部署机构、高校实验室。产品矩阵也依照客户需求分层规划当下主力AI90面向中小B端多卡工作站集群后续会推出适配AI PC、个人本地大模型的轻量化AI30针对超大型算力中心的AI100、AI200系列则延后布局先解决市场最迫切的普惠算力需求从小场景积累落地经验再逐步向上拓展大客户市场。更独特的一点是芯展速的行业定位他们不生产GPU、不自研服务器整机只输出存储硬件与调度中间件以底层技术底座的身份和整机厂商形成互补共生的生态关系这也是本次WAIC能够同步携手威尔创新、思腾合力联合布展、同步完成实机演示的核心原因。解码AI90重构存算底层逻辑破解困住行业的“内存墙”瓶颈本届WAIC世博展览馆的主题演讲台上许玮正式对外发布AI90 FaaS for AI软硬一体化推理加速架构这也是芯展速针对算存失衡痛点打磨出的系统性解决方案。在他的分享中AI90的核心思路跳出了行业“单纯扩容高端显存”的惯性思维用分层存储的思路重新分配算力与缓存负载从系统层面彻底释放GPU闲置算力。整套方案的核心架构分为两大支撑板块一是KV Cache分层卸载体系二是自研智能P2P互联技术二者相辅相成补齐了当前AI推理领域两大难以解决的短板。传统大模型推理流程中一旦GPU显存被KV缓存占满操作系统vLLM会启动通用内存淘汰机制清理数据被清理的对话、文档上下文只能重新计算在一个长上下文或是多租户的推理环境下动辄带来数十乃至成百上千秒的响应延迟。而AI90自研管理中间件开辟了独立于系统内存调度的专属数据通道将低频、长期留存的KV Cache自动分层卸载至PT200Z高速AI SSD搭建起HBMDRAMSSD三级虚拟存储池TB级的扩展容量可以持续承接缓存数据避免重复计算带来的性能损耗。承载这套分层架构的PT200Z SSD是专为AI高频读写场景定制的硬件底座。它采用pSLC存储级介质最高可达100DWPD耐久度对比普通TLC SSD 1-3的DWPD数值耐久能力形成碾压级优势45微秒的读取延迟、字节级寻址特性完美适配KV Cache碎片化、反复擦写的工作负载能够支撑7×24小时不间断推理五年运行周期内不会出现明显性能衰减。杨泽宏也解释了选用pSLC介质的考量“短期采购成本确实高于普通闪存但放到全生命周期测算它的磨损损耗、替换成本大幅降低从写入寿命和维护成本乃至性能收益来看对于预算有限的中小企业来说长期使用反而更划算。”智能P2P互联则瞄准消费级显卡与生俱来的通信短板。原厂RTX系列显卡会屏蔽GPU直连通道多卡并行推理时数据必须经过CPU中转传输延迟高达10微秒以上严重损耗集群并行算力。AI90通过驱动层重定向技术无需修改显卡BIOS、不影响硬件质保就能实现GPU之间数据直连将传输延迟压缩至数百纳秒到1微秒区间8卡5090集群实测推理性能提升5.8倍彻底打通消费级多卡集群的扩展瓶颈。目前方案已完整兼容3090、4090、5090全系NVIDIA显卡完成AMD 7900系列适配后续还会持续推进国产算力卡的兼容开发。整套技术架构的价值在WAIC现场两台合作厂商的工作站上得到了直观验证。4卡RTX 5090集群运行Llama 3 70B大模型搭载AI90前后的数据对比极具冲击力Token吞吐量从120 tk/s飙升至610 tk/s整体性能提升5.1倍64K超长上下文首Token延迟从27.99秒骤降至0.564 秒响应速度提升近50倍GPU显存利用率从原本30%-40%提升至 85%95%长期存在的算力空转问题得到根治。同时方案具备“越长・越优”的特性输入文本、对话上下文越长加速效果越突出完美适配长文档解析、代码生成、多轮历史对话等复杂场景原生支持128K以上超长上下文窗口。相较于市面上同类缓存卸载方案AI90最鲜明的差异化优势在于它极致的普惠属性。无需更换价格高昂的HBM企业级服务器企业现有的消费级RTX工作站就能直接改造标准硬件环境下一天内就能完成驱动安装、推理框架适配、模型完整跑通不用配备专业存储运维团队同时原生兼容vLLM、TensorRT-LLM等主流推理框架客户无需修改业务代码开箱即可投入使用PT200Z SSD支持按需叠加扩容虚拟显存容量可随业务增长弹性拓展不会造成硬件资源浪费。许玮这样总结AI90的设计内核“行业长久以来陷入比拼单卡显存容量的内卷我们换了一条更务实的工程路径用分层存储稀释HBM显存带来的高昂成本让每一块GPU算力都能产出更多Token这才是真正贴合中小企业真实需求的解决方案。”生态共生携手整机伙伴共建普惠算力小方案撬动广阔市场本次WAIC展会上芯展速同步落地威尔创新、思腾合力两大合作展台两套差异化的整机合作模式完整勾勒出芯展速的生态共建思路也印证了这家存储厂商“不单打独斗联合全产业推平算力门槛”的长期规划。威尔创新是深耕AI定制服务器领域的高新技术企业自研4U空间容纳8张计算卡的高密度GPU整机产品广泛落地政企、国央企、传统行业私有化算力项目。双方将AI90存算协同底座、智能调度软件深度嵌入威尔创新液冷GPU工作站面向对稳定性、硬件密度有高要求的政企客户交付软硬件一体化整机方案实打实验证消费级硬件承接企业级业务的可行性。另一边的思腾合力稳居IDC中国加速服务器榜单TOP 8是NVIDIA精英级合作伙伴、华为昇腾APN钻石伙伴拥有千卡级AI算力集群的完整交付经验。双方的合作聚焦互联网初创团队、AI研发工作室、中小算力租赁厂商针对多卡集群推理、LoRA模型微调、日常模型开发场景完成全链路调优打通AI90缓存调度系统与思腾合力自研集群调度平台为中小算力服务商提供低成本、高吞吐的集群加速方案。选择与整机厂商深度合作背后是芯展速清晰的分工逻辑。芯展速专注存储硬件、调度中间件的底层研发服务器厂商深耕整机制造、渠道交付、行业客户触达双方能力互补不用投入巨额资金搭建整机产线、拓展线下渠道。杨泽宏用一个很形象的比喻概括这种合作关系“我们不会自己下场做服务器整机专业的事交给专业的合作伙伴我们输出存算协同的核心技术能力为整机厂商赋能。”放眼长期生态布局芯展速采取分层推进的合作策略。短期持续拓展服务器 ODM、OEM 厂商完成更多品牌整机的适配调试中期联动PC、AI PC整机品牌推出面向个人开发者的轻量化AI30方案长期对接国产算力芯片厂商、各大高校科研机构搭建完整的国产化普惠算力生态。许玮透露后续团队会逐步开放标准化适配工具链简化硬件厂商接入AI90方案的流程让分层存算架构成为行业通用的低成本落地路径。算力平权藏在芯展速朴素的产业理想里当行业头部企业扎堆堆砌HBM高端硬件争先恐后抢夺大型数据中心客户时芯展速主动选择了一条更朴素、更贴近市场底层需求的赛道。他们看见被行业主流方案忽略的中小企业摒弃高价堆料的捷径依靠成熟、轻量化、低成本的分层存储技术一点点消解高端算力构筑的资源壁垒。许玮在采访中提出了一个极具行业参考价值的判断AI产业发展已经走过“单纯比拼算力规模”的阶段正式迈入“以效能为核心”的全新周期。一味堆叠高端GPU只能持续抬高行业落地成本无法从根源上解决中小企业的算力困境存算协同才是实现算力普惠的核心抓手。芯展速打造AI90、搭建产业生态的终极目标从来不是推出一款单项性能顶尖的硬件单品而是打破算力资源的垄断格局让每一家中小企业、每一位独立开发者、每一所高校实验室不用承担天价硬件采购成本仅凭手边现有的消费级显卡就能流畅运行大模型、搭建高并发超长上下文推理服务让“算力平权”不再是一句空洞的行业口号。杨泽宏在访谈尾声聊起了团队的底层理想。印刷术实现了知识的普及互联网打通了信息传递的边界而AI是解放人类创造力的下一代基础设施。算力资源的高度集中就像贵族垄断图书馆只会阻断各行各业的创新活力芯展速所有的技术研发、生态合作最终都落脚于降低AI使用门槛让各行各业的从业者不必被高昂硬件成本束缚依托平价硬件释放AI的产业价值。这条立足真实客户痛点、拒绝盲目堆料内卷的朴素路线或许会重新定义国产AI存储厂商的发展路径也为整个行业提供了一条兼顾技术创新与产业普惠的全新思路。

相关新闻

企业给 WorkBuddy 安装第三方 Skill 前,为什么要先做权限与数据流审查?

企业给 WorkBuddy 安装第三方 Skill 前,为什么要先做权限与数据流审查?

企业给 WorkBuddy 安装第三方 Skill 前,为什么要先做权限与数据流审查? 企业给 WorkBuddy 安装第三方 Skill 前,应把它当作一项可执行的软件能力审查,而不是普通提示词模板。Skill 可能读写本地文件、调用系统命令或第三方 API&a…

2026/7/24 12:21:15 阅读更多 →
2026年AI开源工具适配与优化全解析

2026年AI开源工具适配与优化全解析

1. 2026年AI开源工具适配全景图2026年,AI开源工具生态已进入成熟期,各类垂直领域的工具链日趋完善。从GitHub等开源平台的统计数据来看,当前AI工具主要呈现三大特征:模块化程度显著提升(约78%的工具支持即插即用&#…

2026/7/24 12:21:15 阅读更多 →
通用 AI 基础认知

通用 AI 基础认知

大语言模型基础核心概念 1. Token(令牌) 1.定义 中文:1 个汉字≈2 个 Token;英文:1 个短单词≈1 个 Token,长单词会被拆分;符号、数字、空格单独占 Token。 2.关键作用(后端重点&…

2026/7/24 12:21:15 阅读更多 →

最新新闻

做网站可以用哪些平台?按展示、获客和技术维护需求来选

做网站可以用哪些平台?按展示、获客和技术维护需求来选

做网站的平台可以按任务来选:基础展示需要页面与手机适配,内容获客需要文章、TDK、sitemap和表单,多语言业务还要考虑翻译、访问速度和资料维护,复杂系统则需要接口、权限或定制开发。凡科杰建云、Wix等标准化平台适合较快搭建企业…

2026/7/24 12:28:17 阅读更多 →
DP83848Q-Q1以太网PHY芯片硬件设计:MII/RMII接口、PCB布局与阻抗计算实战

DP83848Q-Q1以太网PHY芯片硬件设计:MII/RMII接口、PCB布局与阻抗计算实战

1. 项目概述与芯片定位在嵌入式网络设备的设计中,以太网物理层收发器(PHY)是连接微控制器或FPGA(MAC层)与物理传输介质(如双绞线)的桥梁。它负责将MAC层产生的并行数字信号,转换成能…

2026/7/24 12:28:17 阅读更多 →
TI ADS7142-Q1车规ADC:从手动采样到自主监控的配置实战

TI ADS7142-Q1车规ADC:从手动采样到自主监控的配置实战

1. 项目概述与核心价值在嵌入式硬件开发,尤其是汽车电子、工业传感或电池管理系统这类对可靠性和实时性要求极高的领域,如何高效、精准地采集模拟信号,并将其转化为数字世界可处理的“语言”,是每个工程师必须面对的课题。模数转换…

2026/7/24 12:28:17 阅读更多 →
JavaScript基础语法与数据类型实战解析

JavaScript基础语法与数据类型实战解析

1. 项目概述作为一名从后端转前端的开发者,我清楚地记得刚开始学习JavaScript时的困惑与兴奋。第六天的学习日记记录了我对JS基础语法和数据类型从懵懂到理解的关键转折点。这篇文章将完整还原我的学习路径,包含那些官方文档不会告诉你的理解技巧和常见误…

2026/7/24 12:28:17 阅读更多 →
Google外贸SEO优化中的搜索结果摘要优化,别浪费这个位

Google外贸SEO优化中的搜索结果摘要优化,别浪费这个位

搜索结果页的“黄金展位”:为什么你的摘要决定了流量的去留在外贸数字营销领域,一个不争的事实正在被越来越多的出海企业所感知:传统的搜索引擎优化逻辑正在被重构。过去,我们执着于让网站的某个页面在谷歌搜索结果中排名第一&…

2026/7/24 12:28:17 阅读更多 →
AI系统失控真相(普通软件绝不会发生的4类故障):2024年生产环境实测数据曝光

AI系统失控真相(普通软件绝不会发生的4类故障):2024年生产环境实测数据曝光

更多请点击: https://kaifayun.com 第一章:AI系统失控真相(普通软件绝不会发生的4类故障):2024年生产环境实测数据曝光 在2024年Q1至Q3的17个大型AI服务生产集群(涵盖推荐、AIGC、金融风控三类场景&#x…

2026/7/24 12:27:17 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻