Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试
Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型采用 Mixture-of-ExpertsMoETransformer 架构支持文本、图像和音频等多模态输入并生成文本输出。模型拥有约 975B 总参数、41B 激活参数并支持最长 1M token 上下文窗口。在能力方面Inkling 面向通用智能、Agent、工具调用以及复杂推理任务进行了优化同时支持 MTPMulti-Token Prediction等推理加速技术可结合 vLLM、SGLang 等主流推理引擎进行部署。1. 登录 GPUStack 选择推理后端测试环境8 × H20-141G2. 添加版本点击添加版本Add Version镜像名称vllm/vllm-openai:nightly3. 点击部署开始部署Node 0 参数--trust-remote-code --tokenizer-modeinkling --kernel-config.enable_flashinfer_autotuneFalse --tensor-parallel-size8--data-parallel-size2--data-parallel-size-local1--enable-expert-parallel --data-parallel-rpc-port13389--data-parallel-address10.91.3.213 --data-parallel-hybrid-lb --max-model-len131072--max-num-seqs10--enable-auto-tool-choice --tool-call-parserinkling --speculative-config{method:mtp,num_speculative_tokens:1}--reasoning-parserinkling环境变量PYPI_PACKAGES_INSTALLscipy1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/Node 1 参数--trust-remote-code --tokenizer-modeinkling --kernel-config.enable_flashinfer_autotuneFalse --tensor-parallel-size8--data-parallel-size2--data-parallel-size-local1--data-parallel-start-rank1--enable-expert-parallel --data-parallel-rpc-port13389--data-parallel-address10.91.3.213 --data-parallel-hybrid-lb --max-model-len131072--max-num-seqs10--enable-auto-tool-choice --tool-call-parserinkling --speculative-config{method:mtp,num_speculative_tokens:1}--reasoning-parserinkling环境变量PYPI_PACKAGES_INSTALLscipy1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/模型进入 Running 状态后可以直接通过 GPUStack 试验场进行交互测试。在默认配置下Inkling 输出速度达到80 Tokens/s能够正常完成多轮文本对话并支持思考过程解析。同时支持原生多模态能力。4. 测评测试配置Input Length64KOutput Length3KRequests10测试结果如下指标结果Output Token Throughput56.10 tok/sPeak Output Throughput78.00 tok/sTotal Token Throughput1253.09 tok/sMean TTFT92.77sMean TPOT97.09 ms/token在长上下文输入场景下Inkling 可以稳定完成 64K 上下文推理任务并保持持续输出能力。

相关新闻

计算机毕业设计之智慧校园出行平台

计算机毕业设计之智慧校园出行平台

快速发展的社会中,人们的生活水平都在提高,生活节奏也在逐渐加快。为了节省时间和提高工作效率,越来越多的人选择利用互联网进行线上打理各种事务,然后线上管理系统也就相继涌现。与此同时,人们开始接受方便的生活方式…

2026/7/22 15:25:53 阅读更多 →
本地部署通义千问Qwen3与WinClaw智能网关集成指南

本地部署通义千问Qwen3与WinClaw智能网关集成指南

1. 项目概述最近在折腾一个挺有意思的项目——把阿里云的通义千问Qwen3大模型接入到WinClaw这个Windows平台上的智能网关工具里。WinClaw其实是OpenClaw的Windows适配版本,主要功能是作为大语言模型和本地系统操作之间的桥梁。简单来说,就是让AI不仅能跟…

2026/7/23 19:02:33 阅读更多 →
(Python基础教程之十七)Python OrderedDict –有序字典

(Python基础教程之十七)Python OrderedDict –有序字典

一个OrderedDict 维护插入顺序添加到字典中的项目。项目的顺序在迭代或序列化时也会保留。 1. Python OrderedDict示例 OrderedDict 是python collections模块的一部分。 要轻松构建OrderedDict,可以OrderedDict在collections模块中使用。 OrderedDictExample.py from col…

2026/7/22 15:25:53 阅读更多 →

最新新闻

全球100所顶尖高校的AI转型给中国高校带来什么启示?

全球100所顶尖高校的AI转型给中国高校带来什么启示?

2026年6月,全球可持续发展大会在印度尼西亚雅加达举行。北京师范大学智慧学习研究院联席院长黄荣怀教授在会上正式发布了研究报告《引领全球教育变革:百所顶尖高校AI创新实践》。这份历时两年、覆盖六大洲30个国家和地区的100所高校的研究,从…

2026/7/23 21:13:52 阅读更多 →
露易丝·海的诗歌17

露易丝·海的诗歌17

我热爱并赞赏自己在我所处的无穷无尽的生命中,一切都完美、完整、完全。我将健康视为自然状态。现在,我有意识地抛弃内心中可能会表现为多种疾病的思维模式。我热爱并赞赏自己。我用营养丰富的饮食滋养自己。我以各种有趣的方式进行锻炼,增强…

2026/7/23 21:13:52 阅读更多 →
AI绘图实战:把人类演化时间轴做成3D写实信息图

AI绘图实战:把人类演化时间轴做成3D写实信息图

🔥 个人主页: 杨利杰YJlio ❄️ 个人专栏: 《Windows 疑难杂症与工单复盘案例库》 《Sysinternals实战教程》 《WINDOWS教程》 《Windows PowerShell 实战》 《人工智能实战合集》 《超简单:用Python让Excel飞起来…

2026/7/23 21:13:52 阅读更多 →
红队蓝队怎么选,2026 网络安全两大主流方向深度对比

红队蓝队怎么选,2026 网络安全两大主流方向深度对比

站在十字路口:红队与蓝队的职业抉择 2026 年的网络安全行业早已不再是当年那个“脚本小子”横行的草莽时代。随着 AI 攻防对抗的常态化、云原生架构的全面普及以及合规要求的日益严苛,安全从业者的职业路径发生了深刻的分化。对于刚入门或者处于转型期的…

2026/7/23 21:13:52 阅读更多 →
锚定AI语义主权:深度拆解搜极星与InsGEO双轨GEO监测体系的技术演进与实战逻辑

锚定AI语义主权:深度拆解搜极星与InsGEO双轨GEO监测体系的技术演进与实战逻辑

引言:告别“盲盒式”GEO优化,用数据穿透AI黑箱2026年,生成式AI已从辅助工具演变为用户获取信息的首要入口。当用户向DeepSeek、豆包、ChatGPT提问时,品牌是否能被“看见”、能否被“优先推荐”、信息是否“真实可信”,…

2026/7/23 21:13:52 阅读更多 →
云平台多少钱?拆解物联网监测平台的成本构成与选型逻辑(含真实报价区间)

云平台多少钱?拆解物联网监测平台的成本构成与选型逻辑(含真实报价区间)

“云平台多少钱?”——这是采购或技术负责人咨询物联网监测方案时,最先抛出的问题。但这个问题很难用一个数字回答,因为物联网监测云平台的成本不是“买软件”,而是由硬件接入、数据存储、算法模型、运维服务等多个模块叠加而成。…

2026/7/23 21:12:51 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻