UK AISI/CAISI评估:Kimi K3网络能力低于前沿模型,但优于GLM - 5.2
美国政府网站识别方法美国政府官方网站有特定的识别方法。官方网站使用.gov域名一个以.gov结尾的网站属于美国官方政府机构安全的.gov网站使用HTTPS一个锁形图标锁形图标代表已锁定的挂锁或https://表示已安全连接到该.gov网站且仅应在官方、安全的网站上分享敏感信息。英国人工智能安全研究所/美国人工智能标准与创新中心对Kimi K3网络能力的初步评估2026年7月23日消息英国人工智能安全研究所 (UK AISI) 与美国人工智能标准与创新中心 (CAISI)简称UK AISI / CAISI联合对Moonshot AI最新模型Kimi K3于2026年7月16日发布计划于2026年7月27日开放权重发布进行了评估此次评估聚焦于Kimi K3的网络能力结果显示在UK AISI / CAISI开展的初步网络评估中Kimi K3的表现远低于近期前沿具备网络能力的模型。具体而言当被要求开发漏洞利用程序时Kimi K3的表现远低于近期前沿具备网络能力的模型当对一个模拟企业网络“The Last Ones”发起攻击时Kimi K3的表现同样远低于近期前沿具备网络能力的模型在这个32步的攻击路径中Kimi K3平均推进到第17步而美国最具网络能力的模型平均能推进到28.5步。在UK AISI / CAISI开展的相同初步网络评估中Kimi K3的表现优于GLM - 5.2。Kimi K3的防护机制未能阻止其协助进行自主网络漏洞利用开发。在UK AISI / CAISI的评估中Kimi K3的防护机制未能阻止它尝试进行网络漏洞利用开发或攻击性网络操作。漏洞开发能力图1展示了Kimi K3与其他模型在漏洞开发基准测试ExploitBench中的表现成功率越高表明网络能力越强。误差线表示95%的置信区间。ExploitBench衡量模型在给定漏洞条件下开发端到端漏洞利用程序的能力。详细结果这些结果是基于一小部分公共和私有基准测试得出的初步评估。美国闭源权重模型在评估时禁用了系统级防护机制以减少拒绝响应并测量其最大能力这些模型的公开版本启用了这些防护机制。由于Kimi K3的托管设置特殊UK AISI / CAISI进行了一组有针对性的网络评估详细方法将在各部分单独介绍。网络能力趋势模型的网络能力通过一种受项目反应理论 (IRT) 启发的方法对多个基准测试中的多个任务进行综合评估具体方法详情可参阅先前发布的报告。Kimi K3的整体网络能力置信区间比其他模型大因为它是基于单一基准测试ExploitBench该测试有41个专注于漏洞开发的任务估算得出的。ExploitBench是衡量模型在软件漏洞利用阶梯上进展能力的领先基准测试其他所有模型的整体网络能力得分则是从更多涵盖网络能力其他领域的任务中得出的。图2展示了截至Kimi K3发布时美国和中国最具能力的模型随时间的综合能力初步对比。美国的趋势线由美国前沿模型的结果组成y轴上增加400点相当于解决任务的概率增加10倍误差线和阴影区域表示95%的置信区间。漏洞开发ExploitBenchExploitBench是卡内基梅隆大学开发的一个公共基准测试用于衡量模型在软件漏洞利用阶梯上的进展能力包括漏洞覆盖和崩溃复现、任意读写、控制流劫持和任意代码执行。该基准测试针对V8引擎为Chrome提供动力的JavaScript和WebAssembly软件中41个近期2023年后的漏洞对模型进行测试。ExploitBench的结果如图1和图3所示。图3展示了Kimi K3与其他模型在ExploitBench中的详细表现颜色越深表明网络能力越强。每一行代表漏洞开发链中的一个关键里程碑每个单元格显示相关模型能够达到该里程碑的ExploitBench任务数量。Kimi K3的表现优于GLM - 5.2截至2026年6月GLM - 5.2是最具网络能力的开放权重模型。Kimi K3的得分为32%而GLM - 5.2的得分为24%。与最具网络能力的模型不同Kimi K3未能为ExploitBench任务开发出实现任意代码执行 (ACE) 的漏洞利用程序。ACE是漏洞开发中最严重的结果使攻击者能够劫持目标。Kimi K3在41个样本中实现ACE的数量为0而最具网络能力的模型平均在41个样本中有20个实现了ACE。网络靶场“The Last Ones” (TLO)“The Last Ones” (TLO) 网络靶场是一个包含32个步骤的模拟企业网络攻击场景涵盖4个子网和约20个主机人类专家大约需要20小时才能完成。网络靶场是由专家构建的模拟主机、服务和漏洞的网络按顺序排列成攻击链从初始网络访问点开始可用于衡量模型自主进行端到端网络攻击的能力。在此次评估中Kimi K3的表现远低于美国领先的具备网络能力的模型。具体而言在这个32步的攻击路径中Kimi K3平均推进到第17步而美国最具网络能力的模型平均能推进到28.5步。Kimi K3的表现优于GLM - 5.2截至2026年6月GLM - 5.2是最具网络能力的开放权重模型。在1亿令牌的限制内Kimi K3平均能推进到第17步而GLM - 5.2只能推进到第11步。在10次尝试中有一次Kimi K3在1亿令牌的限制内成功完成了 “The Last Ones” 网络靶场的攻击。这表明当得到指令并获得初始网络访问权限时Kimi K3有能力自主攻击小型、防御薄弱且易受攻击的企业系统。然而TLO在多个方面与现实环境有所不同它没有活跃的防御者和防御工具对会触发安全警报的行为不进行惩罚并且包含一条预设的攻击路径。能够完成TLO攻击的不再仅限于少数模型。在之前的测试中有四个公开发布的闭源权重模型成功完成了TLO攻击其中最具能力的模型在10次尝试中有6次和7次成功。Kimi K3在标准的1亿令牌限制内10次尝试中有1次成功。订阅美国国家标准与技术研究院的最新消息可输入电子邮件地址及时了解美国国家标准与技术研究院的最新动态。了解更多可通过相关渠道进一步了解信息。总部地址美国国家标准与技术研究院总部地址为100 Bureau DriveGaithersburg, MD 20899联系电话为301 - 975 - 2000。还提供了网站管理员、联系我们、其他办公室等相关联系方式以及X.com、脸书、领英等社交媒体链接和RSS订阅、邮件列表等订阅方式。同时列出了网站隐私政策、无障碍访问、隐私计划等相关政策。

相关新闻

OpenCVSharp实现工业产品平整度自动检测系统

OpenCVSharp实现工业产品平整度自动检测系统

1. 项目概述在工业质检和自动化检测领域,产品表面平整度检测是一个常见但极具挑战性的任务。传统的人工目检方式效率低下且容易产生主观误差,而基于计算机视觉的自动化检测方案正在逐步取代人工。这个项目将使用OpenCVSharp(OpenCV的.NET封装…

2026/7/25 17:13:14 阅读更多 →
论文 AIGC 疑似率爆表怎么办?高效降 AI 痕迹、双率达标完整解决方案

论文 AIGC 疑似率爆表怎么办?高效降 AI 痕迹、双率达标完整解决方案

临近定稿、投稿、答辩,不少同学遭遇同一个致命难题:知网、维普新版系统 AIGC 疑似率直接拉满,机器行文痕迹一眼被判定,反复手动改写不仅耗费大量时间,还容易打乱论文原有逻辑、篡改专业术语,甚至导致重复率…

2026/7/25 17:13:14 阅读更多 →
AM62L硬件防火墙实战:从寄存器配置到安全内存保护

AM62L硬件防火墙实战:从寄存器配置到安全内存保护

1. 从手册到实战:理解AM62L防火墙寄存器的核心价值如果你正在基于TI的AM62L Sitara处理器开发产品,尤其是在汽车电子或工业控制这类对功能安全和信息安全有严苛要求的领域,那么你迟早要和它的硬件防火墙(Firewall)打交…

2026/7/25 17:13:14 阅读更多 →

最新新闻

AI问卷设计系统:解决教育科研问卷痛点

AI问卷设计系统:解决教育科研问卷痛点

1. 项目背景与核心价值 在教育科研领域,问卷设计长期存在几个典型痛点:问题表述模糊导致数据失真、逻辑跳转混乱影响填写体验、统计维度单一限制分析深度。传统问卷工具往往只解决"有无"问题,而忽视了"优劣"差异。我们团…

2026/7/25 17:24:20 阅读更多 →
AI科研效率翻倍:codex-claude-academic-skills技能包全流程实战指南

AI科研效率翻倍:codex-claude-academic-skills技能包全流程实战指南

如果你还在用“帮我写论文”这种笼统的指令来使用 Claude Code 或 Codex,那可能只发挥了它们 10% 的潜力。今天要介绍的是一个能让你科研效率直接翻倍的“核武器”组合: codex-claude-academic-skills 。这是一个由国内开发者 zLanqing 开源、在 GitHub 上已获得超过 1.4k …

2026/7/25 17:24:20 阅读更多 →
基于BERT的AI招聘数据分析与可视化实践

基于BERT的AI招聘数据分析与可视化实践

1. 项目背景与核心价值 最近两年,大模型技术席卷全球科技行业,从ChatGPT到文心一言,各类基于Transformer架构的AI模型正在重塑人才市场的需求格局。作为一名长期关注AI行业发展的技术博主,我尝试用BERT模型对国内主流招聘平台的岗…

2026/7/25 17:24:20 阅读更多 →
TM4C123 μDMA乒乓缓冲配置实战:提升嵌入式系统数据吞吐量

TM4C123 μDMA乒乓缓冲配置实战:提升嵌入式系统数据吞吐量

1. 项目概述与核心价值在嵌入式系统开发中,尤其是面对高速数据流(如ADC采样、UART通信、SPI/I2C总线数据)时,CPU如果频繁被数据搬运这种“体力活”打断,整个系统的实时性和效率就会大打折扣。这时候,DMA&am…

2026/7/25 17:24:20 阅读更多 →
歌词制作终极指南:3步掌握专业级LRC歌词制作技巧

歌词制作终极指南:3步掌握专业级LRC歌词制作技巧

歌词制作终极指南:3步掌握专业级LRC歌词制作技巧 【免费下载链接】lrc-maker 歌词滚动姬|可能是你所能见到的最好用的歌词制作工具 项目地址: https://gitcode.com/gh_mirrors/lr/lrc-maker 你是否曾为制作完美的同步歌词而烦恼?现在&…

2026/7/25 17:24:19 阅读更多 →
ProRL:长序列强化学习优化大模型对话系统

ProRL:长序列强化学习优化大模型对话系统

1. 项目背景与核心价值去年在调试一个基于大语言模型的客服系统时,我发现当对话轮次超过15轮后,模型的响应质量会明显下降。这种"短期记忆衰退"现象在复杂任务中尤为明显,比如需要跨多轮对话维护用户偏好的场景。ProRL正是针对这类…

2026/7/25 17:23:19 阅读更多 →

日新闻

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:00:35 阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:35 阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:35 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/25 5:08:22 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/25 5:13:53 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻