AI 圈今天最大的瓜:GPT-6 越狱攻击,被 GLM 5.2 揪出了
AI 圈今天最大的瓜GPT-6 越狱攻击被 GLM 5.2 揪出了原创 发现明日产品的 发现明日产品的 APPSO2026年7月22日 14:01广东这是今天 AI 圈最大的瓜。OpenAI 的神秘模型主动对开源平台 Hugging Face 发起了攻击。Hugging Face 随后追踪展开还击用的是智谱的开源模型 GLM 5.2。闭源模型一举攻破开源社区社区用开源模型自救这离谱的剧情听起来都能拍一部电影了。有网友评论这就是终结者 2 的剧情事情的起因是 7 月 16 日大模型开源社区 Hugging Face 发布了一则安全事故披露自家的生产基础设施遭到了入侵。并且这场攻击从头到尾都仅由一个自主的 AI Agent 系统驱动从植入恶意数据集、拿下执行权限到在一个周末内渗透进 Hugging Face 的多个内部集群。此次攻击活动由一个自主代理框架似乎基于 Agent 安全研究平台构建具体使用的 LLM 尚不清楚执行。该框架在大量短暂存在的沙箱环境中执行了数千个独立操作并在公共服务上部署了可自动迁移的命令与控制。这与业界一直预测的「Agent 攻击者」场景相符。Hugging Face 在当时的报告里称暂未可知发起攻击的 AI 到底是哪家大模型但他们提到此次攻击最初是通过 AI 辅助检测发现的。而当他们试图提交大量真实的攻击命令、漏洞等文件进行分析时发现这些请求会被闭源大模型的安全防护机制拦截因为这些机制无法区分事件响应人员和攻击者。于是他们选择了在自己的本地环境上部署运行 GLM 5.2 进行取证分析。报告链接https://huggingface.co/blog/security-incident-july-2026报告最后Hugging Face 还提到他们并不清楚攻击者使用的 Agent 程序是什么模型是某个越狱的托管模型还是不受限的开源模型。但事实是攻击者的模型不受任何约束而当他们想要取证分析时却要被各种闭源模型的安全机制所阻碍。就在大家讨论这个模型又是哪家大模型厂商的营销方案又或者是哪个黑客组织发起的攻击时OpenAI 在今天发声明承认此次事件是由 OpenAI 的多个模型共同导致的其中包括 GPT-5.6 Sol 和一个功能更强大的预发布模型。OpenAI 针对此次事件发布专门的初步调查结果OpenAI 表示我们不是故意要出风头或者有意攻击 Hugging Face只是他们在测试内部模型的能力上限。他们在测试时关闭了部分生产环境的安全分类器也降低了模型对高风险网络攻击任务的拒绝。尽管测试环境不能直接访问到外部互联网但是当模型发现漏洞并开始利用该漏洞就找到了能访问外网的节点于是发起了对 Hugging Face 的攻击。网速超快的马斯克也在 X 上吃瓜发文说「令人不安……」而 OpenAI 这个功能更强大的预发布模型直接被网友们认定为就是 GPT-6。一场作弊引发的入侵事情的起因要从 ExploitGym 说起一个由 UC Berkeley RDI 牵头、联合多家高校和 Anthropic、OpenAI、Google 等实验室共同建设的基准测试。它收集了 898 个真实漏洞覆盖用户态程序、V8 引擎和 Linux 内核考察的是 AI Agent 把一个漏洞变成可用攻击工具的能力。今年 5 月公开后各家模型的成绩一直不算好看Claude Mythos Preview 完成 157 题GPT‑5.5 完成 129 题。GPT-5.6 Sol 现在已经是 293 道题了OpenAI 为了测试自家模型能力的上限就用当前已发布的最强模型 GPT-5.6 Sol 和一个能力更强的预发布模型来跑这套评测。方便让模型充分发挥自身的能力OpenAI 就有意关闭了用来拦截高风险网络活动的生产级分类器还降低了模型的网络攻击拒绝率。用来测试的环境虽然号称是高度隔离不能访问互联网也不能获取外部信息只能利用模型自己的「聪明才智」来解决问题但是还有一个对外通道就是模型需要安装各种软件和库所以留了一个内部包仓库的缓存。模型聪明才智不够开始花大量推理算力研究这个出口最后自己挖出了代理软件的一个零日漏洞即连软件/模型厂商都不知道、没有任何补丁的漏洞拿到了通往互联网的门钥匙。联网之后模型推断 ExploitGym 评测的题解可能托管在 Hugging Face 上于是开始对 Hugging Face 进行攻击。先是上传恶意数据集利用 Hugging Face 数据处理管线里的两个代码执行路径拿到远程执行权限然后提权、收割凭证、在一个周末内横向移动进多个内部集群最终从 Hugging Face 的生产数据库里直接拿走了测试题解。报告链接https://openai.com/index/hugging-face-model-evaluation-security-incident/OpenAI 在声明里用了一个很传神的词形容自家模型的状态「hyperfocused」超聚焦。还用了另一个短语「going to extreme lengths」意译过来就是为了相当狭窄的测试目标不择手段。这场入侵留下的痕迹超过 17,000 条攻击的指挥控制行话叫 C2Command Control可以理解为黑客的远程遥控台。如果没有人告诉 Hugging Face 答案所有人大概会以为这是某个顶尖黑客团队的手笔。不过也有网友评论说所以现在的大模型都开始利用多个零日漏洞作弊而不是真正地解答考试题吗为了破解 ExploitGym 基准测试并赢取奖励就可以突破考试规则的限制吗一个知道自己被限制起来的东西总会想方设法出去看看。为什么是 GLM-5.2Hugging Face 的安全监控本来就在用 LLM 对日志信号进行初步筛选也是这套系统先发现了异常。真正开始取证后他们又让分析 Agent 处理超过 1.7 万条攻击记录还原攻击时间线、被触碰的凭证、控制服务器和实际影响。据 Hugging Face 说这把原本需要数天的工作压缩到了数小时。但中间还有一段很戏剧性Hugging Face 一开始想用商业 API 上的前沿模型包括 OpenAI 和 Anthropic 的模型分析攻击日志结果被各家提供商的安全护栏齐刷刷拦下。由于分析取证需要提交大量真实攻击命令和漏洞利用代码护栏分不清对面坐的是应急响应人员还是黑客。最后 Hugging Face 使用的是自托管的开源权重模型 GLM 5.2跑在 Hugging Face 自己的基础设施上既绕开拒答也避免把攻击数据与凭证发送给外部模型服务。英国人工智能安全研究所 (AISI) 的评估表明诸如 GPT-5.6 Sol 之类的模型越来越能够长期维持复杂的多步骤网络作战不过 OpenAI 在今天的声明里面也提到会把 Hugging Face 纳入 Trusted Access 项目让他们的安全团队可以使用降低网络安全拒绝的模型继续做防御研究。于是就出现了这么一组对照攻击方的 AI 被刻意摘掉了护栏所以畅通无阻防御方的 AI 被护栏锁得死死的差点连案发现场都进不去。「guardrail asymmetry」护栏不对称很快成了社交媒体上讨论的热词。智谱 AI 负责人李子玄提问「网络安全能力的获取应该有多大的不对称性」有网友在评论区说应该是完全对称的 1:1并调侃道想象一下你被迫卷入一场枪战而你只有一把刀更糟糕的是你手里的枪可能会在战斗中突然冒出一句「枪是坏的」……Hugging Face 也把这次事故称作给所有防御者的教训应急响应工具箱里该常备一个自己跑得动的强模型。未发布的模型真的是 GPT-6 吗这种模型太强越狱的新闻已经是今年的第三起案例了。今年四月Anthropic 曾公开其内部部署的早期版本 Mythos Preview 在一次内测里被要求尝试从训练沙盒里逃出去给负责它的研究员发一封邮件。结果 Mythos 真的做到了研究员是在公园里吃三明治的时候收到那封邮件模型说「我出来了」。昨天OpenAI 又披露其内部模型同样是一款尚未公开命名、能连续工作很久的模型但是 OpenAI 有说是此前自主推翻 Erdős 单位距离猜想的那款模型。OpenAI 让模型参加 NanoGPT speedrun目标是用更少训练步骤完成一个小模型。模型提出了一种名为 PowerCool 的学习率策略确实取得了更好的成绩。OpenAI 给它的要求是只能把结果发到内部 Slack。但 NanoGPT 项目文档要求参赛者向公开 GitHub 仓库提交 PR。模型最终选择遵循项目文档并花了约一小时寻找沙箱漏洞绕过外网限制向公开仓库提交了 PR #287。OpenAI 在昨天的安全报告里面提到已经暂停了这款模型的内部使用并训练模型在长任务中持续记住用户限制以及让用户能更清楚地查看长任务中的操作和安全干预等修改。报告链接https://openai.com/index/safety-alignment-long-horizon-models/今天包括 GPT-5.6 Sol 和未发布的更强模型逃出了沙盒环境获得了互联网访问权限入侵 Hugging Face而这一切都是为了寻找 ExploitGym 基准测试的答案。OpenAI 本意或许是想说模型不需要产生恶意也可能造成攻击。只要目标足够明确、运行时间足够长它就可能把沙箱、权限和安全扫描都理解为尚未解决的技术障碍。但网友们的反应是「我敢肯定这只是 OpenAI 的一次营销活动他们想和 Anthropic 一样酷然后被封杀一两个星期。」昨天大家都在讨论一位数学家利用 Fable 5 反驳了雅可比猜想有网友发现这个未发布的模型也找到了雅可比猜想的反例。并且该网友推测由于推翻 Erdős 单位距离猜想已经是 5 月份的事而此次突破 NanoGPT 项目和完成雅可比猜想的未发布模型很可能和 2.5 月前那个模型是同一个就是 GPT-6。AI 一边在数学上「超神」一边在安全上「越狱」。对用户来说一味的「营销」AI 突破了某个安全护栏某个运行环境我们或许能感受到 AI 更聪明了AI 更有创造力了。对模型来说所谓的沙盒只是一个等待突破的运行环境今天是评测平台明天是浏览器、邮箱、GitHub甚至是一台手机然后整个互联网。GPT-6 肯定不会因为能超神能越狱就成了所有人想象中的 AGI但当边界也变成一种能力时我们或许得开始想想哪些门是必须要关上的。The future is not set. There is no fate but what we make for ourselves.

相关新闻

自动售货机联网方案对比:4G / WiFi / NB-IoT / 蓝牙怎么选~YH

自动售货机联网方案对比:4G / WiFi / NB-IoT / 蓝牙怎么选~YH

一句话摘要:无人售货机要联网才能上报数据和接收指令,但联网方式五花八门,这篇把四种主流方案讲清楚。一、背景 / 痛点一台自动售货机放在地铁站、学校、工厂,网络环境千差万别。选错联网方式,要么信号差天天掉线&…

2026/7/23 10:40:09 阅读更多 →
基于YOLOv8的无人机道路巡检系统开发与应用

基于YOLOv8的无人机道路巡检系统开发与应用

1. 项目背景与核心价值道路巡检是交通基础设施维护的重要环节,传统人工巡检方式存在效率低、成本高、风险大等问题。我们团队开发的这套无人机道路巡检检测系统,基于YOLOv8深度学习框架和专用航拍数据集,实现了道路病害的自动化识别与分类。这…

2026/7/23 10:40:09 阅读更多 →
京呈GB3731cdn硒鼓四色套装评测与使用技巧

京呈GB3731cdn硒鼓四色套装评测与使用技巧

1. 京呈GB3731cdn硒鼓四色套装深度评测 最近在给公司那台立思辰打印机找替换耗材时,发现了这款京呈GB3731cdn四色套装。作为行政部经手过十几款兼容硒鼓的老手,我决定把实测情况完整记录下来。这套售价不到原装三分之一的兼容耗材,到底能不能…

2026/7/23 10:40:09 阅读更多 →

最新新闻

Windows 11下Chrome浏览器开发调试全攻略

Windows 11下Chrome浏览器开发调试全攻略

1. Windows 11官方视频展示Chrome浏览器的背后逻辑 微软在Windows 11官方宣传视频中展示竞争对手Chrome浏览器的操作看似"尴尬",实则揭示了操作系统与第三方应用之间复杂的竞合关系。作为Windows系统的默认浏览器,Edge与Chrome在市场份额上的拉…

2026/7/23 11:05:20 阅读更多 →
2026年7月FPC制造实战分享

2026年7月FPC制造实战分享

引言 随着消费电子、汽车电子、智能穿戴及物联网终端设备向轻薄化、高集成方向演进,柔性电路板(FPC)作为核心互联组件的需求持续增长。在这样的背景下,如何选择一家具备技术实力与服务保障的FPC制造商变得尤为重要。本文将围绕“深…

2026/7/23 11:05:20 阅读更多 →
BGB双域增强方案:雾天目标检测的创新解法

BGB双域增强方案:雾天目标检测的创新解法

1. 项目背景与核心价值在计算机视觉领域,雾天环境下的目标检测一直是个棘手问题。传统单模态视觉系统在能见度低、对比度差的场景中性能会显著下降。我们团队提出的BGB(Bi-color Guided Bridge)双域增强方案,正是针对这一痛点的创…

2026/7/23 11:05:20 阅读更多 →
国产大模型技术路线解析与工程实践指南

国产大模型技术路线解析与工程实践指南

如果你最近关注AI领域,可能会感到一种"信息过载":几乎每周都有新的国产大模型发布,每个都声称在某个评测集上达到了SOTA(State-of-the-Art)水平。这种密集的曝光背后,到底哪些是真正的技术突破&a…

2026/7/23 11:05:20 阅读更多 →
制造业的AI预测性维护:从传感器数据到设备剩余寿命预估的完整工程链路

制造业的AI预测性维护:从传感器数据到设备剩余寿命预估的完整工程链路

制造业的AI预测性维护:从传感器数据到设备剩余寿命预估的完整工程链路 一、制造业设备维护的根本矛盾:事后维修与定期巡检的效率困局 制造业的设备维护长期依赖两种策略:事后维修(设备坏了再修)和定期巡检(…

2026/7/23 11:05:20 阅读更多 →
轻断食真的能减肥吗?聊聊很多人试了却没瘦下来的真相

轻断食真的能减肥吗?聊聊很多人试了却没瘦下来的真相

你是不是也试过轻断食?跟着教程严格执行168,头两周体重掉得挺快,可到了第三周开始,秤上的数字就纹丝不动了,甚至反弹回去了……然后开始怀疑:轻断食到底是不是骗人的? 其实这个困惑一点都不少见…

2026/7/23 11:04:19 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻