FLI发布AI安全指数,全球模型没有超过C+
nthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。Future of Life Institute未来生命研究所简称FLI发布了2026年夏季AI安全指数。而且拿到C的那家公司刚刚悄悄收回了自己曾经许下的安全承诺。与此同时OpenAI在7月15日发布了一款叫GPT-Red的自动红队测试工具攻击成功率84%远超人类红队测试员的13%。工具在进步治理在退步。成绩单FLI的AI安全指数到2026年夏季已经是第4期覆盖公司从2024年的6家扩展到了9家。评估维度有6个细分指标37项由7位独立专家组成的评审团打分采用美国GPA体系A对应4.0F对应0。9家公司的最终成绩如下AnthropicC2.66分连续3期排名第一在6个维度中的5个领跑。评审团认可了它在透明度、模型规格文档发布、危险能力评估方面的表现以及Responsible Scaling Officer负责任扩展官这一治理架构。OpenAIC2.28分比2025年冬季版的C有所下降。评审团肯定了它在风险评估领域的进步评估套件更全面外部安全测试的参与也更广泛。Google DeepMindC2.01分与上期持平。更新后的Frontier Safety Framework前沿安全框架新增了操控、失对齐和内部部署风险的覆盖水印保护也做得扎实。MetaD1.32分是本期唯一一条上升曲线。从D升到D排名从第6升到第4原因是发布了更详细的安全框架加入了威胁建模并把漏洞赏金计划扩展到了灾难性风险因素。Z.aiD-0.88分。Alibaba CloudD-0.87分。有点好笑的是两家中国公司的安全策略在评审团看来竟然是因为要遵守我国2025年10月修订的《网络安全法》、2021年的《数据安全法》、以及2023年的《生成式AI暂行办法》。评审团把这种策略称为完全被动。xAIF0.65分本期跌幅最大。从第4掉到第7从D直接降到F。评审团找不到有意义的安全团队找不到对存在性安全的任何投入危险能力评估存在巨大漏洞包括完全没有评估AI研发风险。报告还提到xAI的Grok曾生成儿童性虐待材料以及真实人物包括未成年人的非自愿性化图像。xAI在指数中没有列出任何进展亮点。DeepSeekF0.47分。MistralF0.33分。3个不及格美国、中国、欧洲各一家。评审团特意指出这个分布反驳了AI安全差是某个地区的问题这种说法。Mistral垫底被点名为一种讽刺评审团认为欧盟在AI安全监管上一直走在前面。截至证据窗口关闭DeepSeek和Mistral都没有发布过安全框架。7位评审专家分别来自UC Berkeley加州大学伯克利分校、University of Montreal蒙特利尔大学、HEC Montréal蒙特利尔高等商学院、University of Wisconsin-Madison威斯康星大学麦迪逊分校、Oxford University牛津大学、Renmin University of China中国人民大学和Encode。没有一家公司为评估付过费。承诺在缩水排名本身不是最要命的。最要命的是排名靠前的公司正在把以前说过的话收回去。Anthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。评审团给这个模式起了个名字叫moving the goalposts移动球门。结论是这种做法全面削弱了安全框架。UC Berkeley的Stuart Russell教授是7位评审之一他的原话是行业里确实有人在做AI安全方面的好工作但能力竞赛已经变得更加极端。企业已经放弃了早先的承诺不再坚持只在安全措施匹配能力水平时才发布新系统。现在即便能证明发布是不安全的他们也打算照发不误。具体到Anthropic评审团点名批评了Responsible Scaling Policy负责任扩展政策3.0版本认为它稀释了早期的暂停承诺。暂停条件一旦变成取决于竞争对手的选择就没有任何一方有动力先停下来政策的实际约束力就归零了。OpenAI的情况更复杂。在证据收集窗口截至2026年6月3日关闭之后OpenAI把安全团队并入了研究部门取消了独立汇报线。TechTimes把这报道为OpenAI两年内第6位高级安全人员离职。这件事没有被计入评分但方向很明确。评审团还建议OpenAI取消领导层对Safety Advisory Group安全咨询组的否决权并要求安全框架的阈值可量化、可外部执行。对Google DeepMind评审团的疑问是到底哪个内部机构有权在不经 executive leadership高管层批准的情况下独立叫停一次部署Meta那边评审团担心非贬损协议可能正在侵蚀其声称的吹哨人保护。看见悬崖没修护栏整个指数中得分最低的领域是Existential Safety存在性安全。没有一家公司超过C-大多数落在D或以下。评审团承认了一些零散的努力。Anthropic的constitutional classifiers宪法分类器OpenAI对全球AI治理机构的呼吁Google DeepMind的监控承诺Meta针对失控的预防措施。但总体评价是“完全不够”。评审团最具技术含量的一条批评直接指向了行业主流安全范式。Interpretability可解释性研究和Chain-of-Thought思维链可监控性是大多数AI公司最核心的安全投资方向。评审团从架构层面提出了质疑detection is not prevention检测不等于预防。思维链可监控性让模型的推理过程变得可见人类可以发现不对齐的思维。但检测是事后的。一条不对齐的推理链被捕捉到的时候模型已经输出了结果甚至已经执行了动作。一个在问题发生后才发出警报的监控系统提供的是问责不是安全。OpenAI在7月15日发布的GPT-Red恰好印证了这种张力。GPT-Red是一个自动化红队测试模型通过self-play reinforcement learning自博弈强化学习训练。红队模型和一组防御模型同时训练GPT-Red的奖励是成功发起攻击比如成功的prompt injection提示注入防御模型的奖励是抵抗住攻击。结果在GPT-5.1的新颖场景中GPT-Red的攻击成功率84%人类红队测试员只有13%。这些攻击随后被用来加固GPT-5.6 Sol把它的直接提示注入失败率压到了0.05%。这是用对抗性AI在部署前找到并封堵特定漏洞类别的安全工程。但它仍然是针对已知攻击面的检测加固系统不是面向大规模失对齐的预防架构。University of Montreal的David Krueger教授也是评审之一他写道AI公司在制定可信AI安全计划方面缺乏进展令人震惊。连他们自己都开始焦虑了一边冲向递归自我改进一边面对失控的可能性。军事AI集体转向指数中另一个突出发现涉及军事应用。2024年到2026年间Anthropic、OpenAI、Google DeepMind、Meta这4家此前限制或禁止军事应用的公司全部调转方向开始积极争取国防合同。它们加入了xAI和Mistral的行列后两家本来就在做这方面业务。这个转向产生了具体的评分后果。Anthropic在Current Harms当前危害领域下的Military Use of AIAI军事使用子指标上拿了不及格。评审团引用了它与Minab学校空袭事件的reported connection即被报道的关联。那次空袭造成了大规模平民死亡。FLI在报告中明确标注这是评审团关于一个被报道的关联的发现不是对法律责任的认定。最后说几句关于这份指数本身的局限。它评估的是实验室的政策、治理结构、信息披露和已发布的技术框架不是部署产品的实际表现或用户体验。一家公司可以因为文档写得全面而拿高分也可以因为什么都没发布而拿低分。Anthropic的C说的是它的文档化安全实践、治理结构和透明度在同行中相对较强而整个行业至今没有建立起可外部执行的最低标准。

相关新闻

作文自动批改系统:语法、逻辑、文采的分层评价体系

作文自动批改系统:语法、逻辑、文采的分层评价体系

作文自动批改系统:语法、逻辑、文采的分层评价体系 一、个性化深度引言 批改一篇 800 字的作文,人类老师大约需要 5-10 分钟。这对于同时教两个班共 100 名学生的语文老师来说,每次批改作业就是 8-16 个小时的工作量。而这还没算上给出有针对…

2026/7/24 8:33:45 阅读更多 →
知识追踪模型训练:学生行为序列的建模与评估

知识追踪模型训练:学生行为序列的建模与评估

知识追踪模型训练:学生行为序列的建模与评估 一、个性化深度引言 传统考试能告诉你"某个学生在某个时刻答对了几道题",但无法回答"这个学生掌握了哪些知识点,未来遇到类似题目有多大把握做对"。 知识追踪(Kno…

2026/7/23 3:29:38 阅读更多 →
零基础入门 UDS 诊断|一文吃透 0x11 ECU 复位服务(报文格式 + 核心测试点全解析)

零基础入门 UDS 诊断|一文吃透 0x11 ECU 复位服务(报文格式 + 核心测试点全解析)

很多刚接触 ISO 14229 UDS 协议的小伙伴,人生中第一条调试的诊断服务,大概率都是 0x11 ECU 复位。毕竟 “不行就重启” 是刻在所有工程师 DNA 里的万能操作。但如果你以为 0x11 服务就只是 “发个指令让 ECU 重启” 这么简单,那可就错过它的核…

2026/7/24 6:30:26 阅读更多 →

最新新闻

卡美德生物科普:RHD(RhD 血型抗原蛋白)

卡美德生物科普:RHD(RhD 血型抗原蛋白)

在细胞表面抗原、红细胞分子标识、免疫结合相关基础科研领域,RHD 是应用广泛的膜蛋白靶点,也是血型相关基础研究的核心研究对象。该蛋白特异性表达于红细胞细胞膜表层,依靠自身抗原结构介导分子识别、细胞间免疫识别等生理过程。对于从事血液…

2026/7/24 8:34:49 阅读更多 →
智能体技术:从对话到行动的演进与应用

智能体技术:从对话到行动的演进与应用

1. 智能体技术演进:从对话到行动的范式跃迁2026年被业界普遍视为智能体技术从实验室走向大规模商用的关键转折点。过去十年间,我们见证了对话式AI从简单的规则匹配发展到今天的多轮复杂交互,但真正的突破在于智能体开始具备自主行动能力。这种…

2026/7/24 8:34:49 阅读更多 →
开源LLM长期价值:从GPT-J到Mistral的工程实践与能力边界

开源LLM长期价值:从GPT-J到Mistral的工程实践与能力边界

上周和一位做开源模型的朋友聊天,他提到一个观察:现在很多团队都在追求“更快出结果”,但真正能沉淀下来的,往往是那些愿意在基础架构和数据质量上花时间的项目。这让我想起 Stability AI 创始人最近的一次回顾,他提到…

2026/7/24 8:34:49 阅读更多 →
昇腾平台大模型首字生成时间(TTFT)优化实战

昇腾平台大模型首字生成时间(TTFT)优化实战

1. 首字生成时间(TTFT)的行业痛点与核心挑战在人机交互领域,首字生成时间(Time To First Token, TTFT)正成为衡量AI系统响应速度的黄金指标。当用户向大语言模型发送请求时,从敲下回车键到屏幕上出现第一个…

2026/7/24 8:34:49 阅读更多 →
别急着换赛道:数据分析经验在 AI 项目里到底值多少?

别急着换赛道:数据分析经验在 AI 项目里到底值多少?

如果你正准备往大模型方向转,《别急着换赛道:数据分析经验在 AI 项目里到底值多少?》这类问题别只看热度。更重要的是判断自己该补哪块能力,以及怎么证明你真的会。摘要上周的需求评审会上,我和产品经理吵了一架。起因…

2026/7/24 8:34:49 阅读更多 →
Chrome-agent:基于Rust的LLM原生浏览器自动化工具实践

Chrome-agent:基于Rust的LLM原生浏览器自动化工具实践

你有没有遇到过这样的场景:想用大语言模型(LLM)自动完成一些网页操作,比如批量填写表单、抓取特定信息、或者模拟用户点击流程,结果发现现有的工具要么配置复杂,要么性能堪忧,要么根本无法处理动…

2026/7/24 8:33:49 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻