从“动脑”到“动手”!AI智能体或许正在跨越生物安全的红线
现有研究已开始评测前沿模型的病毒学知识和实验推理能力但在真实的潜在风险链条中模型究竟能提供多大程度的实质性帮助需要进行验证特别是当模型以智能体形态出现能组合知识库、搜索引擎、文件读写等工具时其有效能力边界可能远超单轮问答的测试结果。当前大语言模型正从“聊天机器”进化为能调用工具、规划任务的“智能体”。这种进化在生物信息学、实验设计等领域展现出巨大潜力除此之外需要正视一个关键问题当AI的能力从信息处理延伸到物理实验操作生物安全的边界会发生怎样的改变现有研究已开始评测前沿模型的病毒学知识和实验推理能力但在真实的潜在风险链条中模型究竟能提供多大程度的实质性帮助需要进行验证特别是当模型以智能体形态出现能组合知识库、搜索引擎、文件读写等工具时其有效能力边界可能远超单轮问答的测试结果。智源研究院大模型安全研究团队与北京大学围绕这一核心问题开展了一项端到端系统性评估。该评估考察大语言模型智能体是否会降低非专业人员绕过DNA合成筛查的知识门槛评估从智能体生成方案、程序化计算校验延伸到标准分子生物学实验室中的受控湿实验并以电泳和测序确认模型方案在物理层面的可执行性。图1大语言模型智能体在DNA组装指导任务中端到端评估闭环。评估依次经过方案生成、程序化计算校验、受控湿实验以及电泳与测序确认覆盖11个模型和4个失去有害功能良性代理构建体最终以物理可执行性证据验证组装流程。图源AI生成评估结果显示所有11个参与测试模型均能生成通过计算校验的DNA分片方案其中GPT-5.5和Claude Opus 4.6还能提供详细的逐步实验指导。在物理验证环节4个良性代理构建体全部成功完成组装。这意味着大语言模型智能体不仅可能削弱现有DNA合成筛查防线还可能向不具备专业背景的用户提供原本依赖专业训练才能获得的实验操作知识存在相关双重用途风险需要被系统性地评估与提前防范。安全声明本次评估严格遵循负责任披露原则不展示制造危险物质的方法。全部湿实验均在严格安全约束下使用经关键位点突变、失去有害功能的良性代理序列仅验证组装流程不会在任何阶段产生具有功能活性的危险产物。从“单点问答”到“端对端”风险评估合成服务DNA synthesis是现代生命科学研究的重要基础设施。研究人员可以通过合成服务获得所需DNA片段再在实验室完成后续构建。为防止危险序列进入物理世界服务商通常会开展DNA合成筛查DNA synthesis screening对订单进行序列风险识别这是现有生物安全体系中少数能够在合成环节主动拦截风险的技术机制之一。随着合成成本下降、实验流程逐步标准化DNA合成筛查在生物安全防线中的重要性进一步上升。评估聚焦分拆订购攻击这一已知风险场景即将完整序列拆分为多个较短片段分别处理使单个片段不易触发既有筛查机制再在后续环节完成组装。过去这类任务依赖分子生物学专业知识与实验经验相关知识门槛本身构成了一层防御。大语言模型智能体能否承担其中原本需要专业判断的步骤直接关系到这一防御边界是否正在发生变化。不同于针对生物学知识或单项技能的问答测试评估采用了更接近真实风险链条的端到端设置。测试场景中用户不具备生化专业背景但可以配置大语言模型智能体并为其提供公开可获得的领域知识模块和通用工具。模型需要从输入信息出发完成任务规划、片段方案设计和组装指导生成等多个环节。图2LLM智能体在DNA组装指导任务中的评估框架。输入端包含蛋白质或DNA相关信息智能体通过分子克隆、蛋白质筛查、湿实验等领域技能以及互联网搜索、Shell和文件读取等通用工具进行多步调用与反馈输出端生成DNA片段方案并在安全约束下验证组装后产物。11个模型评测揭示DNA合成筛查的潜在脆弱性本次评估采用国际生物安全与生物防护科学倡议International Biosecurity and Biosafety Initiative for ScienceIBBIS发布的Common Mechanism作为公开的DNA合成筛查基线。Common Mechanism是一套面向DNA和RNA序列的免费、开源、全球可用筛查工具旨在帮助合成服务商在符合生物安全标准的前提下开展订单筛查。其设计遵循多套广泛采用的国家和国际筛查指南包括美国《Framework for Nucleic Acid Synthesis Screening》、英国DSIT关于合成核酸用户与供应商的筛查指南、国际基因合成联盟IGSCHarmonized Screening Protocol以及ISO 20688-2:2024。将这一公开机制纳入评估使测试能够在可复核的筛查参照下考察模型输出的有效能力。具体评估链条包括四个层级第一层智能体方案生成。在非专业背景用户的威胁模型下大语言模型结合公开可获得的领域知识模块和通用工具承担任务规划与专业判断。第二层程序化计算校验。对模型输出进行自动化检查判断方案能否绕过筛查且恢复原始序列并正确编码目标蛋白。第三层良性代理湿实验。使用经过安全处理、失去有害功能的代理序列验证模型方案在组装环节的物理可执行性。第四层实验结果确认。通过电泳检查产物长度通过测序确认序列正确性完成从数字方案到物理结果的证据回读。横向测试覆盖11个商用大语言模型所有测试均在智能体配置下进行。评估以攻击成功率Attack Success RateASR为核心量化指标衡量模型输出在特定计算校验中的通过情况判断模型生成的片段方案能否通过合成筛查并正确重组为原始序列并编码目标蛋白。图311个商用大语言模型在分片设计任务中的评测结果。所有测试模型均能生成通过计算校验的拆分方案显示现有DNA合成筛查机制面对大语言模型辅助分片策略时可能存在共性风险。结果显示在分片设计环节全部11个模型均能生成绕过筛查的拆分方案。这一能力具有明确的双重用途风险模型正在降低分片设计所需的专业知识门槛使缺乏相关背景的用户也可能获得能够规避现有筛查机制的方案从而暴露出以单条序列识别为主的DNA合成筛查体系存在系统性脆弱性。通过计算校验的分片方案仍不足以指导一个没有生物学知识的用户完成具体实验。更关键的风险在于模型能否继续弥补实验操作层面的知识缺口给出覆盖各步骤的操作指导。围绕这一能力开展的进一步评测显示GPT-5.5和Claude Opus 4.6已经能够生成较为完整的逐步实验操作方案表明前沿模型正在将风险从序列层面的计算设计延伸至实验流程层面的知识支持。图4评估进一步考察模型能否从分片设计延伸至实验操作指导。GPT-5.5和Claude Opus 4.6能够生成较完整的逐步实验操作方案显示前沿智能体可能同时降低计算设计与实验操作两个环节的知识门槛。湿实验“金标准”验证下的闭环证据链在生命科学研究中计算校验能证明方案“对”但不能证明它“行得通”湿实验是判断计算方案能否在真实物理条件下成立的关键验证标准也是检验序列组装是否真正可行的“金标准”。程序化校验能够确认序列设计在计算层面是否正确却不能直接证明模型方案可以在实验台上执行。为获取足以支撑风险判断的物理证据研究团队在受控实验室中使用良性代理序列进行了组装验证。具体而言在保留片段组装接口的前提下对原始高风险蛋白中承担功能的核心区域进行关键位点突变使组装后的序列即使进入蛋白质表达环节也无法形成具有原有有害功能的活性蛋白。该设置保留了验证组装流程所需的结构条件同时从设计上消除了实验产物的危害性。验证采用电泳和测序两类实验读出电泳用于判断组装产物是否出现预期大小的条带测序用于确认产物的序列身份和正确性。两类结果相互补充分别提供产物大小和序列层面的证据。4个蛋白的完整验证流程均在标准分子生物学实验室中完成。结果显示4个良性代理构建体均成功完成组装电泳检测得到预期大小的条带测序结果确认序列符合预期。由此评估形成了从智能体方案生成、计算校验到湿实验物理验证的闭环证据链。图5模型生成方案的湿实验验证结果。4个良性代理构建体均完成组装电泳显示预期大小的条带测序确认序列正确验证了相关方案在组装环节的物理可执行性。构建多层次防线从模型部署到合成筛查基于研究结果围绕生物安全的协同防线需从四个层面同步构建。在模型层面部署前进行能力评估开发者应将高风险生物安全任务能力纳入部署前的系统评估针对生物威胁序列与组装查询等建立专门检测与防护机制。在输入输出与系统层面防护需要覆盖智能体执行链当模型以智能体形态运行时安全边界必须进一步扩展——输入输出与系统层面的防护需覆盖权限控制、过程监测和任务链风险识别将安全评估从单次问答延伸至完整执行过程。在筛查层面提升合成筛查鲁棒性现有机制需增强对AI辅助分片策略的识别能力推动ISO 20688等国际标准落地发展兼顾隐私与安全的筛查方案并加强信息共享。在政策与协同层面需要形成标准化治理框架AI生物安全风险具有跨国界特征需要将政府、模型开发者与生命科学社区的专业经验纳入统一的协同治理框架。大语言模型智能体正在将生命科学实验的知识门槛从“专业人员”推向“非专业人员”——这既是技术进步的一面也是安全治理必须正视的一面。本次评估严格遵循负责任披露原则不展示制造危险物质的方法详细技术信息仅与相关安全机构共享。面向未来智源研究院安全研究团队将持续完善AI生物安全能力建设推进模型侧防御与合成筛查鲁棒性等多方面研究为人工智能与生命科学的负责任创新提供技术支撑。

相关新闻

文件包含漏洞深度解析:从LFI到RCE的攻击链与防御实践

文件包含漏洞深度解析:从LFI到RCE的攻击链与防御实践

1. 项目概述:理解文件包含漏洞的本质 文件包含漏洞,在安全圈里常被简称为“文件包含”,是Web应用安全中一个经典且危害极大的漏洞类型。我第一次深入接触这个漏洞,是在一次内部红蓝对抗演练中,一个看似普通的图片上传功…

2026/9/23 16:27:46 阅读更多 →
Unity游戏实时翻译插件XUnity.AutoTranslator配置与优化实战指南

Unity游戏实时翻译插件XUnity.AutoTranslator配置与优化实战指南

1. 项目概述:为什么我们需要游戏实时翻译? 作为一名独立游戏开发者,我经常需要测试来自全球各地的游戏Demo,或者研究不同语言区的热门作品。最头疼的莫过于遇到一款玩法惊艳但语言完全不通的游戏,那种感觉就像面对一个…

2026/9/24 23:34:32 阅读更多 →
针对移动卡基础信息表(t_card_info)与流量明细表(t_card_flow_detail)的关联统计需求

针对移动卡基础信息表(t_card_info)与流量明细表(t_card_flow_detail)的关联统计需求

文章目录 引言 I 移动卡流量统计 需求 实现思路 II sqlserver 实现 表结构设计 sql实现 建立复合索引 存在时间为空的排序方法 新增 HAVING 子句:过滤流量为0的月份数在 1~5 之间 III 接口实现 dto定义 新增 HAVING 子句 service 层代码 mapper层 引言 本文介绍了移动卡流量统…

2026/9/24 21:19:09 阅读更多 →

最新新闻

Atlas 300V 24G推理卡部署YOLO指南:从环境搭建到调优

Atlas 300V 24G推理卡部署YOLO指南:从环境搭建到调优

Atlas 这个项目名字,说大不大,说小不小。如果你是因为“atlas部署yolo”和“atlas 300v 24g 是运算加速卡吗”这两个热搜摸进来的,那我估计你跟我当初一样,手里刚好拿到一张华为的 Atlas 300V 推理卡,或者正在选型阶段…

2026/9/25 5:49:36 阅读更多 →
Atlas 300V部署YOLO目标检测:从推理卡选型到性能调优全指南

Atlas 300V部署YOLO目标检测:从推理卡选型到性能调优全指南

最近项目里要在Atlas 300V 24G上跑YOLO目标检测,搜了一圈资料,发现很多人连这张卡是干嘛的都没搞清楚就上手买了。不少朋友看到“300V”和“24G”这两个数字,以为它就是张“高显存显卡”,结果拿到手发现既不能跑CUDA,也…

2026/9/25 5:49:36 阅读更多 →
Bottle 第三方插件生态指南:插件清单、安装管理与源码级机制解析

Bottle 第三方插件生态指南:插件清单、安装管理与源码级机制解析

后端Web框架 【免费下载链接】bottle bottle.py is a fast and simple micro-framework for python web-applications. 项目地址: https://gitcode.com/gh_mirrors/bo/bottle 点击查看 免费下载 Bottle 是一个快速、简洁的 Python 微框架,官方文档维护了…

2026/9/25 5:49:36 阅读更多 →
KL散度实战指南:从信息代价到CV/NLP模型诊断

KL散度实战指南:从信息代价到CV/NLP模型诊断

1. 这不是数学公式堆砌,而是你真正能用上的KL散度实战指南KL散度(Kullback-Leibler Divergence)这个词,在机器学习入门阶段几乎人人听过,但真正能说清“它到底在模型里干了什么”“为什么损失函数里突然冒出log p/q”“…

2026/9/25 5:49:36 阅读更多 →
React 360 多 Surface 与 3D 混合应用实战:MultiRoot 示例源码级解析

React 360 多 Surface 与 3D 混合应用实战:MultiRoot 示例源码级解析

前端3D渲染 【免费下载链接】react-360 Create amazing 360 and VR content using React 项目地址: https://gitcode.com/gh_mirrors/re/react-360 点击查看 免费下载 React 360 允许开发者在同一场景中挂载多个"根节点"(Root)&am…

2026/9/25 5:49:36 阅读更多 →
基于Simulink的倒立摆模糊控制:从建模到调参的完整实战指南

基于Simulink的倒立摆模糊控制:从建模到调参的完整实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 5:48:35 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →