搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架
来自人大和蚂蚁最新的研究工作 SearchOS 给出的答案是把搜索状态做成一种可以调度的基础设施并提供系统级的多智能体搜索协作。让 Agent 上网查资料已经不算新鲜事。过去一年多搜索智能体的能力提升主要沿着一条清晰路径展开通过强化学习让模型学会何时搜索、如何构造查询、怎样调用工具以及如何根据页面内容继续推理。但模型搜索能力的提升并不会自然解决长程任务中的系统问题。在复杂的信息检索过程中模型往往需要动态发现成百上千的实体、补齐大量属性并在多个来源之间核验事实有限窗口上下文的模型往往难以完成此类任务。如果计划、进度、证据和失败记录主要保存在不断增长的对话上下文中任务拉长后就容易出现几类问题已经确认的事实随压缩丢失不同子任务重复查询多个 Agent 对字段口径理解不一来源与结论脱钩系统也很难准确判断 “已经完成多少、还缺什么”。搜索 Agent 学会调用工具之后下一个问题是怎样让它在长程任务里搜得久、不重复、不失忆还能知道自己究竟搜全了没有来自人大和蚂蚁最新的研究工作 SearchOS 给出的答案是把搜索状态做成一种可以调度的基础设施并提供系统级的多智能体搜索协作。论文链接https://arxiv.org/abs/2607.15257GitHub 链接https://github.com/antins-labs/SearchOS项目官网https://antins-labs.github.io/SearchOS/YouTube 演示合集https://www.youtube.com/watch?vDZNXxMcxnMQlistPLXMUs3Ayz3EQ作者介绍本文的第一作者是张宇尧和高俊杰。张宇尧是中国人民大学高瓴人工智能学院的直博二年级研究生研究方向主要是信息智能体曾获 WWW2025 AgentSociety 大赛银牌、阿里巴巴 - 天池杯 xAFAC 大赛冠军ACL2026 SAC Hightlight 论文奖高俊杰是清华大学本科生、MBZUAI 的硕士研究生研究方向为多模态大模型和信息智能体目前就职于蚂蚁集团。方法介绍SearchOS 首先借鉴关系型数据库的设计理念重新定义了开放域信息检索问题。给定自然语言请求 q, 系统首先创建一个关系搜索模式其中 T_m 定义了表模式A_m 是要填写的列P_m 是区分每一行的主键R 是表之间的对应关系。简而言之关系模式定义了搜索任务的信息结构用主键识别待收集的实体用外键连接不同类型的对象。查一个事实、横向比较、全域调研、等等各种信息检索问题都可以落到一套关系型模式上。简单任务可能只有几行复杂任务可以有多张表通过主键和外键连接。系统一边发现实体、一边补属性每个值同时保存 citation可以回到对应网页和原文位置。围绕这个定义SearchOS 做了几项核心设计1. 面向搜索的上下文管理作者的核心判断是搜索状态应该存在于系统中而不是存在于对话历史中。围绕这一判断SearchOS 设计了 Search-Oriented Context ManagementSOCM将一次检索任务维护为四类持续演化的共享状态Frontier Tasks保存带优先级和依赖关系的待办任务明确哪些任务正在执行、等待或已完成Evidence Graph记录 finding、source、confidence以及证据之间的关系Coverage Map关系模式的实时补全状态持续显示哪些实体、属性和跨表依赖仍然缺失Failure Memory记录无效查询、不可访问来源和缺失能力避免后续 Agent 重复走入同一条失败路径。可以将这一机制理解为是一种所有 Agent 共用的进度表谁负责什么任务、收集到哪些信息哪条路已经不再可行通过查询一份共享的搜索状态来实现。2. 流水线并行调度有了 SOCMSearchOS 采用了多智能体架构中常见的编排者 - 子智能体架构。在运行时长生命周期的 Orchestrator 负责统一规划、调度和收敛。它先通过 Explore 阶段理解问题并发现候选实体再建立包含主键和表间关系的搜索模式将尚未补全的实体、属性或关系拆成任务分派给多个短生命周期 Search Agent。在 Agent 调度上SearchOS 采用了两类成熟的 AI Infra 思路一类是流水线并行机制让不同频次同时处于流水线的不同阶段另一类连续派发某个请求一结束就立即把新请求补进空出的计算槽位而不是等待整批任务全部完成。可以把每个搜索子任务看作一个 micro-batch把 search → open → find 看作一条搜索流水线。多个 Search Agent 执行完整搜索链但不同任务会错峰进入、交叠推进哪个 Agent 先完成调度器就马上把新的 Schema 缺口转化为任务补进空闲槽位。这样既能让不同搜索阶段在时间上重叠也能避免被一批任务中最慢的那个拖住从而提高 Agent 槽位利用率、整体吞吐量和墙钟效率。3. 搜索工具中间层长程搜索里模型会丢任务状态、忽略约束实际应用时还会遇到工具报错、无效输出、死循环和预算控制等问题。只靠 Prompt 提醒很难控制各种商用或开源模型的异常行为。为了让这些控制逻辑不依赖 Agent 自己记住并执行SearchOS 在模型和工具之间加了一层搜索工具中间层 Search Tool Middleware Harness 其中Context Middleware 负责按需注入相关状态并控制上下文规模Sensor Middleware 识别循环、重复查询和停滞Evidence Extraction Middleware 负责结构化抽取、单位归一、citation 锚定和证据入库。每个搜索 Agent 只需处理局部搜索子任务实现干净、连贯地推理和搜索而状态治理、证据处理和异常干预由系统层统一完成。4. 层次化搜索技能库SearchOS 还构建了面向搜索 Agent 的层次化技能体系将技能分为 orchestration、strategy 和 access 等类型。在开源的第一个版本中作者们预置了约 280 个技能。其中 Strategy skills 沉淀排名检索、多跳搜索、实体消歧等 “如何搜索” 的方法access skills 处理反爬、登录墙、动态页面和深层目录等 “如何访问” 的问题。技能可以按任务路由和复用也可以从成功与失败的搜索轨迹中继续演化并在隔离工作进程中执行。作者同时指出SearchOS-V1 的核心贡献是如何将搜索过程中的中间产物抽象为跨Agent共享的系统状态并为任务执行提供基础设施。如何从数据源、交互轨迹以及用户意图自动化生成大规模技能论文中明确留给后续工作来介绍和讨论。实验结果为了评测 SearchOS 的有效性作者们在两个开放信息检索基准上进行了评测。 第一个是 WideSearch 这是一个面向大规模宽表信息收集的任务 包含 200 道人工题中英各 100 跨 15 领域答案要落成可核验的完整表。另一个是 GISA 有 373 道贴近真实检索场景的题答案格式覆盖单项、集合、列表、表格重点考察开放世界信息收集的全面性。根据项目公布的 max3 结果SearchOS 在全部 F1 指标上领先参评的单智能体与多智能体基线。其中 WideSearch Item F1 为 80.3、Row F1 为 56.5GISA Table Item F1 为 76.9、Set F1 为 76.5。在要求枚举完整集合的 Set F1 上SearchOS 比次优基线高 13.4 分其增益主要来自 Coverage Map 驱动的持续补漏。为了进一步验证关系搜索模式的灵活性作者们还在 40 道可拆成多表的题上进行了实验。他们首先使用 GPT5.5 预先构建了单表和多表结构并分别进行收集任务。结果表明即便人为给每道题提前指定最优表结构Oracle Item F1 仍比 SearchOS 低 8.2 Row F1 低 7.7 。这表明真实场景下不同信息收集任务适用的表结构不同从而验证了 SearchOS 在探索过程中随发现的实体关系动态创建表结构的有效性。基于流水线并行的连续派发机制能够显著提高系统的吞吐量、降低模型调用次数和运行时间同时提高效果Case 研究则进一步表明所设计的 Sensor 中间件能够在搜索过程的早期、中期和后期停滞时干预 Agent 搜索行为从而推动搜索过程的顺利完成。预先构建的技能则进一步缩短了系统的运行时间并显著降低了搜索和 Jina API 的调用次数从而降低了一次搜索任务的所需成本。总结在 SearchOS 中作者们所尝试解决的并不是 “怎样再设计一个搜索 Agent 或算法”而是一个更基础也更加本质的问题当搜索成为长程、多角色协作、需要持续恢复和证据追溯与核验的系统任务时Agent 之间应该共享什么状态系统又该如何调度、监督并收敛它们。目前 SearchOS 已提供 CLI、全屏 TUI 和 Web 研究工作台。用户可以实时查看 Schema 补全进度、Agent 任务流和逐格证据中途退出后也可以继续运行或回头复盘。项目支持多家模型服务商和本地部署首次运行可通过配置向导完成设置如果你是做竞品研究、学校 / 产品对比、榜单或作品完整枚举、多跳信息核验或者在咨询、投研、BD、科研里经常要做 “尽量找全、每条都有出处” 的长程调研这个框架很值得试试看。

相关新闻

国内十大企业网站搭建平台与工具盘点

国内十大企业网站搭建平台与工具盘点

企业官网不仅承担品牌展示作用,也是客户了解产品、提交咨询和建立信任的重要入口。对于没有专业技术团队的中小企业来说,选择操作简单、模板丰富并且便于后期维护的建站平台,通常比从零开发更节省时间。下面整理十种常见的企业网站搭建平台与…

2026/9/8 23:01:44 阅读更多 →
2026论文翻车真相[特殊字符]不是你不会写,是工具选错了!okbiye才是隐形通关密码✅

2026论文翻车真相[特殊字符]不是你不会写,是工具选错了!okbiye才是隐形通关密码✅

🌐 官方直达:首页 - Okbiye智能写作Okbiye免费论文查重检测-首款免费论文检测软件,为毕业生提供专业的论文重复率检测、论文降重、Aigc检测、智能排版 、论文写作等一站式服务。https://www.okbiye.com 同样是写毕业论文,为什么有的人一次查…

2026/9/14 2:34:19 阅读更多 →
布隆过滤器原理、特性及短信黑名单过滤业务实现方案

布隆过滤器原理、特性及短信黑名单过滤业务实现方案

一、 什么是布隆过滤器?(作用、组成、添加元素流程、查询元素的流程、特点(误判、不支持删除)布隆过滤器(Bloom Filter)是由Burton Howard Bloom于1970年提出的。我们可以把它看作由位数组和一组哈希函数组…

2026/9/18 15:36:50 阅读更多 →

最新新闻

3张表搞定三角函数值对照表全部,面试不再慌的最佳实践

3张表搞定三角函数值对照表全部,面试不再慌的最佳实践

3张表搞定三角函数值对照表全部,面试不再慌的最佳实践 面试被问原理答不上来,那种尴尬真的能让人当场黑屏。别慌,今天把三角函数值对照表全部整理成可运行的代码项目,教你一套 最佳实践 ,让你从背表到懂逻辑,彻底告别死记硬背。 项目目标…

2026/9/22 18:38:44 阅读更多 →
影驰1060图解原理:3招解决代码跑不通难题

影驰1060图解原理:3招解决代码跑不通难题

影驰1060图解原理:3招解决代码跑不通难题 刚拿到影驰1060显卡,准备跑个移动端渲染项目,结果复制来的代码直接报错,心里是不是特别慌?别急,这种“代码看着对,一跑就崩”的情况,90%的新手都踩过坑。今天不聊虚的,直接上干货,用…

2026/9/22 18:38:44 阅读更多 →
在 Logstash 中使用 Winlogbeat 模块:加载并接入 Ingest Pipeline 解析 Windows 日志

在 Logstash 中使用 Winlogbeat 模块:加载并接入 Ingest Pipeline 解析 Windows 日志

数据工程后端 【免费下载链接】logstash Logstash - transport and process your logs, events, or other data 项目地址: https://gitcode.com/gh_mirrors/lo/logstash 点击查看 免费下载 Logstash 与 Winlogbeat 模块的集成并不需要复杂的 Logstash 过滤器重写&a…

2026/9/22 18:38:44 阅读更多 →
5步拆解空调原理图避坑指南:从入门到精通的底层逻辑

5步拆解空调原理图避坑指南:从入门到精通的底层逻辑

5步拆解空调原理图避坑指南:从入门到精通的底层逻辑 官方文档往往长达上百页,公式堆砌让人头大,核心逻辑却藏在字缝里。很多初学者对着复杂的制冷循环图发呆,根本抓不住重点。其实,想真正搞懂空调原理图,从入门到精通,不需要死记硬背每一个系数,而是…

2026/9/22 18:38:44 阅读更多 →
5分钟搞定软件测试工程师简历:源码解析视角下的避坑指南

5分钟搞定软件测试工程师简历:源码解析视角下的避坑指南

5分钟搞定软件测试工程师简历:源码解析视角下的避坑指南 面试被问原理答不上来,简历写得再花哨也白搭。HR和技术主管在筛选软件测试工程师简历时,最反感的不是经验少,而是“只有结果,没有过程”。他们想看到的不是一行行“负责XX项目测试”,而是你…

2026/9/22 18:37:44 阅读更多 →
3个实战项目惨痛教训:全拼符号导致代码崩盘的避坑指南

3个实战项目惨痛教训:全拼符号导致代码崩盘的避坑指南

3个实战项目惨痛教训:全拼符号导致代码崩盘的避坑指南 刚复制来的代码,粘贴进本地环境直接报错?别急着怀疑人生,八成是“全拼符号”在捣鬼。我在三个 实战项目 里都栽过这个跟头,明明逻辑没问题,就是跑不通。…

2026/9/22 18:37:43 阅读更多 →

日新闻

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天 配置环境就卡半天?别怪机器慢,多半是你没选对工具链。在Java、Go或Python的项目现场, 手写实现…

2026/9/22 0:00:41 阅读更多 →
剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑 面试被问原理答不上来,是不是常态?别慌。很多开发者对着 GitHub 开源仓库里的代码发呆,看似简单实则暗藏玄机。今天这份【剑帝加点】速查手册,直接带你拆解核心实现,把面试必考的原理讲透。…

2026/9/22 0:00:41 阅读更多 →
手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优 复制来的代码跑不通不知道怎么调?别慌,这种“复制粘贴地狱”在开发圈太常见了。尤其是做 图片压缩网站…

2026/9/22 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/22 4:32:41 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/22 4:38:57 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/22 8:51:04 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/22 2:43:42 阅读更多 →