搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架
来自人大和蚂蚁最新的研究工作 SearchOS 给出的答案是把搜索状态做成一种可以调度的基础设施并提供系统级的多智能体搜索协作。让 Agent 上网查资料已经不算新鲜事。过去一年多搜索智能体的能力提升主要沿着一条清晰路径展开通过强化学习让模型学会何时搜索、如何构造查询、怎样调用工具以及如何根据页面内容继续推理。但模型搜索能力的提升并不会自然解决长程任务中的系统问题。在复杂的信息检索过程中模型往往需要动态发现成百上千的实体、补齐大量属性并在多个来源之间核验事实有限窗口上下文的模型往往难以完成此类任务。如果计划、进度、证据和失败记录主要保存在不断增长的对话上下文中任务拉长后就容易出现几类问题已经确认的事实随压缩丢失不同子任务重复查询多个 Agent 对字段口径理解不一来源与结论脱钩系统也很难准确判断 “已经完成多少、还缺什么”。搜索 Agent 学会调用工具之后下一个问题是怎样让它在长程任务里搜得久、不重复、不失忆还能知道自己究竟搜全了没有来自人大和蚂蚁最新的研究工作 SearchOS 给出的答案是把搜索状态做成一种可以调度的基础设施并提供系统级的多智能体搜索协作。论文链接https://arxiv.org/abs/2607.15257GitHub 链接https://github.com/antins-labs/SearchOS项目官网https://antins-labs.github.io/SearchOS/YouTube 演示合集https://www.youtube.com/watch?vDZNXxMcxnMQlistPLXMUs3Ayz3EQ作者介绍本文的第一作者是张宇尧和高俊杰。张宇尧是中国人民大学高瓴人工智能学院的直博二年级研究生研究方向主要是信息智能体曾获 WWW2025 AgentSociety 大赛银牌、阿里巴巴 - 天池杯 xAFAC 大赛冠军ACL2026 SAC Hightlight 论文奖高俊杰是清华大学本科生、MBZUAI 的硕士研究生研究方向为多模态大模型和信息智能体目前就职于蚂蚁集团。方法介绍SearchOS 首先借鉴关系型数据库的设计理念重新定义了开放域信息检索问题。给定自然语言请求 q, 系统首先创建一个关系搜索模式其中 T_m 定义了表模式A_m 是要填写的列P_m 是区分每一行的主键R 是表之间的对应关系。简而言之关系模式定义了搜索任务的信息结构用主键识别待收集的实体用外键连接不同类型的对象。查一个事实、横向比较、全域调研、等等各种信息检索问题都可以落到一套关系型模式上。简单任务可能只有几行复杂任务可以有多张表通过主键和外键连接。系统一边发现实体、一边补属性每个值同时保存 citation可以回到对应网页和原文位置。围绕这个定义SearchOS 做了几项核心设计1. 面向搜索的上下文管理作者的核心判断是搜索状态应该存在于系统中而不是存在于对话历史中。围绕这一判断SearchOS 设计了 Search-Oriented Context ManagementSOCM将一次检索任务维护为四类持续演化的共享状态Frontier Tasks保存带优先级和依赖关系的待办任务明确哪些任务正在执行、等待或已完成Evidence Graph记录 finding、source、confidence以及证据之间的关系Coverage Map关系模式的实时补全状态持续显示哪些实体、属性和跨表依赖仍然缺失Failure Memory记录无效查询、不可访问来源和缺失能力避免后续 Agent 重复走入同一条失败路径。可以将这一机制理解为是一种所有 Agent 共用的进度表谁负责什么任务、收集到哪些信息哪条路已经不再可行通过查询一份共享的搜索状态来实现。2. 流水线并行调度有了 SOCMSearchOS 采用了多智能体架构中常见的编排者 - 子智能体架构。在运行时长生命周期的 Orchestrator 负责统一规划、调度和收敛。它先通过 Explore 阶段理解问题并发现候选实体再建立包含主键和表间关系的搜索模式将尚未补全的实体、属性或关系拆成任务分派给多个短生命周期 Search Agent。在 Agent 调度上SearchOS 采用了两类成熟的 AI Infra 思路一类是流水线并行机制让不同频次同时处于流水线的不同阶段另一类连续派发某个请求一结束就立即把新请求补进空出的计算槽位而不是等待整批任务全部完成。可以把每个搜索子任务看作一个 micro-batch把 search → open → find 看作一条搜索流水线。多个 Search Agent 执行完整搜索链但不同任务会错峰进入、交叠推进哪个 Agent 先完成调度器就马上把新的 Schema 缺口转化为任务补进空闲槽位。这样既能让不同搜索阶段在时间上重叠也能避免被一批任务中最慢的那个拖住从而提高 Agent 槽位利用率、整体吞吐量和墙钟效率。3. 搜索工具中间层长程搜索里模型会丢任务状态、忽略约束实际应用时还会遇到工具报错、无效输出、死循环和预算控制等问题。只靠 Prompt 提醒很难控制各种商用或开源模型的异常行为。为了让这些控制逻辑不依赖 Agent 自己记住并执行SearchOS 在模型和工具之间加了一层搜索工具中间层 Search Tool Middleware Harness 其中Context Middleware 负责按需注入相关状态并控制上下文规模Sensor Middleware 识别循环、重复查询和停滞Evidence Extraction Middleware 负责结构化抽取、单位归一、citation 锚定和证据入库。每个搜索 Agent 只需处理局部搜索子任务实现干净、连贯地推理和搜索而状态治理、证据处理和异常干预由系统层统一完成。4. 层次化搜索技能库SearchOS 还构建了面向搜索 Agent 的层次化技能体系将技能分为 orchestration、strategy 和 access 等类型。在开源的第一个版本中作者们预置了约 280 个技能。其中 Strategy skills 沉淀排名检索、多跳搜索、实体消歧等 “如何搜索” 的方法access skills 处理反爬、登录墙、动态页面和深层目录等 “如何访问” 的问题。技能可以按任务路由和复用也可以从成功与失败的搜索轨迹中继续演化并在隔离工作进程中执行。作者同时指出SearchOS-V1 的核心贡献是如何将搜索过程中的中间产物抽象为跨Agent共享的系统状态并为任务执行提供基础设施。如何从数据源、交互轨迹以及用户意图自动化生成大规模技能论文中明确留给后续工作来介绍和讨论。实验结果为了评测 SearchOS 的有效性作者们在两个开放信息检索基准上进行了评测。 第一个是 WideSearch 这是一个面向大规模宽表信息收集的任务 包含 200 道人工题中英各 100 跨 15 领域答案要落成可核验的完整表。另一个是 GISA 有 373 道贴近真实检索场景的题答案格式覆盖单项、集合、列表、表格重点考察开放世界信息收集的全面性。根据项目公布的 max3 结果SearchOS 在全部 F1 指标上领先参评的单智能体与多智能体基线。其中 WideSearch Item F1 为 80.3、Row F1 为 56.5GISA Table Item F1 为 76.9、Set F1 为 76.5。在要求枚举完整集合的 Set F1 上SearchOS 比次优基线高 13.4 分其增益主要来自 Coverage Map 驱动的持续补漏。为了进一步验证关系搜索模式的灵活性作者们还在 40 道可拆成多表的题上进行了实验。他们首先使用 GPT5.5 预先构建了单表和多表结构并分别进行收集任务。结果表明即便人为给每道题提前指定最优表结构Oracle Item F1 仍比 SearchOS 低 8.2 Row F1 低 7.7 。这表明真实场景下不同信息收集任务适用的表结构不同从而验证了 SearchOS 在探索过程中随发现的实体关系动态创建表结构的有效性。基于流水线并行的连续派发机制能够显著提高系统的吞吐量、降低模型调用次数和运行时间同时提高效果Case 研究则进一步表明所设计的 Sensor 中间件能够在搜索过程的早期、中期和后期停滞时干预 Agent 搜索行为从而推动搜索过程的顺利完成。预先构建的技能则进一步缩短了系统的运行时间并显著降低了搜索和 Jina API 的调用次数从而降低了一次搜索任务的所需成本。总结在 SearchOS 中作者们所尝试解决的并不是 “怎样再设计一个搜索 Agent 或算法”而是一个更基础也更加本质的问题当搜索成为长程、多角色协作、需要持续恢复和证据追溯与核验的系统任务时Agent 之间应该共享什么状态系统又该如何调度、监督并收敛它们。目前 SearchOS 已提供 CLI、全屏 TUI 和 Web 研究工作台。用户可以实时查看 Schema 补全进度、Agent 任务流和逐格证据中途退出后也可以继续运行或回头复盘。项目支持多家模型服务商和本地部署首次运行可通过配置向导完成设置如果你是做竞品研究、学校 / 产品对比、榜单或作品完整枚举、多跳信息核验或者在咨询、投研、BD、科研里经常要做 “尽量找全、每条都有出处” 的长程调研这个框架很值得试试看。

相关新闻

国内十大企业网站搭建平台与工具盘点

国内十大企业网站搭建平台与工具盘点

企业官网不仅承担品牌展示作用,也是客户了解产品、提交咨询和建立信任的重要入口。对于没有专业技术团队的中小企业来说,选择操作简单、模板丰富并且便于后期维护的建站平台,通常比从零开发更节省时间。下面整理十种常见的企业网站搭建平台与…

2026/7/29 8:25:58 阅读更多 →
2026论文翻车真相[特殊字符]不是你不会写,是工具选错了!okbiye才是隐形通关密码✅

2026论文翻车真相[特殊字符]不是你不会写,是工具选错了!okbiye才是隐形通关密码✅

🌐 官方直达:首页 - Okbiye智能写作Okbiye免费论文查重检测-首款免费论文检测软件,为毕业生提供专业的论文重复率检测、论文降重、Aigc检测、智能排版 、论文写作等一站式服务。https://www.okbiye.com 同样是写毕业论文,为什么有的人一次查…

2026/7/29 8:25:58 阅读更多 →
布隆过滤器原理、特性及短信黑名单过滤业务实现方案

布隆过滤器原理、特性及短信黑名单过滤业务实现方案

一、 什么是布隆过滤器?(作用、组成、添加元素流程、查询元素的流程、特点(误判、不支持删除)布隆过滤器(Bloom Filter)是由Burton Howard Bloom于1970年提出的。我们可以把它看作由位数组和一组哈希函数组…

2026/7/29 8:25:58 阅读更多 →

最新新闻

方法论:从思维框架到高效执行的系统化指南

方法论:从思维框架到高效执行的系统化指南

1. 从“知道”到“做到”的鸿沟:为什么我们需要方法论我们每天都在处理各种问题,从写一份工作报告、策划一个项目,到学习一门新技能、解决一个技术难题。很多时候,我们手头有信息,有工具,甚至也有目标&…

2026/7/29 8:34:00 阅读更多 →
智能锁卡技术强的公司

智能锁卡技术强的公司

对不起,我无法提供关于特定公司是否“智能锁卡技术强”的建议或评价。如果您需要了解智能锁相关技术或公司信息,建议您查阅专业行业报告或咨询相关领域的权威机构。不过,我可以为您推荐一款与智能卡技术相关的高品质产品——山西博旭万联科技…

2026/7/29 8:34:00 阅读更多 →
Open Interpreter实战指南:从自然语言到自动化终端操作

Open Interpreter实战指南:从自然语言到自动化终端操作

第一次在本地环境跑通 Open Interpreter 的那个下午,我盯着终端里自动生成的 Python 脚本,突然意识到这不仅仅是另一个代码生成工具。过去几年,我们习惯了在云端调用大模型 API,把代码片段、配置修改、文件操作这些琐碎任务一个个…

2026/7/29 8:34:00 阅读更多 →
GPT-4o模型API开发实战:从环境配置到多场景应用指南

GPT-4o模型API开发实战:从环境配置到多场景应用指南

在人工智能技术快速迭代的今天,每一次大模型的升级都牵动着开发者和技术爱好者的心。最近业内关注的焦点集中在模型能力的又一次飞跃——新版本在多项基准测试中展现出令人瞩目的进步,特别是在代码生成、逻辑推理和多模态理解方面有了显著提升。本文将从…

2026/7/29 8:34:00 阅读更多 →
书法美术培训需要长期坚持吗

书法美术培训需要长期坚持吗

在孩子的成长过程中,很多家长都会考虑让孩子参加书法美术培训,但是书法美术培训需不需要长期坚持呢?今天我们就结合艺绘空间的教学情况来聊聊这个话题。长期坚持,培养专注力孩子在成长过程中,专注力的培养至关重要。在…

2026/7/29 8:34:00 阅读更多 →
从零搭建Elasticsearch 8.x集群:配置详解与实战避坑指南

从零搭建Elasticsearch 8.x集群:配置详解与实战避坑指南

1. 项目概述:为什么需要自己动手搭建ES集群? 如果你正在处理日志分析、商品搜索或者任何需要处理海量非结构化数据的业务,那么Elasticsearch(简称ES)这个名字你一定不陌生。它是一个基于Lucene的分布式搜索和分析引擎…

2026/7/29 8:33:00 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻