智能体蜂群实验:新框架性能提升,不同模型组合成本差异巨大!
Cursor产品导航Cursor提供多种功能与服务包括产品智能体、云端、移动端、自动化、CLI、应用市场、代码审查、企业、定价、资源更新日志、Blog、文档、社区、帮助、工作坊、论坛、招聘等板块还有登录、联系销售和下载等入口。智能体蜂群实验背景与目标今年早些时候开展一系列实验测试扩展智能体协作实现目标的极限假设这能解锁任务规模和复杂度新层级。旗舰项目从零开始构建Web浏览器取得概念验证成功但距成熟软件还有差距。后续目标是理解智能体蜂群以便进行工程化设计为此重新挑战依据SQLite文档用Rust从零构建的任务。实验初步结果让新旧蜂群在相同任务、模型和时间预算下运行衡量通过预留SQL测试套件比例。新蜂群在每种模型配置下表现更优如使用Grok 4.5时四小时内达80%通过率旧蜂群两小时前失控暂停。还调整不同模型工作分配不同组合产出质量相近但成本差异大。树与叶子大型任务描述呈树状结构智能体群围绕此结构组织有规划器智能体和worker智能体两种角色。规划器由最强模型驱动负责拆分目标worker由速度快、成本低的模型驱动负责执行。这种设计优于僵化编排系统能泛化到多样任务还用于内部发现修复漏洞、提升测试覆盖率和生成训练数据等。树如何影响记忆单个智能体承担完整任务时易偏离目标要么失去全局把握要么局部工作变差。而智能体蜂群中规划器和worker分工明确上下文使用更高效其可扩展性或源于上下文效率而非并行性这种结构类似企业层级组织原理。智能体的版本控制系统Git和Cargo等工具的并发控制方式不适用于数百个并发智能体的工作量。今年早些时候浏览器智能体群提交峰值约每小时1000次新系统达每秒约1000次。为此从零构建新的版本控制系统它还能暴露冲突并实现协调机制。每秒1,000次提交下的失效模式人类工程团队的协作机制在智能体群提交速率下会出现失效模式脑裂设计通过提示让规划器自己做决策并避免子树重复决策解决规划器之间的冲突让智能体记录决策在共享文档通过引用传递解决结果合并冲突由中立第三方智能体介入解决超大文件让worker智能体标记外部智能体拆分僵化允许引入破坏性变更并传导更新相关工作。审查视角多智能体系统需审查机制自我纠正错误。试验多种审查视角单一视角无法发现所有问题低相关视角叠加可提高可靠性投入审查的算力回报高。让智能体塑造环境借鉴迹象引导机制让智能体沉淀知识。开展Field Guide实验由智能体自主管理文件夹并注入信息其收益在非完全智能体掌控的代码库中可能更大训练模型为后继者写作值得研究。SQLite实验让新版本智能体群用Rust实现SQLite手册内容不提供源代码等信息以sqllogictest为评分标准。人工审查确保系统均衡构建智能体会自行选择策略整体趋势比具体时刻分数更重要。不同模型组合下的结果测试四种模型配置新框架在每种组合中都优于旧版。Fable 5混合方案首小时通过约三分之二测试集四小时新版运行结果在73% - 85%之间旧版在11% - 77%之间旧版Grok 4.5运行两小时左右暂停所有新版配置最终通过整个测试集。未来希望运行完整N×N矩阵此次重点是不同框架版本对比。深入剖析这些运行对比Grok 4.5在旧框架和新框架下的提交速率、合并冲突数、热点文件大小和Rust crate数量等指标发现旧框架存在无效忙碌、冲突多、文件膨胀和脑裂等问题最终新蜂群代码行数更少且得分更高。模型经济性不同模型组合产出质量相当但成本差异大worker承担大部分token但规划器token成本更高。大型任务中前沿规划器收敛不确定性后低成本模型执行可节省成本。如GPT - 5.5仅worker成本就达9373而Opus 4.8规划、Composer 2.5执行的worker集群成本仅411。Fable 5规划器虽单token价格高但使用token少但其worker消耗token多总成本更高。把规格说明当作提示AI发展提升工程师工作抽象层级智能体蜂群使工作基本单位变为规格说明。要让其可行蜂群需遵循规格说明稀缺的是对意图的准确描述。智能体蜂群类似编译器但每一步是概率性的本文旨在缩小差距。此次solo Opus 4.8 run生成的代码库已公开邀请读者查看并反馈。相关文章包括2026年6月11日用Auto - review管控智能体自主性、2026年6月2日构建云端智能体的经验、2026年5月6日用autoinstall自举Composer等文章信息。产品与资源等信息产品包括智能体、团队版、企业、定价、代码审查等资源有下载、更新日志、文档等公司有招聘、Blog、社区等法律涉及服务条款、隐私政策等还有连接X、LinkedIn、YouTube等渠道。

相关新闻

“阅后即焚”的PrivateBin与乌龙事件

“阅后即焚”的PrivateBin与乌龙事件

网管小贾 / sysadm.cc最近新上任的薛总,虽是一介女流,却是雷厉风行,言谈举止一丝不苟,颇有高端职场女性的风范。 听有人说,她可是董事长亲自指派来这当总经理的,嗯,怎么说我也应该巴结好啊&…

2026/7/22 23:22:11 阅读更多 →
知网/万方/PubMed三库查重结果竟相差41.2%?揭秘AI搜索底层语义锚点偏移机制(含TensorFlow调试日志)

知网/万方/PubMed三库查重结果竟相差41.2%?揭秘AI搜索底层语义锚点偏移机制(含TensorFlow调试日志)

更多请点击: https://codechina.net 第一章:知网/万方/PubMed三库查重结果差异的实证现象与问题提出 在科研写作与学术出版实践中,同一文献在知网、万方与PubMed三大数据库中呈现显著不同的重复率数值,已成为普遍且亟待解析的技术…

2026/7/22 23:22:11 阅读更多 →
【HarmonyOS 6】HarmonyOS 自定义时间选择器实现

【HarmonyOS 6】HarmonyOS 自定义时间选择器实现

前言 在开发时间管理类应用时,时间选择器是一个非常常见的功能。本文将通过近期在鸿蒙应用开发中的一个实际案例,详细讲解如何在 HarmonyOS 应用中实现一个自定义的时间选择器。我们这个案例中的选择器支持半小时为单位的时间选择,适合用于记…

2026/7/22 23:21:06 阅读更多 →

最新新闻

本地私密 AI 工具 OpenClaw 安装教程 数据本地运行更安全(含安装包)

本地私密 AI 工具 OpenClaw 安装教程 数据本地运行更安全(含安装包)

🦞OpenClaw 2.7.9 最新部署教程|零基础搭建桌面 AI 自动化数字员工 适配平台:Windows10/11 64 位、macOS12 及以上 稳定版本:v2.7.9 特点✨:全可视化操作、零代码部署、全自动环境配置,适合新手入门 &…

2026/7/23 0:05:27 阅读更多 →
Redis何时会成为“拖油瓶“?深度解析Redis拖垮应用程序的十大致命场景

Redis何时会成为“拖油瓶“?深度解析Redis拖垮应用程序的十大致命场景

引言:Redis的双刃剑特性 在现代应用架构中,Redis几乎已经成为标配。它以其卓越的性能、丰富的数据结构和简单易用的API,成为了缓存、会话存储、消息队列等场景的首选。然而,正是这种"好用"的特性,让很多开发…

2026/7/23 0:05:26 阅读更多 →
非升即走扎心真相:大部分青椒三年没成果直接走人

非升即走扎心真相:大部分青椒三年没成果直接走人

现在从头部双一流到地方普通本科,非升即走已经是高校通用的考核规则。绝大多数院校都划死了硬性红线:聘期之内必须拿到国自然青年项目、产出要求数量的高水平论文,三年期限到了没达标,不续聘、直接解约走人。不少青年青椒白天排满…

2026/7/23 0:04:26 阅读更多 →
AI课程论文怎么写不撞车?2026年实测:一晚上搞定3000字,查重AIGC双达标

AI课程论文怎么写不撞车?2026年实测:一晚上搞定3000字,查重AIGC双达标

【一句话答案】课程论文用AI写最怕"全班撞车AI率超标",毕业之家AI(www.biye.com)的ai生成课程论文功能按个性化选题定向生成、内置双检优化,实测3000字课论一晚上完成,查重率和AIGC率双双低于学校红线。一、…

2026/7/23 0:04:26 阅读更多 →
[Android] 可视化音乐制作 -短视频超火的音乐视频制作工具

[Android] 可视化音乐制作 -短视频超火的音乐视频制作工具

[Android] 可视化音乐制作 -短视频超火的音乐视频制作工具 链接:https://pan.xunlei.com/s/VOy7xOpSlVN0N8AWBUpn13U6A1?pwdcss3# 一键生DIY律动音频特效,多种炫酷波形样式选择,搭配背景音乐快速,作简单,短视频创…

2026/7/23 0:04:26 阅读更多 →
最新量化实现前,先让AI检查逻辑参数和流程缺口

最新量化实现前,先让AI检查逻辑参数和流程缺口

从手工交易转向量化表达时,很多问题看起来像代码问题,实际上先是规则问题。只要规则没有讲清,流程没有闭合,再熟悉实现方式也会反复返工。AI 可以帮助读者提前检查这些缺口,让注意力回到规则本身。让 AI 先帮你把问题问…

2026/7/23 0:03:26 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻