Operator 之后开源社区半年追平 OpenAI『看屏操作』CUA 开源化全面复盘【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua2025 年 1 月OpenAI 发布首个号称「L3 级智能体」的 Operator并同步披露了其背后核心技术 CUAComputer-Using Agent——让模型不再只输出文字而是通过「看屏幕、点鼠标、敲键盘」直接操作真实电脑。当时社区的主流判断是这是智能体大战的起跑枪但也是封闭生态的又一次收拢——computer-use-preview模型只对 Tier 3 用户开放、只能走 Responses API、无法本地部署开发者手里只有一份「看得见摸不着」的演示。如今回头看剧本没有按封闭路线走。本文结合开源社区的真实舆情与本地仓库源码复盘 Operator 首发后的半年里开源阵营是如何把「看屏—决策—执行」闭环从实验室演示做成工程标配的并客观评估OpenAI 与开源派的差距还剩多少一、Operator 首发『L3 级智能体』的叙事与它的技术底座回顾 Operator 发布时的社区叙事核心卖点可以压缩成三句话能看会动视觉模型理解屏幕像素并生成键鼠指令、自主工作在一个网页会话内独立完成订票、网购等多步任务、安全可靠敏感操作前请求人类确认。这套叙事的技术底座正是 CUA屏幕截图进模型模型输出受限动作空间里的动作系统执行后回读新截图形成闭环。对照当时各家披露的对比信息Anthropic 同期的 Computer Use 走的是另一条路线——它把「看屏操作」作为工具暴露给已有 Agent 框架而 Operator 则把视觉理解、规划与执行打包成一个端到端的独立产品。社区随即指出两边的共同局限慢、贵、受限且最关键的是——模型权重与运行闭环都封闭在云端开发者无法在自有硬件上复现或改造。CSDN 上同期文章的评价可以概括当时氛围Operator「已为智能体大战开了好头」但也只是「开了好头」。它真正抛出的不是产品而是一个明确的技术命题如果 AI 要以人的方式使用电脑那么视觉感知、动作规划、执行器、安全围栏这四件事必须做成可被复现的开放工程。开源社区的追赶正是从回答这个命题开始的。二、开源阵营半年把『看屏—决策—执行』闭环做成标配从 2025 年中开始开源生态在四个层面几乎同时发力模型层开源了「看屏的脑子」驱动层开源了「执行的手脚」运行层开源了「装智能体的房子」评测层开源了「衡量追平进度的尺子」。1. 模型层从 UI-TARS 到 Qwen-CUA『看屏大脑』快速开源模型层是追赶最直观的战场。字节跳动 Seed 团队开源 UI-TARS-1.5 系列直接以「多项 Benchmark 取得 SOTA」的姿态切入阿里随后放出 Qwen-CUA——一个基于 397B 混合专家模型的「原生电脑操作智能体」宣称仅通过屏幕截图输入与键鼠操作输出即可跨软件工作并在 OSWorld 等八大基准上显著超越同期基线配套提出长程视觉上下文分块折叠、可验证训练基础设施与 SAPO 迭代式强化学习。这条「视觉—动作」范式与 Operator 的 CUA 高度同构但权重完全开放。更激进的开源信号来自麻省理工科技评论报道的「四人团队」用 1100 万小时屏幕录像训练出一个「通用的计算机行为模型」——证明在 Operator 的路径之外「看屏能力」可以从真实人机交互数据中规模化习得而不是只能由闭源实验室垄断。香港大学与月之暗面合作推出的 OpenCUA 则直接打出「每人都可造专属电脑智能体」的口号把「造 CUA」从特权变成模板。2. 驱动层Cua Driver——把『操作』从模型手里解放出来模型只是脑子真正让开源派「追平」的胜负手在执行层。本仓库的 Cua Driver当前 Rust 侧版本 0.34.0提供了一个非常具体的参照它把「看屏—决策—执行」闭环里的执行与观察做成任何模型都能接入的开放运行时。get_window_state在一次调用里同时返回窗口的无障碍树与截图——树说明「哪些元素可操作」角色、标签、element_token截图说明「该操作哪个」。动作侧则定义了严格的「行动阶梯」见 How Cua Driver worksElement后台按element_token走系统无障碍动作Windows 的 UI Automation Invoke、macOS 的 AXPerformAction、Linux 的 AT-SPIPixel后台按同一张截图读出的x, y坐标点击键盘动作先点一下聚焦再输入Page浏览器标签页切到 DOM 级工具经 CDP 无焦点操作Foreground仅当以上都失败才以前台模式重试该动作。每一步的响应都携带effectconfirmed/unverifiable/suspected_noop/partial/refused与escalation建议——「事件已投递」不等于「状态已改变」这是驱动层对闭环诚实性的核心承诺。配以 平台支持矩阵可以看到这套设计在 macOS、Windows、Linux X11、Linux Wayland 上的边界被逐格标清而不是含糊的「全平台可用」平台语义路由后台输入/捕获主要限制macOSAccessibility APIScoped CoreGraphics/SkyLight、ScreenCaptureKit需 TCC 授权个别后台手势拒绝WindowsUI Automation窗口消息直达目标 HWNDdaemon 必须在交互会话而非 Session 0Linux X11AT-SPI面向窗口的 X11 输入与捕获部分工具包拒绝合成后台事件Linux WaylandAT-SPI依合成器而定原始后台按键拒绝宁可不发关键点在于驱动层明确地把「拒绝」写进契约。background_unavailable是结构化响应而非失败掩饰——在 Wayland 上不知道焦点会落到哪个窗口时驱动选择拒绝而不是冒险把键敲进错误的应用。这种「可验证的拒绝」与「经得起回读的确认」正是 Operator 演示中最缺失、而开源工程最能补足的部分。当无障碍树与 DOM 都无法提供目标时可选装 感知扩展把单张截图解析为带边界的文本/图标/控件区域且每个感知动作都被绑定到产生它的那一次捕获——复用或超时60 秒的捕获会被capture_not_found/capture_expired直接拒绝。这意味着开源派不只复刻了「看屏」还复刻了「看屏必须基于当下真实画面」这一安全语义。更进一步仓库与 Omarchy 的 Hyprland 合作实现了「合成器原生」的后台操作见 blog/omarchy-cua-driver.md在合成器层面为智能体维护独立的合成光标与输入 seat用户前台拖拽与智能体后台操作并行互不干扰——这是对 Operator「接管你的屏幕」范式的正面升级3. 运行层给智能体一整套『房子』「看屏操作」最终要在真实的操作系统上跑。开源派半年内把运行层也补全了cua-spacesdlibs/cua-spacesd/README.md作为运行在沙箱/虚拟机内的守护进程用单端口 3211 同时暴露 gRPC、/mcp流式 HTTP MCP、/files签名 URL、/tunnel转发与 H.264/Opus 媒体流并提供进程、文件、截图、输入、低延迟音视频等全套智能体就绪接口。Lume 则在 Apple Silicon 上用 Virtualization.Framework 管理本地 macOS/Linux 虚拟机把「装智能体的房子」下沉到个人硬件。整个仓库的架构分层在 README.md 的「Choose your path」里一目了然Spaces 给智能体完整桌面、Driver 负责跨三平台桌面自动化、Lume 负责本地 VM、Cua Bench 负责评测、CUA-S1 负责专用决策模型并通过统一 SDKPython/TypeScript/Swift/Kotlin与 MCP 把各层缝合成一个闭环。4. 评测层Cua Bench——把『追平』变成可测量的东西追平与否不能靠宣传要靠尺子。Cua Bench当前 0.3.0提供了这把尺子可验证的电脑使用任务跑在真实桌面沙箱上以统一口径给任意智能体打分libs/cua-bench/README.md。一个任务模块只有四个函数契约清晰得几乎不像评测框架函数职责tasks_config声明同一目标下的变体提示词、数据、主题、OS 不同setup_task准备环境、打开应用solve_task可选 oracle一条已知的成功路径oracle 失败意味着任务本身坏了evaluate_task检查最终状态并给奖励对 oracle、人类、智能体一视同仁评测不再止于「跑完给个分数」每次运行产出trajectory.jsonATIF 格式轨迹含截图与summary.jsonpass_at_k、统计与分项可直接导出为训练数据。仓库内置 OSWorld、OSWorld-Verified、MiniWoB、WebVoyager 等主流基准适配器让社区可以拿同一套任务集横向对比闭源与开源智能体。「半年追平」这个判断第一次有了可复算的证据链。5. 决策模型层CUA-S1——把『决策』做成小模型也能干的事开源派不只追平了「大模型看屏」还试图把决策本身变小。CUA-S1 是一个研究型小模型家族libs/cua-s1/MODEL_CARD.md理念是「System 1」式快速有界决策给定屏幕状态与固定的元素, 动作候选集用单次前向选出最优项而非逐 token 生成。这个家族很有代表性cua-s1-nano-0.1是约 85.5 万参数的选项注意力分类器cua-s1-4b-0.1/0.2是在冻结的开源 Qwen3.5-4B 之上训练的 LoRA 适配器分为纯文本无障碍树与多模态截图两种模式0.2 版本还叠加了针对真实 GUI 环境的监督 强化学习两阶段。更难得的是模型卡对自己局限性的坦白分布内合成数据上决策准确率 97.5%但换成目录外标签的表单时掉到 29.3%——模型卡明确警告「高置信度的 skip 不等于表单在范围内或已完成」。这种边界标注本身就是开源生态成熟度的证明追平不是嘴上宣称而是把「知道自己在哪会失败」也一并开放。三、OpenAI 与开源派的差距还剩多少盘点完开源阵营半年交出的答卷可以给出一个分层结论。已经追平的是「看屏—决策—执行」闭环的完整性模型层有 Qwen-CUA、UI-TARS 级别的开源权重执行层有 Cua Driver 这种把无障碍语义路由、后台输入、逐格验证写成契约的运行时运行层有容器、虚拟机、云端一体的沙箱体系评测层有 Cua Bench 的统一尺子决策层甚至有了专用小模型。从「能不能用」的角度开源派在半年内把 Operator 的演示级能力变成了可自建、可评测、可拒绝、可审计的工程标准。差距仍在的主要在三个维度通用长程规划的稳定性。Operator 背后是闭源大模型的端到端规划开源派目前最成熟的是「专用决策 外部 harness 规划」的组合跨应用、跨会话、动辄上百步任务的一致性仍主要依赖外部大模型而非开源权重本身。安全围栏的成熟度。仓库在权限standard/bounded/unrestricted三档、捕获绑定、拒绝契约上做得很扎实但「有害动作识别」「跨平台政策一致执行」这类软性能力仍落后于闭源产品的多年运营沉淀。评测口径的统一。Cua Bench 提供了尺子但社区尚未形成「像 ImageNet 之于视觉」那样的公认电脑使用基准共识——OSWorld、MiniWoB、WebVoyager 各测一角横向可比性仍在建设期。回看这半年最值得记录的或许不是某个分数超越而是一个范式转折「看屏操作」从 OpenAI 的封闭演示变成了一个由模型、驱动、运行、评测、决策五层开源组件拼接而成的公共基础设施。Operator 证明了 CUA 值得做而开源社区证明了它可以用开放的方式做、并且做得可验证。差距还在但赛道已经从「仰望演示」变成了「可以动手改」——这恰恰是追平最扎实的第一步。【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考