开源 CUA 大战本周开打OpenCUA、UI-TARS-1.5 前后脚开源27k 星的 trycua/cua 如何守擂【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua本周计算机使用智能体Computer-Use Agent下称 CUA赛道迎来罕见的双模型撞车字节 Seed 把 UI-TARS-1.5 的权重开源并亮出多项 SOTA 战绩港大与 Kimi 团队前后脚放出 OpenCUA主打人人可造专属电脑智能体。当模型派开始成建制地开源那个长期盘踞 GitHub 趋势榜、被社区称为Cua的 27k 星仓库 trycua/cua 反而显得安静——它没有新权重可发。但把仓库拆开看会发现它的护城河从来不在模型权重而在模型之下的电脑层跨三操作系统的驱动Cua Driver、沙箱与本地虚拟机运行时SDK/CLI Lume、评测与数据工厂Cua Bench以及一套把 OpenCUA、UI-TARS 直接吃掉当自家组件的模型无关适配层。本文基于仓库源码逐行核对回答一个问题模型阵营集体开源的这几天trycua/cua 是被围剿还是恰好被抬到了更高的生态位。一、两位挑战者SOTA 战绩与人人可造的叙事先给模型派记分。UI-TARS-1.5ByteDance SeedUI-TARS 系列的第二代开源权重。trycua/cua 仓库自己的博客在对比各模型能力时引用了它的基准数据这张表也是目前社区引用率最高的OS 操作能力坐标系之一BenchmarkUI-TARS-1.5OpenAI CuaClaude 3.7此前 SOTAHumanOSWorld100 步42.536.428.038.1200 步72.4Windows Agent Arena50 步42.1——29.8—WebVoyager84.887.084.187.0—Online-Mind2Web75.871.062.971.0—AndroidWorld64.2——59.5—上表出自 Cua 团队维护的模型能力对照blog/build-your-own-operator-on-macos-2.md这张表透露的信息比分数本身更重要UI-TARS-1.5 的强项集中在OS/桌面级任务OSWorld、Windows Agent Arena 双双刷新 SOTA浏览器场景 OpenAI Cua 仍保留 2 个百分点优势。Cua 团队的选型结论也因此写得很直白需要更强 OS/桌面能力和低延迟自动化时选 UI-TARS Loop。对一个开源模型而言在最难打的原生桌面场景上超过闭源 API就是它能快速出圈的原因。OpenCUA港大 Kimi走的是另一条叙事——人人可造专属电脑智能体。与 UI-TARS 主打综合智能体不同OpenCUA 是典型的 grounding界面定位模型给一张截图和一句点这里它输出click(x..., y...)。7B 级权重开源意味着开发者可以在本地起一个 OpenAI 兼容端点自己组装智能体循环不必依赖任何云 API。同期中文社区出现了一整批截图 多模态模型 pyautogui手写 CUA 的教程潮阿里的 Qwen-CUA397B MoE等模型也在此前后发布——人人可造不是口号而是工程事实一个视觉定位模型 一个键鼠执行器最小可用 CUA 就闭环了而这两个部件现在都是开源的。模型派这一轮攻势本质上是把 CUA 栈里最贵的智力层免费化了。接下来看 trycua/cua 手里还攥着什么。二、生态位卖电脑不卖大脑打开 README.md第一句话是 Give AI agents computers they can use.——注意不是 Give AI agents a brain。仓库自我定位是四件套Cua Driver跨 macOS/Windows/Linux 的桌面自动化驱动通过 CLI、MCP 或类型化 SDK 接入支持后台投递——智能体干活时不动你的指针、不抢焦点Cua SDK CLI一条cua命令和 Rust 核心管本地虚拟机、gVisor/Docker 容器、云端沙箱沙箱内的 cua-spacesd 守护进程在 3211 端口暴露进程、文件、截屏与输入能力Lume基于 Apple Virtualization.Framework 的本地 macOS/Linux 虚拟机管理M 系列芯片上从 Apple 恢复镜像创建 Tahoe 虚拟机并 SSH 接入Cua Bench建任务、跑评测、导出训练轨迹的基准与 RL 环境。仓库架构图把生态位画得很清楚img/cua-architecture.png整个栈被切成 Environment / Execution / Intelligence 三层最右一列 Agent Framework 标注着100 VLM Options、Pre-built agent loops、Bring Your Own Key。换句话说trycua/cua 从设计上就把大脑外置为可插拔组件——模型派开源的不是威胁而是给它补上了免费、可本地化的选项。商业结构同样自洽仓库绝大部分代码SDK、CLI、Driver、Lume、Bench是 MIT只有 Cua Spaces 应用层走 FSL-1.1-MIT源可用、不可提供竞品托管服务、每个版本两年后转 MIT见 LICENSING.md 与 COMMERCIAL.md。它卖的是给你的智能体一台电脑的运行时与服务模型层恰恰是它最不需要独占的部分。三、源码级证据OpenCUA 与 UI-TARS 早已是 Cua 的内置组件最能说明守擂姿势的不是 README 措辞而是 libs/python/agent/ 下的 agent loop 目录。Cua 把每个模型厂商的怪癖封装成独立的Agent Loop用正则注册——模型名一换大脑即换register_agent(modelsr(?i).*OpenCUA.*) # loops/opencua.py register_agent(modelsr(?i).*ui-?tars-?2.*) # loops/uitars2.py逐个看细节才能理解模型无关要吞掉多少脏活。OpenCUA Loop 的坐标工程libs/python/agent/cua_agent/loops/opencua.pyOpenCUA 端点不理会 provider 侧的像素提示所以 Cua 在发送前真的重编码图片——用qwen_vl_utils.smart_resize按factor28、max_pixels12845056缩放并记住缩放系数把模型返回的坐标反向映射回原始分辨率MIN_PIXELS 3136 MAX_PIXELS 12845056 FACTOR 28 rh, rw smart_resize(orig_h, orig_w, factorFACTOR, min_pixelsMIN_PIXELS, max_pixelsMAX_PIXELS) # ... def _rescale(x: int, y: int) - Tuple[int, int]: if last_orig_w and last_orig_h and last_rw and last_rh: return _rescale_coordinate(x, y, last_orig_w, last_orig_h, last_rw, last_rh) return (x, y)输出解析同样为 OpenCUA 定制优先匹配其原生的click(x..., y...)extract_coordinates_from_click还兼容旧式pyautogui.click(...)输出再退到 【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考