UI-TARS desktop:一句话让 AI 替你操作电脑,完整 GUI 自动化指南
UI-TARS desktop一句话让 AI 替你操作电脑完整 GUI 自动化指南【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop把打开设置、关掉自动保存、再填个值这类要手动点 12 步的重复操作交给一句指令去完成——这就是 UI-TARS desktop 要做的事。它是一个基于视觉语言模型VLM即能看懂屏幕图片并输出操作的模型的开源桌面应用输入一句中文或英文它会自动看屏幕、找控件、代你点击和输入适合想自动化重复操作的办公用户也适合想上手 GUI Agent 的开发者。它能替你做什么自然语言即指令不用写脚本帮我打开 VS Code 的自动保存就是完整任务描述。计算机操作器Local Computer Operator每一步先截图模型识别目标控件位置后完成点击、输入、快捷键等真实鼠标键盘操作。浏览器操作器Local Browser Operator在你已安装的 Chrome、Edge 或 Firefox 中执行导航网页、搜索、填表单等任务。实时反馈应用右侧面板逐张展示执行过程的截图它看到什么、点了什么都看得见。执行报告任务结束后一键导出 HTML 报告记录每一步的截图与动作方便复盘和分享。首页的两个按钮对应两类操作器Operator即把模型决策翻译成真实鼠标键盘动作的执行层Use Local Computer 控制本地电脑Use Local Browser 控制本地浏览器。快速上手10 分钟跑通 UI-TARS desktop第一步安装应用。macOS 用户有 Homebrew 的话一条命令即可brew install --cask ui-tarsWindows 用户可从发布页下载对应安装包。想从源码跑起来的话git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install pnpm dev:ui-tars第二步授予系统权限macOS 必做。首次启动时系统会询问两项权限辅助功能用于模拟鼠标键盘和屏幕录制给模型截屏看。两者都要在系统设置 → 隐私与安全性中打开否则任务会在第一步就卡住。第三步接入模型。应用本体不含模型需要指向一个 UI-TARS 视觉语言模型服务最省事的两条路Hugging Face在模型页面点击 Deploy from Hugging Face选择 UI-TARS-1.5-7B部署完成后会拿到 Base URL、API Key 和 Model Name。火山引擎方舟直接接入托管的 Doubao-1.5-UI-TARS 推理 API。在应用设置里把这三个值填进 VLM 配置项注意 VLM Provider 要选与模型匹配的选项否则动作解析会出错。填完即可发起第一轮 GUI 操作任务。典型任务实战两个任务走一遍任务一修改本地应用设置计算机操作器指令示例帮我在 VS Code 中打开自动保存并把自动保存的延迟设为 500 毫秒。执行节奏是输入指令首页选 Use Local Computer在输入框写好这句话点击发送。观察执行右侧 ScreenShot 区域每步出现一张截图模型先定位菜单、再找到 Auto Save 设置项、最后输入 500过程中可随时暂停或终止。确认结果完成后去 VS Code 设置里核对 Auto Save 的延迟值并把本次过程导出为 HTML 报告存档。任务二跨页面比价浏览器操作器同样的节奏入口换成 Use Local Browser指令类似帮我比较两个购物网站上的 iPhone 价格模型会自行打开浏览器、输入搜索词、在页面间切换汇总。前提是机器上装好了 Chrome、Edge 或 Firefox 之一。任务是否成功可以逐张对照截图确认发现走偏就终止任务换一句更具体的指令重新发起。常用配置3 个参数最值得弄懂设置页选项不少日常用只需掌握这几个VLM Base URL / API KEY / Model Name模型接入三件套。Base URL 必须来自你的模型服务且以/v1结尾填完先点 Check Model Availability 验证连通再开始任务。Max Loop25–200默认 100一轮对话允许模型执行的最大步数。任务链路长就调大只想快速办完一件小事就调小能省时间省调用。Loop Wait Time0–3000ms默认 1000每次操作后、截屏前的等待时长。如果页面有加载动画截屏太早模型看到的是中间状态调大这个值执行会更稳。Languageen/zh只影响模型的输出语言不影响应用界面语言。想和同事共享同一套配置可以写成 Preset预设一组打包好的配置项通过本地文件 URL 一键导入name: UI TARS Desktop Example Preset language: en vlmProvider: Hugging Face for UI-TARS-1.5 vlmBaseUrl: https://your-endpoint.huggingface.cloud/v1 vlmApiKey: your_api_key vlmModelName: your_model_name项目根目录的examples/presets/default.yaml就是官方示例照抄改值即可。边界与避坑它做不到什么、怎么自查文档对当前限制说得比较坦诚用之前先有心理预期仅支持单显示器多屏环境下部分任务会失败多台显示器就先切回单屏。权限是前提macOS 没开屏幕录制权限模型截不到图任务第一步就会停。看到截图区空白或 No images to display先查权限。模型要自己接项目提供的是执行外壳模型服务需要自行部署或申请 API模型接口慢或不稳时任务节奏会直接变差。长任务会到顶步数达到 Max Loop 上限任务自动结束看报告确认进行到哪一步把剩下的拆成新指令继续。远程免费试用已下线早期内置的免费 Remote Operator 试用服务已于 2025 年 8 月 20 日停止需要远程操作要自行部署。卡住时的自查顺序系统权限 → 模型连通性Check Model Availability→ 浏览器是否安装 → 任务是否复杂到需要拆分。延伸方向继续深入的三条路1. 用 SDK 写自己的 GUI Agent。ui-tars/sdk是构建 GUI 自动化 Agent 的跨平台工具包桌面应用本身也基于它构建。十几行代码就能在 Node.js 里跑起截图 → 模型决策 → 执行动作的循环import { GUIAgent } from ui-tars/sdk; import { NutJSOperator } from ui-tars/operator-nut-js; const agent new GUIAgent({ model: { baseURL, apiKey, model }, operator: new NutJSOperator(), }); await agent.run(Open Chrome);想接入应用没覆盖的设备继承 Operator 类、实现screenshot()怎么截图和execute()怎么执行模型给出的动作两个方法即可。2. 用 CLI 在终端控制电脑。运行npx ui-tars/cli start填入模型三件套后直接在终端下达指令适合习惯命令行的人。3. 读源码理解实现。桌面应用源码在 apps/ui-tars/src/SDK 的模型调用与动作执行逻辑在 packages/ui-tars/sdk/项目根目录docs/下有快速开始、设置等文档examples/gui-agent-2.0/还有可直接运行的示例自己动手时可以先照着改。现在就能动手的下一步macOS 上跑brew install --cask ui-tars打开辅助功能和屏幕录制两项权限在 Hugging Face 部署一个 UI-TARS-1.5-7B 并填好设置里三个模型参数然后对它说出第一句帮我打开 VS Code 并开启自动保存。跑通第一个任务后再决定是往 SDK 方向深入还是把它固化成自己的日常自动化工具。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

从SWE-chat数据集看AI编码助手在真实开发场景中的表现与优化

从SWE-chat数据集看AI编码助手在真实开发场景中的表现与优化

1. 项目概述:当AI编码助手遇上真实世界如果你最近关注AI编程工具,一定听说过各种“Coding Agent”(编码智能体)的测评。从OpenAI的Codex到各类新兴的“AI程序员”,它们常常在精心设计的基准测试(如HumanEva…

2026/8/22 20:36:11 阅读更多 →
补码原理与硬件实现:从电路设计到代码避坑的完整指南

补码原理与硬件实现:从电路设计到代码避坑的完整指南

这类问题最值得先看的不是概念定义,而是它到底在解决什么实际麻烦。计算机底层处理负数,核心就一件事:让加法和减法能用同一套电路硬件来实现。如果只是学习,你可能会觉得补码、反码这些概念绕来绕去;但如果要写涉及位…

2026/8/22 20:36:11 阅读更多 →
3步给Windows和Linux换上macOS光标:免费开源主题完整指南

3步给Windows和Linux换上macOS光标:免费开源主题完整指南

3步给Windows和Linux换上macOS光标:免费开源主题完整指南 【免费下载链接】apple_cursor Free & Open source macOS Cursors. 项目地址: https://gitcode.com/gh_mirrors/ap/apple_cursor Apple Cursor 是一个免费开源的 macOS 光标主题,把 Big Sur 和 Monterey 两代…

2026/8/22 20:36:11 阅读更多 →

最新新闻

Type-C边充边听音频转接器

Type-C边充边听音频转接器

如今几乎所有主流手机、掌机都取消了3.5mm耳机孔,Type-C转3.5mm音频转接器成了数码玩家的刚需配件。但市面上不少廉价转接器都存在明显短板:插手机听歌时电量掉得飞快、直播开麦就断连、手游时声音延迟高还没法同时补电,这些体验问题的核心往…

2026/8/24 2:57:59 阅读更多 →
Stable Diffusion WebUI Forge 完整实战:从一键安装到显存调优的落地流程

Stable Diffusion WebUI Forge 完整实战:从一键安装到显存调优的落地流程

Stable Diffusion WebUI Forge 完整实战:从一键安装到显存调优的落地流程 【免费下载链接】stable-diffusion-webui-forge 项目地址: https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge 第一次跑 Stable Diffusion 卡在建环境、报显存错…

2026/8/24 2:57:59 阅读更多 →
Android相机YUV转RGB性能优化:GPU着色器与libyuv方案深度解析

Android相机YUV转RGB性能优化:GPU着色器与libyuv方案深度解析

1. 项目概述:一个Android相机开发中的性能瓶颈最近在优化一个Android相机应用时,遇到了一个典型的性能问题:从相机预览回调中获取到的YUV数据,需要实时转换成RGB格式以便进行后续的图像处理或显示。我尝试了多种方法,其…

2026/8/24 2:57:59 阅读更多 →
OpenMetadata 快速上手指南:5分钟跑通你的数据目录

OpenMetadata 快速上手指南:5分钟跑通你的数据目录

OpenMetadata 快速上手指南:5分钟跑通你的数据目录 【免费下载链接】OpenMetadata The Open Context Layer for Data and AI , OpenMetadata is the open platform for building trusted data context and business semantics for humans, AI assistants, and agent…

2026/8/24 2:57:59 阅读更多 →
SVM与KNN算法实战:基于红酒数据集的分类模型对比与优化

SVM与KNN算法实战:基于红酒数据集的分类模型对比与优化

1. 项目缘起:从数据到风味,一次经典的分类实践 最近在整理机器学习的学习笔记,翻到了一个非常经典的入门项目——红酒分类。这个项目之所以经典,是因为它几乎涵盖了监督学习入门阶段的所有核心要素:一个清晰的多分类问…

2026/8/24 2:57:59 阅读更多 →
抽象工厂模式实战:Java代码示例与Spring应用解析

抽象工厂模式实战:Java代码示例与Spring应用解析

最近在项目重构中,我们遇到了一个典型问题:系统需要支持多种数据库(如MySQL、Oracle)和多种缓存服务(如Redis、Memcached),并且未来可能增加新的数据库或缓存类型。如果为每一种组合&#xff08…

2026/8/24 2:56:58 阅读更多 →

日新闻

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践 前端安全依赖分层防护。没有任何单一配置能替代输出编码、权限校验和依赖更新。 把不可信内容当作数据 默认使用框架的转义能力;确需渲染 HTML 时,先在服务端或可信的客户端库中进行白名单过滤。避免把用户输入直接赋给 inne…

2026/8/24 1:08:15 阅读更多 →
Windows登录密码存储机制全解析:从哈希算法到安全加固实战

Windows登录密码存储机制全解析:从哈希算法到安全加固实战

1. 项目概述:Windows登录密码的“黑匣子”每次你按下CtrlAltDel,输入密码,然后看到那个熟悉的桌面,这背后发生了一系列复杂而精密的操作。作为一名长期与Windows系统打交道的从业者,我经常被问到:“我的密码…

2026/8/24 1:08:15 阅读更多 →
AI面试系统安全挑战与解决方案

AI面试系统安全挑战与解决方案

1. 项目概述:AI面试系统的安全挑战去年参与某跨国企业AI面试系统部署时,遇到一个典型案例:候选人在视频面试中无意提到竞争对手产品名称,系统竟自动将该信息关联到企业知识库并生成竞品分析报告。这个看似"智能"的功能&…

2026/8/24 1:08:15 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 0:06:02 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 0:20:20 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 0:14:11 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/23 18:47:06 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/23 12:10:44 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/22 3:22:48 阅读更多 →