最近这波让 AI 直接操作电脑确实卷。Manus、Operator 都在拼让 agent 看图点鼠标,但真正上手时会发现一个尴尬:大多数项目只做其中一个环节——要么给你个 driver,要么给个 benchmark,要么给个沙箱。想拼出一套能训练、能评测、能落地的完整链路,只能自己东拼西凑。
今天要聊的开源项目 trycua 的 Cua 就是冲这个来的:它一次把 driver、云桌面、本地虚拟机、决策模型、评测基准 全摆上桌,MIT 开源,目前 Star 26,879(forks 1,870),建仓以来持续高频提交。下面具体看看它到底装了什么。

项目简介
Cua 是 computer-use 领域的全栈开源底座:给 AI agent 一台真正能用的电脑——跨系统操作桌面、供给隔离云桌面、跑本地虚拟机、用专用小模型做快速决策,再用 benchmark 评测和导出训练数据。
官方给自己的定位是 “Scale computer-use 2.0”:把 agent 从只会点网页升级到能在代码、API、图形界面之间自由切换。它不是一个单一工具,而是一个 monorepo 全家桶,主力语言 Rust + Python,五个模块各自独立又能串起来。
核心亮点拆解
1. 全栈五件套,完整度罕见
Cua Driver(操作层)+ Cua Fleets(云桌面)+ Lume(本地 VM)+ CUA-S1(决策模型)+ Cua Bench(评测基准),打包开源。在一众只做“看图点鼠标”的项目里,这个完整度确实少见——训练、评测、数据生成一条龙,不用自己攒基础设施。
2. Driver 后台交付,不抢你的鼠标
Cua Driver 让 agent 在 macOS、Windows、Linux 上操作原生桌面 App 和浏览器,提供 CLI / MCP(模型上下文协议) / typed SDK 三种接入方式,接 Claude Code、Codex、Cursor 都能用。
关键细节是后台交付:agent 在后台干活,不抢你的鼠标焦点。当然,前提是该平台和应用支持,边界以官方 platform-support 文档为准。
3. Bench 零门槛起步 + MIT 免费商用
Cua Bench 补上了最容易被忽略的评测环节:构建任务、评估 agent、导出轨迹做训练数据。起步任务不需要 VM、Docker 和模型 API key,装个 cua-bench[browser] 就能先跑通一个模拟任务。整套 MIT 协议,免费商用,底层 Rust/Python 也够硬。
核心原理与架构差异
旧方案的缺陷:computer-use 链条上的每个环节都有零散开源件,但它们来自不同项目、接口互不兼容,环境隔离靠手工搭 VM,评测各写各的脚本——拼起来比造轮子还累。
Cua 的分层架构,用四层讲清楚:
1. 执行层:Cua Driver。 统一的操作原语层,把点哪个元素、输什么文本、读什么状态抽象成跨系统 API。因为跑在系统层,它支持多会话并发——官方演示里两个 Driver 会话同时在 LibreOffice Calc 选单元格、在 Inkscape 选对象,终端始终保持在台前。这就是后台交付的底气。

2. 环境层:Cua Fleets + Lume。 Fleets 在 run.cua.ai 上按需供给隔离的 Linux 云桌面;Lume 基于苹果官方 Virtualization.Framework,在 Apple Silicon 上创建本地 macOS / Linux 虚拟机。两者共用同一套 Sandbox SDK,代码写一次,本地云端都能跑——环境供给这件事被标准化了。

3. 决策层:CUA-S1。 一族小型专用决策模型,官方用 “System 1”(快思考)类比:处理“这个值该填进哪个字段”“要不要动这个元素”这类快速、有界的决策,而不是逐 token 生成一大段文本。把高频小决策从主模型手里卸下来,是降延迟、降成本的直接手段。

4. 评测层:Cua Bench。 任务定义、评估器、轨迹导出一体化,且刻意做到零依赖起步——让“评测”从研究者的奢侈品变成开发流程的标配。

这个架构的判断很清晰:computer-use 的瓶颈不是某个模型不够聪明,而是执行、环境、决策、评测四层各缺一块。Cua 把四层一次补齐。
快速上手
核心流程:
-
装 Driver(macOS/Linux 一行命令,Windows 用 PowerShell 脚本):
curl -fsSL https://cua.ai/driver/install.sh | bash
irm https://cua.ai/driver/install.ps1 | iex
-
验证首个示例:让 agent 在计算器里算 6 × 7,再验证界面上确实显示 42;
-
尝鲜 Bench(零依赖):
pip install "cua-bench[browser]"
跑一个模拟任务,evaluator 报出 reward 1.0 即环境就绪;
-
要沙箱:Apple Silicon 用 Lume 起本地 macOS 虚拟机;要云端隔离桌面再接 Fleets。

注:以上为官方文档口径,不同平台的权限细节以官方 platform-support 文档为准,这里不复述未实测的安装体验。
团队落地方案
1. 团队改造思路
Cua 适合接在 GUI agent 研发底座这一层:执行用 Driver、环境用 Fleets/Lume、评测用 Bench,各层可独立采用、按需替换——你可以只引 Driver 接现有 agent,也可以整套替换自建基础设施。改造边界清晰:它不绑模型、不绑云厂商,Fleets 除外。
2. 部署方案
Driver 走 CLI 安装脚本 + MCP 配置,可以进团队标准的开发机初始化流程;Sandbox SDK 统一本地/云端环境定义后,环境即代码:虚拟机模板、云桌面池配置沉淀为仓库资产,新人入职环境一条命令到位。
3. 业务系统集成
Driver 的 typed SDK 和 MCP 接口天然可进 CI:UI 回归任务可以由 agent 在 Lume 虚拟机里跑,配合 Bench 的 evaluator 做断言打分;轨迹导出接数据管线,直接喂给模型训练。团队资产共享不再是“每个人本地各搞一套”的状态。
4. 团队规范定制
Bench 的任务定义和评估器是团队规范的载体:把“什么算操作成功”“哪些动作越权”写成任务与 evaluator,每个 agent 版本发布前跑一遍 benchmark,用分数代替体感做准入。
真实适用场景
- 做 computer-use agent 的团队:需要开源 driver 操作桌面 + 隔离沙箱环境;
- 训练 / 评估 GUI Agent 的研究者:Bench + 轨迹导出正好覆盖评测与数据生成;
- 自研能操作电脑的 agent 底座的开发者:五层各取所需,拒绝东拼西凑;
- AI 教学与 demo:零依赖 Bench 起步任务适合课堂快速演示。
不适合:只想装个现成 GUI Agent 直接用的普通用户、完全没有编程基础的人——monorepo 门槛摆在那。
客观优缺点 + 避坑
核心优势:全栈完整度罕见;Rust/Python 主力 + MIT;维护活跃。
局限:
- monorepo 结构复杂:五个子项目塞一个仓库,语言横跨 Rust/Python/TypeScript/Go/Swift,GitHub 主语言甚至显示 HTML,因为 docs 体量大。想单拎 driver 出来用,也得先趟一遍文档;
- 部分能力绑商业服务:Fleets 云桌面依赖 run.cua.ai,且池子在 claim 结束后可能保留付费容量——官方教程特别强调按步骤清理,别踩账单的坑;
- 本地权限门槛:Driver 需配置 macOS 辅助功能等系统权限,不是装上就能用;
- CUA-S1 尚处早期:source-only 研究发布,模型与数据集卡要逐个看适用范围和限制,别指望开箱即用。
落地常见坑:computer-use 整个方向仍在早期,通用 GUI Agent 的可靠性普遍待验证,Cua 也没跳出这个阶段。建议先从 Bench 免依赖任务和 Driver 单机命令起步,验证价值后再投入 Fleets 云资源。
最后说两句
computer-use 这波,大家在卷让 agent 看图点鼠标;Cua 的回答是把执行、环境、决策、评测四层基础设施一次攒齐,开源给你。它是个全家桶、有门槛,部分能力还连着它的云服务——但对已经有明确 computer-use 方向的团队,省下的基础设施时间是真金白银。
开源地址: https://github.com/trycua/cua
如果你也在关注这类 AI agent 基础设施,不妨常来云栈社区逛逛,开发者资源和讨论氛围都比较务实。