嗨,我是小华同学,专注解锁高效工作与前沿AI工具!每日精选开源技术、实战技巧,助你省时50%、领先他人一步。👉免费订阅,与10万+技术人共享升级秘籍!
以前的 AI 会告诉你“怎么点”,现在真正麻烦的是:谁来点、点完有没有成功、出了问题能不能复盘?
让 Agent 操作电脑,不是把鼠标交出去就结束了。它还需要看到屏幕、执行动作、验证结果,并且最好不抢走你正在使用的键盘和光标。
这篇用 3 分钟讲清 Cua:它把 Driver、Sandbox、Bench 和虚拟机串起来,让 Computer-Use 从演示变成可构建、可评估、可复现的工程基础设施。

Cua 是什么?
一句话:Cua 不是一个“帮你点一下”的脚本,而是一套让 AI 真正使用电脑的开源基础设施。
它目前已经获得约 2.06 万 Star,最新 Release 是 fleet-v0.0.3,项目采用 MIT 许可证。它关注的不是某一个网站的自动化,而是更底层的问题:
Agent 能不能跨操作系统看懂界面、做出动作、确认结果,并把过程交给团队复用?
| 方案 | 能做什么 | 主要短板 |
|---|---|---|
| 普通 AI 助手 | 回答问题、生成代码、给出操作步骤 | 通常不会真的操作桌面 |
| 单点自动化脚本 | 固定点击、填写表单、执行流程 | 换机器、换界面后容易失效 |
| Cua | 驱动真实桌面、启动隔离环境、评测任务、记录轨迹 | 仍需要权限控制和任务边界 |
它把四块能力拼到了一起

1. Cua Driver:让 Agent 在后台操作电脑
Driver 面向 macOS、Windows、Linux,让 Agent 可以查看窗口、截图、点击、输入、启动应用并验证结果。
它最有意思的地方是:操作可以在后台进行,不必抢走你当前正在使用的光标和焦点。 对办公自动化、桌面 QA、演示环境和个人 Agent 来说,这比“自动移动鼠标”更接近真正可用的产品能力。
Driver 还提供 CLI 和 MCP 接入方式,可以接入 Claude Code、Codex、Cursor、OpenClaw 等客户端。
2. Cua Sandbox:给 Agent 一台 disposable 电脑
如果直接把生产电脑交给 Agent,风险和复现成本都很高。Sandbox 的思路是创建一次性的 GUI 机器,让任务在隔离环境中运行。
它支持 Linux、macOS、Windows、Android 等环境,既可以使用云端机器,也可以在本地 QEMU 中运行。Python 用户可以从下面的方式开始:
pip install cua
from cua import Image, Sandbox
async with Sandbox.ephemeral(Image.linux()) as sb:
await sb.shell.run("echo hello")
await sb.screenshot()
重点不在这几行代码,而在于:每个任务都有自己的环境,失败之后可以重新创建,测试结果也更容易复现。
3. Cua-Bench:别只看“演示成功”
Computer-Use 最容易出现的错觉是:视频里点成功一次,就以为系统已经可靠。
Cua-Bench 把 OSWorld、ScreenSpot、Windows Arena 和自定义任务放进评测流程,还可以导出轨迹用于训练和分析。这样团队评估的就不只是“模型会不会点”,还包括:
- 任务成功率怎么样?
- 在不同系统上是否稳定?
- 哪一步最容易失败?
- 失败轨迹能不能复盘和再利用?
4. Lume:把本地虚拟机也纳入工具链
Lume 面向 macOS 和 Linux 虚拟机,在 Apple Silicon 上使用 Apple Virtualization Framework,目标是让本地 VM 更接近真实机器的使用体验。
这让 Cua 不只适合“云端跑一次”,也适合开发者在本地构建、调试和验证自己的 Computer-Use 流程。
它真正解决的不是“会不会点”

很多桌面 Agent 的 Demo 看起来都很惊艳:识别屏幕,然后点击按钮。但进入真实项目后,难点通常变成了四件事:
- 状态:当前窗口到底是什么状态?
- 动作:点击或输入是否真的发出去了?
- 验证:页面变化是不是任务要求的结果?
- 复现:失败后能不能重新跑出同样的问题?
Cua 的价值,就是把“看屏幕、做动作、验证结果、记录轨迹”放进同一套工程模型里。
一个真实任务是怎么跑的?

可以把它理解成一条流水线:
自然语言任务
↓
获取窗口状态或截图
↓
点击、输入、启动应用
↓
等待界面状态变化
↓
独立验证任务结果
↓
记录轨迹,支持复盘和评测
例如,让 Agent 打开计算器完成 6 × 7,并不是让它“凭感觉”说答案,而是让它打开应用、执行输入、读取结果,再把最终状态报告出来。这个过程才有机会被测试、被审计、被扩展。
适合谁?不适合谁?
| 适合场景 | 不适合直接使用的场景 |
|---|---|
| 构建桌面型 AI Agent | 没有权限隔离的生产环境 |
| 跨系统 GUI 自动化 | 只靠坐标点击、完全不做验证的脚本 |
| QA、回归测试、任务评测 | 把高风险账号直接交给不受控 Agent |
| 训练数据和操作轨迹生成 | 需要百分之百稳定、但没有重试和人工兜底的流程 |
尤其要注意:后台操作不等于无风险操作。 Cua 提供权限策略,可以按工具和参数限制 Agent 的能力,并支持默认拒绝;但涉及支付、删除、登录和敏感数据的任务,仍然应该放在隔离环境中,并保留人工确认。
3 分钟上手 Cua Driver
macOS 或 Linux 可以先安装 Driver:
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
然后检查本机状态:
cua-driver doctor
cua-driver call list_apps
如果你希望让 Agent 客户端直接调用,还可以安装 Cua skills 或生成 MCP 配置。想研究隔离环境,则从 pip install cua 和官方 Sandbox 教程开始会更合适。
小华的判断
Cua 最值得关注的地方,不是它让 AI “会点鼠标”了,而是它开始补齐 Computer-Use 真正缺少的工程环节:
执行环境、跨平台驱动、权限控制、结果验证、评测基准和可复用轨迹。
这意味着桌面 Agent 正在从“看起来很聪明的 Demo”,走向“可以被开发、被测试、被复盘的系统”。如果你正在做 AI Agent、桌面自动化或智能 QA,Cua 值得先收藏,再拿一个低风险任务试跑。
下一篇可以继续拆解 Cua Driver 的 MCP 接入、权限策略,以及怎样设计一个不会乱点的桌面 Agent。