推荐一款开源工具:让 AI Agent 替你做 iOS、Android 自动化测试,能平替 Appium?

简介: Appium统治移动端自动化测试12年,但脚本复杂、维护成本高。新开源工具agent-device(Callstack出品)开启范式革命:专为AI Agent设计,通过语义化元素引用(@e1)、全链路证据采集、探索→回放机制,让AI“看懂”界面自主操作,非Appium替代品,而是下一代智能测试基础设施。

Appium 你用了多少年?

它从 2013 年到现在,12 年了。

12 年里,移动端自动化测试的格局基本没变——Appium 统治一切。

但说实话,Appium 不好用

写个测试脚本,要找元素 ID、写 XPath、处理弹窗、适配各种屏幕。脚本写完比业务代码还长,UI 一改全崩。

12 年了,一直如此。

直到最近,我发现了一个开源项目——让我觉得移动端自动化测试的范式,可能真的要变了。

它叫 agent-device

Callstack 出品,MIT 开源,JPMorgan Chase、Expensify、Shopify 的团队都在用。

一句话介绍:它是一款开源给 AI Agent 用的设备自动化 CLI,iOS、Android、TV、桌面全覆盖,目前在Github上,该项目star数接近4k。

安装方式(Node.js 版本需大于22.12):

npm install -g agent-device@latest
agent-device doctor
agent-device --version
agent-device help workflow

注意——它不是另一个 Appium。

Appium 的逻辑:你写脚本,一步步告诉它怎么点、怎么填。

agent-device 的逻辑完全不同:你把它交给 AI Agent(Codex、Claude Code),Agent 自己看屏幕、找按钮、做操作。

agent-device 只干一件事——当 Agent 的"眼睛"和"手"。

为什么我觉得它可能改变格局?

先说我的判断:不是技术比 Appium 更强,是思路根本不一样。

Appium 时代,测试的核心能力是"写脚本"——你得会 XPath、懂定位策略、处理等待逻辑。

agent-device 时代,测试的核心能力变成"描述意图"——你说"验证登录功能正常",Agent 自己看屏幕、找元素、点按钮、判断结果。

这不是优化,是范式转移

就像从"手写汇编"到"用高级语言"——不是汇编不好,是抽象层变了。

三个我觉得很聪明的设计

第一,语义化引用。

agent-device 截取屏幕快照后,给每个可交互元素分配一个引用——@e1@e2@e3

Agent 不需要写 XPath,只需要说"点击 @e3"。

agent-device snapshot -i
# @e1 [heading] "Settings"
# @e2 [button] "Sign In"
# @e3 [text-field] "Email"

agent-device fill @e3 "test@example.com"

XPath 会因为 UI 改版而失效。但基于无障碍树的引用,稳定性高一个量级

第二,证据收集不只是截图。

日志、网络流量、性能采样、崩溃上下文、React 渲染 profile——全自动收集。

这意味着 Agent 不只是"操作完了",还能自证清白。出了 bug 要复盘?证据链一条不少。

第三,探索变回放。

Agent 探索完一遍操作流程,自动录制成 .ad 脚本,之后 CI 反复跑。

探索时靠 AI,回归时靠脚本——两个阶段各取所长。

但别急着吹,它也有短板

第一,需要 AI Agent 驱动。

你得有 Codex 或 Claude Code。没有 Agent,它就是一个 CLI,价值砍半。

第二,吃 App 的无障碍标签。

它依赖 accessibility tree。如果 App 没做无障碍适配,元素全标"button",Agent 也抓瞎。

第三,生态还处在早期。

虽然已经有大厂在用,但文档、教程、社区最佳实践还在积累。碰到坑,你得自己趟。

我的判断

它不会立刻替代 Appium——但代表了 Appium 之后的方向。

Appium 解决的问题是"怎么让机器按步骤操作手机"。

agent-device 解决的问题是"怎么让 AI 像人一样看屏幕、理解界面、自主操作"。

这两件事,根本不在一个层面上。

未来两三年,移动端测试的核心能力,会从"写自动化脚本"转向"编排 AI Agent 做验证"。agent-device 不是终局,但它可能是推倒多米诺骨牌的那只手

如果你在做移动端测试,建议现在就去 GitHub 看看,跑一遍 Demo。

别等到所有人都在用的时候,你才反应过来。

GitHub 项目地址:github.com/callstack/agent-device

目录
相关文章
|
2月前
|
人工智能 缓存 JavaScript
当AI学会自己“探索性测试”,纯手工点点点的QA还能活多久?
本文探讨AI时代测试工程师的生存危机与转型机遇:当AI不仅能生成用例,更能自主探索、发现未知缺陷,手工测试正被“绕过”而非简单替代。文章剖析AI探索性测试的三层架构、真实效能对比,并指出测试人的新定位——从执行者转向策略设计者与AI教练。核心能力不再是“点点点”,而是定义风险、校准AI、沉淀测试知识。
|
2月前
|
人工智能 小程序 安全
没有测试用例,Agent 也能跑完整个系统?AppCrawler 自动遍历测试背后的模型、架构与工程边界
AppCrawler 是一款面向AI时代研发提速的智能遍历测试工具,不依赖预编写的用例,而是通过状态建模、路径规划、智能断言与Diff对比,自动探索业务路径、识别异常并持续构建可复用的测试模型,助力测试从“脚本执行”迈向“质量规则设计”。
|
2月前
|
Web App开发 人工智能 jenkins
还在手写测试报告?推荐一款 AI 测试Skill:只需一句指令,自动生成专业定制化测试报告!
`api-report-generator`是一款AI驱动的接口测试报告生成工具,一句指令即可将执行数据自动转化为含11大专业分区、风险分级、优化建议及Allure联动的决策型HTML报告,告别“数字堆砌”,让报告真正有人看、能决策。
287 0
还在手写测试报告?推荐一款 AI 测试Skill:只需一句指令,自动生成专业定制化测试报告!
|
2月前
|
Web App开发 人工智能 前端开发
10万人都在用的 top10 skills,我帮你试了!
Vercel推出的AI技能导航站skills.sh热度爆表,Top 10技能最高达240万热度!本文实测全榜,揭秘哪些真好用:find-skills是必备入口,frontend-design治“AI味”页面,tdd强制测试先行,grill-me灵魂拷问方案……按角色推荐组合,助你高效赋能AI助手。
841 0
|
2月前
|
人工智能 NoSQL 测试技术
测试开发必备的 AI 技能库:推荐6 个让接口自动化测试效率翻倍的 Skills
本文详解接口自动化测试“执行与报告”阶段的6款AI Agent Skill:打标、执行、诊断、清理、报告、编排,覆盖脚本筛选→智能运行→失败自愈→数据净化→决策报告→全链路调度,实现真正智能化、流水线化的测试闭环。
387 1
测试开发必备的 AI 技能库:推荐6 个让接口自动化测试效率翻倍的 Skills
|
2月前
|
人工智能 自然语言处理 测试技术
从 LLM 评测到 AI Agent 评测,我的一些思考!
本文深入剖析AI评测体系的演进与陷阱,指出当前主流评测方法在Agent场景下的根本性失效:静态数据集、单次测试、只看输出等范式无法应对Agent的动态性、不确定性与系统性。文章提出四大关键转变——从“说了什么”到“做了什么”、从数据集到交互环境、从单点分数到概率分布、从评模型到评完整系统,并倡导构建多维、场景化、闭环的科学评测体系
294 1
从 LLM 评测到 AI Agent 评测,我的一些思考!
|
22天前
|
人工智能 JavaScript 测试技术
从0到1搭建AI辅助测试环境:2026最新版,建议收藏
告别繁琐配置!30分钟用Node.js+DeepSeek Harness+Playwright搭好AI测试环境,无需Python、不配服务器,API Key一贴即用。支持AI自动生成/执行Web测试用例,新手也能零门槛上手——最难的不是技术,是“以为很难”的念头。
|
1月前
|
人工智能 文字识别 JavaScript
AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
本文介绍`ui-testscript-enhancer`技能:自动为AI生成的UI测试脚本注入六大健壮性能力——智能等待、弹窗处理、iframe/Shadow DOM穿透、异常重试、失败截图录屏及验证码识别(集成ddddocr),5分钟将“能跑”的脚本升级为CI-ready的“跑得稳”生产级脚本。
278 2
AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
|
26天前
|
人工智能 测试技术 调度
UI自动化测试提效必备Skill!一套CI流水线编排 Skill 可以直接抄了...
本文介绍 `ui-pipeline-scheduler`——UI自动化测试全链路编排技能。它将执行、诊断、重试、合并、报告五阶段自动串联,实现“一键启动、条件触发、熔断兜底、结果不丢”,解决人工串调、时机难判、死循环、数据失真等痛点,让测试人员从“操盘手”升级为“决策者”。
117 6
UI自动化测试提效必备Skill!一套CI流水线编排 Skill 可以直接抄了...
|
2月前
|
Web App开发 人工智能 缓存
自研 AOQ 协议,为多模态 AI 构建确定性传输底座
AOQ(AI Over QUIC)是专为多模态AI设计的自研传输协议,首创“实时+非实时”双模自适应机制,支持文本、音视频、文件全格式统一承载与强同步。基于QUIC深度优化,具备0-RTT建连、流级容错、智能带宽调度等能力,60%高丢包下仍保障流畅交互,突破弱网瓶颈,实现低延迟、高可靠、强同步三者兼得。
832 1