推荐一款开源工具:让 AI Agent 替你做 iOS、Android 自动化测试,能平替 Appium?

简介: Appium统治移动端自动化测试12年,但脚本复杂、维护成本高。新开源工具agent-device(Callstack出品)开启范式革命:专为AI Agent设计,通过语义化元素引用(@e1)、全链路证据采集、探索→回放机制,让AI“看懂”界面自主操作,非Appium替代品,而是下一代智能测试基础设施。

Appium 你用了多少年?

它从 2013 年到现在,12 年了。

12 年里,移动端自动化测试的格局基本没变——Appium 统治一切。

但说实话,Appium 不好用

写个测试脚本,要找元素 ID、写 XPath、处理弹窗、适配各种屏幕。脚本写完比业务代码还长,UI 一改全崩。

12 年了,一直如此。

直到最近,我发现了一个开源项目——让我觉得移动端自动化测试的范式,可能真的要变了。

它叫 agent-device

Callstack 出品,MIT 开源,JPMorgan Chase、Expensify、Shopify 的团队都在用。

一句话介绍:它是一款开源给 AI Agent 用的设备自动化 CLI,iOS、Android、TV、桌面全覆盖,目前在Github上,该项目star数接近4k。

安装方式(Node.js 版本需大于22.12):

npm install -g agent-device@latest
agent-device doctor
agent-device --version
agent-device help workflow

注意——它不是另一个 Appium。

Appium 的逻辑:你写脚本,一步步告诉它怎么点、怎么填。

agent-device 的逻辑完全不同:你把它交给 AI Agent(Codex、Claude Code),Agent 自己看屏幕、找按钮、做操作。

agent-device 只干一件事——当 Agent 的"眼睛"和"手"。

为什么我觉得它可能改变格局?

先说我的判断:不是技术比 Appium 更强,是思路根本不一样。

Appium 时代,测试的核心能力是"写脚本"——你得会 XPath、懂定位策略、处理等待逻辑。

agent-device 时代,测试的核心能力变成"描述意图"——你说"验证登录功能正常",Agent 自己看屏幕、找元素、点按钮、判断结果。

这不是优化,是范式转移

就像从"手写汇编"到"用高级语言"——不是汇编不好,是抽象层变了。

三个我觉得很聪明的设计

第一,语义化引用。

agent-device 截取屏幕快照后,给每个可交互元素分配一个引用——@e1@e2@e3

Agent 不需要写 XPath,只需要说"点击 @e3"。

agent-device snapshot -i
# @e1 [heading] "Settings"
# @e2 [button] "Sign In"
# @e3 [text-field] "Email"

agent-device fill @e3 "test@example.com"

XPath 会因为 UI 改版而失效。但基于无障碍树的引用,稳定性高一个量级

第二,证据收集不只是截图。

日志、网络流量、性能采样、崩溃上下文、React 渲染 profile——全自动收集。

这意味着 Agent 不只是"操作完了",还能自证清白。出了 bug 要复盘?证据链一条不少。

第三,探索变回放。

Agent 探索完一遍操作流程,自动录制成 .ad 脚本,之后 CI 反复跑。

探索时靠 AI,回归时靠脚本——两个阶段各取所长。

但别急着吹,它也有短板

第一,需要 AI Agent 驱动。

你得有 Codex 或 Claude Code。没有 Agent,它就是一个 CLI,价值砍半。

第二,吃 App 的无障碍标签。

它依赖 accessibility tree。如果 App 没做无障碍适配,元素全标"button",Agent 也抓瞎。

第三,生态还处在早期。

虽然已经有大厂在用,但文档、教程、社区最佳实践还在积累。碰到坑,你得自己趟。

我的判断

它不会立刻替代 Appium——但代表了 Appium 之后的方向。

Appium 解决的问题是"怎么让机器按步骤操作手机"。

agent-device 解决的问题是"怎么让 AI 像人一样看屏幕、理解界面、自主操作"。

这两件事,根本不在一个层面上。

未来两三年,移动端测试的核心能力,会从"写自动化脚本"转向"编排 AI Agent 做验证"。agent-device 不是终局,但它可能是推倒多米诺骨牌的那只手

如果你在做移动端测试,建议现在就去 GitHub 看看,跑一遍 Demo。

别等到所有人都在用的时候,你才反应过来。

GitHub 项目地址:github.com/callstack/agent-device

目录
相关文章
|
22天前
|
人工智能 缓存 JavaScript
当AI学会自己“探索性测试”,纯手工点点点的QA还能活多久?
本文探讨AI时代测试工程师的生存危机与转型机遇:当AI不仅能生成用例,更能自主探索、发现未知缺陷,手工测试正被“绕过”而非简单替代。文章剖析AI探索性测试的三层架构、真实效能对比,并指出测试人的新定位——从执行者转向策略设计者与AI教练。核心能力不再是“点点点”,而是定义风险、校准AI、沉淀测试知识。
|
20天前
|
人工智能 NoSQL 测试技术
测试开发必备的 AI 技能库:推荐6 个让接口自动化测试效率翻倍的 Skills
本文详解接口自动化测试“执行与报告”阶段的6款AI Agent Skill:打标、执行、诊断、清理、报告、编排,覆盖脚本筛选→智能运行→失败自愈→数据净化→决策报告→全链路调度,实现真正智能化、流水线化的测试闭环。
152 1
测试开发必备的 AI 技能库:推荐6 个让接口自动化测试效率翻倍的 Skills
|
21天前
|
Web App开发 人工智能 前端开发
10万人都在用的 top10 skills,我帮你试了!
Vercel推出的AI技能导航站skills.sh热度爆表,Top 10技能最高达240万热度!本文实测全榜,揭秘哪些真好用:find-skills是必备入口,frontend-design治“AI味”页面,tdd强制测试先行,grill-me灵魂拷问方案……按角色推荐组合,助你高效赋能AI助手。
460 0
|
8天前
|
人工智能 文字识别 JavaScript
AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
本文介绍`ui-testscript-enhancer`技能:自动为AI生成的UI测试脚本注入六大健壮性能力——智能等待、弹窗处理、iframe/Shadow DOM穿透、异常重试、失败截图录屏及验证码识别(集成ddddocr),5分钟将“能跑”的脚本升级为CI-ready的“跑得稳”生产级脚本。
126 2
AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
|
19天前
|
人工智能 自然语言处理 测试技术
从 LLM 评测到 AI Agent 评测,我的一些思考!
本文深入剖析AI评测体系的演进与陷阱,指出当前主流评测方法在Agent场景下的根本性失效:静态数据集、单次测试、只看输出等范式无法应对Agent的动态性、不确定性与系统性。文章提出四大关键转变——从“说了什么”到“做了什么”、从数据集到交互环境、从单点分数到概率分布、从评模型到评完整系统,并倡导构建多维、场景化、闭环的科学评测体系
149 1
从 LLM 评测到 AI Agent 评测,我的一些思考!
|
21天前
|
人工智能 小程序 安全
没有测试用例,Agent 也能跑完整个系统?AppCrawler 自动遍历测试背后的模型、架构与工程边界
AppCrawler 是一款面向AI时代研发提速的智能遍历测试工具,不依赖预编写的用例,而是通过状态建模、路径规划、智能断言与Diff对比,自动探索业务路径、识别异常并持续构建可复用的测试模型,助力测试从“脚本执行”迈向“质量规则设计”。
|
21天前
|
人工智能 jenkins 测试技术
AI 测试必备:多Agent Skill 智能编排,从「脚本执行」到「失败自愈」到「报告生成」,一键跑通全流程!
`api-pipeline-scheduler`是接口自动化测试的“总指挥”,一键编排`执行→清理→报告`全链路,零改动原有Skill,支持4种模式与异常续跑,真正实现多Agent协同闭环,大幅提升测试效率与流水线标准化水平。
143 0
AI 测试必备:多Agent Skill 智能编排,从「脚本执行」到「失败自愈」到「报告生成」,一键跑通全流程!
|
21天前
|
缓存 运维 NoSQL
阿里云 Tair vs 原生开源 Redis:企业级内存数据库深度对比
Tair 在性能(3 倍于开源 Redis)、持久化(持久内存掉电不丢数据)、高可用(99.995% SLA / 1.5s 故障切换)、数据结构(6 种企业级扩展)、运维成本(全托管节省 60%)五个核心维度全面领先,是国内企业级内存数据库的最佳选择。开发测试场景可使用原生开源 Redis 快速起步,生产环境强烈建议迁移至阿里云 Tair。
103 1
|
23天前
|
机器学习/深度学习 传感器 人工智能
工厂机器坏了才维修?数字孪生+大数据,正在把“事后抢修”变成“提前预警”
工厂机器坏了才维修?数字孪生+大数据,正在把“事后抢修”变成“提前预警”
100 1
|
27天前
|
Web App开发 人工智能 jenkins
还在手写测试报告?推荐一款 AI 测试Skill:只需一句指令,自动生成专业定制化测试报告!
`api-report-generator`是一款AI驱动的接口测试报告生成工具,一句指令即可将执行数据自动转化为含11大专业分区、风险分级、优化建议及Allure联动的决策型HTML报告,告别“数字堆砌”,让报告真正有人看、能决策。
152 0
还在手写测试报告?推荐一款 AI 测试Skill:只需一句指令,自动生成专业定制化测试报告!