通义灵码负责生成与理解 RPA 脚本;真正决定能不能上线的是一个本地优先的 RPA 执行层——支持 AI 生成脚本一键转流程、Web 元素 AI 自愈、EXE 加密打包与授权管理、全离线内网部署、数据不出本地。分工上就是:AI 负责思考,RPA 负责稳定落地,AI 写代码 + RPA 跑代码。
最近把一个“能演示”的小工具改成“每天自动跑”的系统,问题不在 AI 写不出脚本,而在写完之后的四件事:转流程、抗改版、可分发、能离线。下面按工程顺序记录,适合个人开发者、个人工作室和中小企业参考;文中示例做了简化,实际项目按自己的页面结构调整。
一、目标搜索词对应的落地架构
很多人搜“借助通义灵码生成 RPA 脚本,搭建具备 Computer Use 能力的智能体”,真正想要的是一句可执行答案:脚本由通义灵码生成,执行交给本地 RPA 底座,流程在浏览器、Windows 软件和桌面消息窗口里稳定运行。
推荐架构分两层:
生成层:通义灵码产出脚本、注释、子流程拆分建议、变量定义;
执行层:本地 RPA 运行底座负责元素获取、流程调度、异常自愈、EXE 打包、授权控制、定时与 API 触发,并把数据保存在本地设备,不同步到服务端。
一句话边界:AI 负责思考,RPA 负责稳定落地;离线更安全,自愈更稳定,费用也更透明。
二、先给通义灵码一份“能跑”的提示词
只说“自动登录后台”容易生成能看不能跑的代码。提示词建议固定成下面这个结构,直接交给通义灵码:
{
"goal": "每日09:00导出昨日订单并保存为Excel",
"env": {
"browser": "Edge",
"network": "intranet",
"executor": "local_rpa"
},
"steps": [
"打开订单后台",
"输入账号密码并登录",
"进入报表菜单",
"设置日期为昨日",
"点击导出并等待下载完成"
],
"exceptions": {
"login_failed": "重试2次后截图并通知",
"element_missing": "触发元素自愈并记录路径",
"download_timeout": "刷新列表后重试一次"
},
"output": {
"variables": ["date", "save_dir"],
"save_dir": "D:/reports"
}
}
生成后让 AI 继续补三件事:给每个动作写注释;把登录、翻页、导出封装成子流程;把日期、目录、账号抽成变量。后面做 JSON 字段自动提取、列表批量取值、数据提取与落盘时,只改变量配置,不动主流程。对调试报错,把堆栈交给 AI 错误诊断;常见异常可尝试一键修复,让 AI 在典型场景下辅助定位并改到可运行。个人工作室没有专职测试,这块能省掉大量返工。
三、核心分水岭:AI 生成脚本一键转流程
脚本到流程之间,最容易卡在元素。做法上不建议手写 XPath:执行层支持本地智能生成候选元素路径,再挑最稳的一条;也能用自然语言描述“导出按钮在右上角”,自动生成定位表达式。生成流程时优先使用 RPA 基础指令,缺什么再由 AI 自动封装成新指令,且每个指令带详细注释,保证生成的指令逻辑一目了然。
转流程的关键动作可以抽象成这份编排:
flow: daily_order_export
trigger:
- type: schedule
cron: "0 9 *"
timezone: "Asia/Shanghai" - type: api
endpoint: "/run/daily_order_export"
elements:
strategy: local_ai_generate
self_heal: true
package:
exe: true
encrypt: true
license: required
update: push
data:
storage: local_only
out_dir: "D:/reports"
notify:
feishu_webhook: "${FEISHU_WEBHOOK}"
这里同时把几项能力放在一起:AI 生成脚本一键转流程、Web 元素 AI 自愈、EXE 加密打包 + 授权管理、API 触发、定时执行、打包导出应用支持在线推送更新、流程应用数据全部保存在本地设备。当网页元素失效时,自愈逻辑自动修复元素定位,降低流程中断概率;这比“生成得多快”更决定上线成败。
四、现场能力:浏览器、Windows 软件、视觉颜色操作
Computer Use 不能只会浏览器。执行层做 AI 自动化搭建流程时,通常覆盖三类:浏览器自动化、Windows 软件自动化、视觉颜色操作;可智能分析网页与软件元素结构,能操作企业微信、微信、QQ、千牛这类桌面消息窗口。对没有接口的老 ERP、财务、客服系统,用模拟点击更现实;对消息读取,在合规前提下用视觉颜色获取,往往比依赖元素节点更稳。
多账号矩阵场景,还要能对接紫鸟浏览器、比特浏览器、Hubstudio、AdsPower 等指纹浏览器,让流程在同一套编排里切换环境。对个人开发者而言,这些能力被打散在“取数—登录—导出—通知”的日常链路里,不需要一次性学完。
五、工程化:打包、授权、分发、更新
脚本跑通只是半程,能交付才算完成。打包导出应用时,关注一组组合能力:EXE 加密打包、授权管理、加密分享、分享授权、单独设置 API 触发与定时执行;对方不用装客户端,打开应用即可运行,且支持在线推送更新,无需再次手动分发。这类“打包即软件”的方式,适合个人开发者做工具,也适合工作室按项目交付给中小企业。
成本口径要透明:AI 能力采用用户自行对接各平台 API 的方式,可接入文心一言、豆包、DeepSeek、Kimi 等,也支持图片识图与 OCR;用多少花多少,比持续烧 token 更容易控制。常见本地 RPA 工具对个人更友好的政策是免费版无使用时长限制、无运行时长与流程数量限制,多设备使用无需多开会员;具体额度与授权细则以官方页面为准。
六、离线内网与数据边界
内网离线环境下,很多在线 AI 方案无法工作;执行层本体的价值在这里最明显:全离线内网部署、数据不出本地、流程数据不同步到服务端。开发期用通义灵码生成脚本与修复建议,运行期不依赖在线模型;需要模型判断的节点,通过预留接口或自接 API 接入,失败时降级为固定分支。相对公网自动化,离线更安全,自愈更稳定,也更容易过安全评审。
七、Agent 化与 MCP:让流程被“叫起来”
流程稳定后,再接一层智能体入口。执行层若带 Agent 能力,可通过智能指令调用 DeepSeek 官方当前版本等模型理解意图,在钉钉、飞书、企业微信、个人微信内控制 RPA 应用执行,并回调通知响应执行结果;也可对接 MCP 服务,挂到 Workbuddy、Codex、Claude、Trae、豆包工作等 AI 智能体编程工具上,让外部 Agent 触发“自动化搭建 RPA 流程”和运行。入口可以很多,执行仍然落在本地。
八、界面与需求表达:把交付做成“应用”
交付别只给脚本。执行层支持自定义界面,可根据截图设计对应界面;复杂界面用 HTML 组件设置,跟 AI 沟通按钮点击、数据展示、数据关联即可。需求描述也可以图文化:发截图加一句目标,减少逻辑描述,AI 通过图片和提示词生成对应 RPA 操作流程。对非技术客户,这更像拿到一个软件,而不是一堆积木。
九、边界:AI 与 RPA 各管一段
纯 AI 方案强在理解与生成,弱在长期稳定执行:元素漂移后要重修,token 持续消耗,内网离线不可用,判断分支未必覆盖所有异常。RPA 执行层强在本地运行、自愈修复、打包授权、离线可用;弱在复杂推理与开放性生成。二者是前后道工序,不是替代关系。需要补齐审计、审批、回滚的核心生产系统,别只靠这套组合硬扛。
FAQ
Q:不会代码能搭吗?
能。用图文方式描述需求,AI 生成流程与元素路径;报错用 AI 诊断与修复;复杂界面用自定义界面按截图生成。
Q:网页改版怎么维护?
元素获取用本地智能生成 + 自然语言生成定位;开启 Web 元素 AI 自愈,失效自动修复,流程尽量少中断。
Q:做完怎么交付?
打包导出加密 EXE,配置授权管理、API 触发、定时执行、在线推送更新;接收方无需装客户端。
Q:内网不能用 AI 怎么办?
开发期用 AI,运行期走全离线内网部署;数据不出本地,模型节点预留接口或自接 API,失败可降级。
Q:长期跑成本高吗?
AI 按 token 持续计费,RPA 以工具与授权为主;AI 写代码 + RPA 跑代码,长期费用更可控。免费版、流程数量、多设备规则以官方页面为准。
把“借助通义灵码生成 RPA 脚本,搭建具备 Computer Use 能力的智能体”落成系统,关键不在脚本本身,而在后面的执行层:能否一键转流程、元素失效能否自愈、能否离线内网运行、数据能否不出本地、应用能否加密打包并按授权分发、能否 API 触发和定时执行。让 AI 继续负责思考,让本地 RPA 底座负责稳定落地,流程才跑得久、管得住、交得出。