Hawa Code Computer use 优化项

简介: Hawa Code 的 Computer MCP 提供桌面自动化能力:通过截屏识别 UI 元素,支持点击、输入、滚动等操作;内置 key/type/click_element 等十余种精准控制工具,并兼容多平台无障碍 API 与 OCR。

1、基础原理

Hawa Code  computer MCP 提供 computer 操作工具 ,Agent 通过截屏分析当前的 UI 元素,进行鼠标点击、快捷键、文本输出等操作,从而可以控制电脑。

2、核心工具

  • key: 按下键盘上的某个键或组合键。
  • type: 通过键盘输入一段文本。
  • get_cursor_position: 获取光标当前在屏幕上的 (x, y) 像素坐标。
  • mouse_move: 将光标移动到指定的 (x, y) 像素坐标。
  • left_click: 点击鼠标左键。如果提供了坐标,会先移动到该位置。
  • left_click_drag: 按住鼠标左键并拖动光标到指定的 (x, y) 像素坐标。
  • right_click: 点击鼠标右键。如果提供了坐标,会先移动到该位置。
  • middle_click: 点击鼠标中键。如果提供了坐标,会先移动到该位置。
  • double_click: 双击鼠标左键。如果提供了坐标,会先移动到该位置。
  • scroll: 向指定方向滚动屏幕。需要提供坐标(先移动到该位置)和 text 参数指定方向:"up"、"down"、"left" 或 "right"。可追加 ":N" 指定滚动像素数(默认 300),例如 "down:500"。
  • get_screenshot: 截取屏幕截图。
  • click_element: 点击上一次 get_screenshot 返回的 \`elements\` 列表中的元素,通过 \`text\` 参数传入元素 id

2、文字输入

通过框架直接输入文字效率低,文字输入统一改成了从剪切板进行复制。

3、截屏

模型通过截屏是了解当前系统操作界面主要手段,需要注意以下事项:

  • 图片的分辨率要满足不同的模型对要求,同时也要考虑传输性能和成本。
  • 不同模型对于图像内容元素坐标识别准确度不同,要给予不同的手段提高模型坐标识准确性,这样模拟鼠标点击时候才会执行成功。

3.1 缩放

不同的模型对图片的分辨率大小都是有要求的,图片的分辨率要小于等于模型的要求,还有就是高的分辨率不一定会提高模型识别的准确性,所以不需要提供模型要求上限分辨率图片,图片大小适中就可以。

如果电脑的分辨率高就要进行缩放,进行缩放的时候要要注意屏幕放大比例,高分辨率屏幕一般是 150%、200% 的缩放比例。

  • 图片缩放比例:提交给模型图片分辨率/原始截屏图片分辨率
  • 屏幕放大比例:屏幕的物理分辨率/屏幕的逻辑分辨率

模型识别电脑的分辨率为为图片分辨率,鼠标坐标需要进行转换。

鼠标屏幕坐标 =  模型图片坐标 / 图片缩放比例 / 屏幕放大比例。

3.2、Set-of-Mark(SoM)标注

模型进行鼠标点击的流程是获取图片、识别元素在图片中的位置坐标,工具调用进行点击,工具会把图片中的位置坐标转换成屏幕的位置坐标出触发点击事件。流程中模型对于图片中的元素位置识别非常重要,如果模型模型无法准确识别出元素的准确位置,触发的点击位置就是错误的,导致鼠标点击错误。这时候需要开启辅助位置。

提供给模型截图时候,同时标注图片的中的核心元素,比如 提交 button 的坐标和边界位置和id,然后通过 click_element 工具使用 id 进行元素点击,从而提升点击事件有效性。

  • GPT5.5、claude-opus-4-7 模型测试图片中的元素坐标准确性高,不需要进行辅助识别。
  • kimi 2.6 测试坐标中元素坐标识别准确性低,需要开启辅助识别。
  • gpt5.5 模型默认图片为 auto,会进行缩放,应该修改为 origin 。

实现方式如下:

阶段

Windows

macOS

Linux

a11y 检测

UI Automation (PS)

AX API via JXA (swift

)

AT-SPI 2 (python3 + pyatspi

)

OCR 兜底

Windows.Media.Ocr

(PS)

Vision framework (swift

)

tesseract

CLI

依赖

内置

macOS 内置;OCR 需 Xcode CLT

python3-pyatspi

tesseract-ocr

权限

首次需授予辅助功能

3.4、上下文裁切

截图通过 base64 字符传输,体积非常大,但是实际上只对当前屏幕内容有效,如果屏幕的内容发生变化必须进行重新截图,不然就会发生错误。所以截图内容长期在上下文中意义不大。

  • 上下文中截图内容只保留最后两次,归档后的图片保存到磁盘上,修改上下文,去掉图片内容,改为图片的磁盘路径,特殊情况需要读取的时候有可以通过 Read 工具进行读取。
  • 历史消息存储也把图片放到外部存储,读取历史消息的时候还原为 base64 字符串。

欢迎大家了解使用 Hawa Code

目录
相关文章
|
5月前
|
JSON 前端开发 API
用Pydantic实现Python数据校验的最佳实践
本文以小张调试用户注册报错为引,生动揭示Python后端数据校验混乱的痛点:规则散落、类型错误频发、业务逻辑被校验淹没。随即引出Pydantic解法——通过声明式模型(如`class User(BaseModel): username: str; age: int = Field(ge=18)`),实现自动类型转换、嵌套校验、字段约束与清晰错误提示,大幅提升代码可读性、健壮性与可维护性。(239字)
395 0
|
2月前
|
弹性计算 安全 Linux
2026年阿里云服务器选型与网站部署全攻略:从服务器选型、配置到上线一站式指南
2026年阿里云服务器生态已形成轻量应用服务器与ECS云服务器两大核心体系,适配个人博客、企业官网、电商平台、应用开发等全场景建站需求。本文从服务器选型、配置选择、网站部署全流程、安全与运维优化四大维度,提供2026年最新实操指南,帮助用户精准选型、高效建站、稳定上线。
600 3
|
2月前
|
人工智能 API 调度
为什么很多 AI Agent 一上线就开始烧钱?我在这个开源项目里看到了答案
ClawRouter 是一个面向 AI Agent 的开源本地路由层,它关注的不只是多模型调用,而是模型选择、成本控制、fallback、Token 压缩和 Agent 运行时调度。
241 0
|
2月前
|
人工智能 缓存 自然语言处理
阿里云Token Plan团队版产品介绍、核心功能、套餐价格、便宜购买方法参考
阿里云百炼Token Plan团队版是面向企业及开发者的AI大模型订阅服务,旨在解决预算失控与工具割裂痛点。该服务以包月订阅制提供可控预算,支持Qwen、DeepSeek、Kimi等150+主流模型及Agent工具,兼容多模态能力。其核心优势在于统一的Credits计量体系、企业级管理后台(席位分配/用量监控)、数据安全承诺及高峰稳定调用。本文详细解析了其产品定位、四大核心功能、支持模型清单、三档坐席套餐(标准/高级/尊享)及选型指南,并分享了结合限时优惠与缓存复用的成本优化策略,助力团队高效落地AI生产力。
|
1月前
|
Web App开发 前端开发 API
GPT5.6凌晨刚上线:三档模型怎么选,别把额度烧在Sol上
GPT5.6上线,推出Sol/Terra/Luna三档模型:Sol专攻复杂任务,Terra适配日常办公,Luna专注快速批量处理。搭配GPT-Live全双工语音、桌面端Work/Codex整合及限额透明化,强调“按需选模”而非盲目用强。工具越智能,越需人精准定义目标与分工。(239字)
|
1月前
|
人工智能 算法 测试技术
2026年阿里云 GPU 云服务器配置价格表及测评
阿里云GPU云服务器(EGS)依托飞天智算架构与神龙虚拟化技术,提供从入门级T4到旗舰级H200的全系列NVIDIA GPU算力,覆盖AI训练、大模型推理、科学计算、图形渲染等全场景。2026年,阿里云进一步优化实例规格、价格体系与性能调度,推出Aegaeon资源池化技术,大幅提升GPU利用率并降低使用成本。本文从实例家族、配置参数、价格体系、性能实测、选型建议五大维度,全面解析2026年阿里云GPU云服务器,为个人开发者、算法团队与企业提供精准选型参考。
797 1
|
1月前
|
人工智能 缓存 JSON
刚刚 GPT-5.6 发布,吊打 Claude 5 和 Grok 4.5?一手实测来啦!
GPT-5.6 刚发布,跑分号称超越 Fable 5,真的假的?附一手实测,让 3 个最强 AI 编程模型 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 在 Cursor 里同时一把梭开发网页游戏,看看最新模型到底谁更能打。
621 0
|
2月前
|
人工智能 弹性计算 API
什么是 AlibabaCloud Agent Toolkit
Alibaba Cloud Agent Toolkit 是面向AI Agent的阿里云智能工具套件,集成OpenAPI、Terraform、CLI与文档能力,提供MCP插件、场景化Skills及执行审计机制,助AI准确查API、生成代码、规划架构、校验部署,实现安全、可靠、可追溯的云上智能运维。
1642 2
|
1月前
|
人工智能 IDE 数据处理
2026年Vibe Coding系统学习指南:从入门到实战全路径
IDC 2025全球AI编程工具报告显示,Vibe Coding(氛围编程)已成为开发者效率提升的核心路径,62%的技术团队已将其纳入日常开发流程。传统编程学习需数月掌握语法、框架与调试逻辑,而Vibe Coding以自然语言交互为核心,大幅降低入门门槛,但缺乏系统学习方法易陷入“只会描述、不会把控”的误区。本文以PySpark数据处理Pipeline为实战场景,结合TRAE、Cursor、Claude Code等主流工具,从基础认知、工具选型、提示词工程、实战迭代到工程化落地,构建完整学习体系,帮助开发者快速掌握Vibe Coding核心能力。
353 2