NON906/omniparser-autogui-mcp

分类General
作者Community
星标23
定价Free

简介

这是一个将 OmniParser 的视觉解析能力与 PyAutoGUI 自动化操作结合的 MCP 服务。简单来说,它让 AI 拥有了“眼睛”和“手”:AI 能通过屏幕截图识别界面上的按钮、输入框等元素,并直接模拟鼠标点击和键盘输入来操控你的电脑。对于需要处理复杂 GUI 软件、无法通过 API 接入的陈旧系统,或者想要实现全自动网页/应用操作的开发者来说,这是一个极佳的桥梁。它将原本碎片化的视觉识别与执行步骤统一到了 MCP 标准下,显著降低了构建 AI Agent 操控桌面的门槛。

核心亮点

  • 视觉识别驱动,无需手动编写复杂的选择器
  • 支持模拟鼠标点击与键盘输入,接管 GUI 操作
  • 打通 AI 认知与系统执行,实现端到端自动化
  • 适配 MCP 协议,可快速集成至支持的 AI 客户端

完整文档

omniparser-autogui-mcp

日本語版はこちら

这是一个 MCP server,它使用 OmniParser 分析屏幕并自动操作 GUI。
已在 Windows 上确认可用。

License 说明

本项目采用 MIT 许可证,但不包括子模块和子包。
OmniParser 仓库采用 CC-BY-4.0。
每个 OmniParser 模型具有不同的许可证(参考)。

安装

1. 请执行以下操作:

code
git clone --recursive https://github.com/NON906/omniparser-autogui-mcp.git
cd omniparser-autogui-mcp
uv sync
set OCR_LANG=en
uv run download_models.py
(除 Windows 外,请使用 `export 代替 set。)
(如果你希望
langchain_example.py 能够运行,请改为执行 uv sync --extra langchain。)

2. 将以下内容添加到你的 claude_desktop_config.json 中:`claude_desktop_config.json
{
"mcpServers": {
"omniparser_autogui_mcp": {
"command": "uv",
"args": [
"--directory",
"D:\\CLONED_PATH\\omniparser-autogui-mcp",
"run",
"omniparser-autogui-mcp"
],
"env": {
"PYTHONIOENCODING": "utf-8",
"OCR_LANG": "en"
}
}
}
}
`(将 D:\\CLONED_PATH\\omniparser-autogui-mcp 替换为您克隆的目录。)

env 允许以下额外配置:

  • OMNI_PARSER_BACKEND_LOAD
如果与其他客户端(如 LibreChat)配合使用时无法工作,请指定为 1
  • TARGET_WINDOW_NAME
如果您想指定操作的窗口,请指定窗口名称。 如果未指定,则在整个屏幕上操作。
  • OMNI_PARSER_SERVER
如果您希望在另一台设备上进行 OmniParser 处理,请指定服务器的地址和端口,例如 127.0.0.1:8000。 可以使用 uv run omniparserserver 启动服务器。
  • SSE_HOST, SSE_PORT
如果指定,通信将通过 SSE 而非 stdio 进行。
  • SOM_MODEL_PATH, CAPTION_MODEL_NAME, CAPTION_MODEL_PATH, OMNI_PARSER_DEVICE, BOX_TRESHOLD`
这些用于 OmniParser 配置。 通常情况下不需要配置。

Usage Examples

  • 在屏幕上的浏览器中搜索 "MCP server"。

等等。