NON906/omniparser-autogui-mcp
简介
这是一个将 OmniParser 的视觉解析能力与 PyAutoGUI 自动化操作结合的 MCP 服务。简单来说,它让 AI 拥有了“眼睛”和“手”:AI 能通过屏幕截图识别界面上的按钮、输入框等元素,并直接模拟鼠标点击和键盘输入来操控你的电脑。对于需要处理复杂 GUI 软件、无法通过 API 接入的陈旧系统,或者想要实现全自动网页/应用操作的开发者来说,这是一个极佳的桥梁。它将原本碎片化的视觉识别与执行步骤统一到了 MCP 标准下,显著降低了构建 AI Agent 操控桌面的门槛。
核心亮点
- 视觉识别驱动,无需手动编写复杂的选择器
- 支持模拟鼠标点击与键盘输入,接管 GUI 操作
- 打通 AI 认知与系统执行,实现端到端自动化
- 适配 MCP 协议,可快速集成至支持的 AI 客户端
完整文档
omniparser-autogui-mcp
(日本語版はこちら)
这是一个 MCP server,它使用 OmniParser 分析屏幕并自动操作 GUI。
已在 Windows 上确认可用。
License 说明
本项目采用 MIT 许可证,但不包括子模块和子包。
OmniParser 仓库采用 CC-BY-4.0。
每个 OmniParser 模型具有不同的许可证(参考)。
安装
1. 请执行以下操作:
code
git clone --recursive https://github.com/NON906/omniparser-autogui-mcp.git
cd omniparser-autogui-mcp
uv sync
set OCR_LANG=en
uv run download_models.pyexport 代替 set。)
(如果你希望 langchain_example.py 能够运行,请改为执行 uv sync --extra langchain。)
2. 将以下内容添加到你的
claude_desktop_config.json 中:`claude_desktop_config.json
{
"mcpServers": {
"omniparser_autogui_mcp": {
"command": "uv",
"args": [
"--directory",
"D:\\CLONED_PATH\\omniparser-autogui-mcp",
"run",
"omniparser-autogui-mcp"
],
"env": {
"PYTHONIOENCODING": "utf-8",
"OCR_LANG": "en"
}
}
}
}
`(将 D:\\CLONED_PATH\\omniparser-autogui-mcp 替换为您克隆的目录。)
env 允许以下额外配置:
OMNI_PARSER_BACKEND_LOAD
如果与其他客户端(如 LibreChat)配合使用时无法工作,请指定为 1。
TARGET_WINDOW_NAME
如果您想指定操作的窗口,请指定窗口名称。
如果未指定,则在整个屏幕上操作。
OMNI_PARSER_SERVER
如果您希望在另一台设备上进行 OmniParser 处理,请指定服务器的地址和端口,例如 127.0.0.1:8000。
可以使用 uv run omniparserserver 启动服务器。
SSE_HOST, SSE_PORT
如果指定,通信将通过 SSE 而非 stdio 进行。
SOM_MODEL_PATH, CAPTION_MODEL_NAME, CAPTION_MODEL_PATH, OMNI_PARSER_DEVICE, BOX_TRESHOLD`
这些用于 OmniParser 配置。
通常情况下不需要配置。
Usage Examples
- 在屏幕上的浏览器中搜索 "MCP server"。
等等。