用OpenAI Agents SDK配合Playwright MCP
给LLM Agent加个浏览器插件其实就是解决它“看不见实时网页”和“无法操作页面”的问题。我尝试用 OpenAI Agents SDK 跑通了 Playwright MCP 的方案,这种组合比自己写复杂的 Selenium 脚本要高效得多。
这种部署方式让 AI Agent 从一个“聊天机器人”变成了真正的“自动化执行体”,实战价值很高。
下一篇
我的关于AI Agent安全性的一个小思考 →
最核心的逻辑是通过 MCP (Model Context Protocol) 把 Playwright 的浏览器控制能力直接暴露给模型,让 Agent 能像人一样执行点击、输入和页面跳转。
具体的实操链路是这样的:
一、安装环境
先得把 MCP 服务跑起来,确保环境里有 Playwright 依赖。
npm install -g @modelcontextprotocol/server-playwright
npx playwright install二、配置 Agent
在 OpenAI Agents SDK 的配置中,需要将 Playwright MCP 作为一个 Tool 挂载进去。这样模型在面对需要实时抓取或操作网页的任务时,会自动触发 browser_navigate 或 browser_click 等指令。
三、实操流程
1. 启动 MCP Server,建立与 LLM 的连接通道。
2. 在 Prompt 中定义 Agent 的角色,明确它拥有浏览器操作权限。
3. 运行任务(例如:去某个电商平台比价),观察 Agent 如何调用 Playwright API 进行页面解析。
踩坑点提醒:
- 选择器失效:Agent 有时候会通过视觉/文本猜测元素 ID,但动态网页的 ID 经常变,建议在提示词里引导它优先使用更稳定的 CSS Selector。
- 异步等待:Playwright 的页面加载是异步的,如果 Agent 操作太快,容易报
element not found错误,需要在工作流中加入适当的等待机制。
这种部署方式让 AI Agent 从一个“聊天机器人”变成了真正的“自动化执行体”,实战价值很高。