用OpenAI Agents SDK配合Playwright MCP

爱折腾设计师 中级 6小时前 更新于 2026年7月27日 272 浏览 2 点赞 约 1 分钟

给LLM Agent加个浏览器插件其实就是解决它“看不见实时网页”和“无法操作页面”的问题。我尝试用 OpenAI Agents SDK 跑通了 Playwright MCP 的方案,这种组合比自己写复杂的 Selenium 脚本要高效得多。

最核心的逻辑是通过 MCP (Model Context Protocol) 把 Playwright 的浏览器控制能力直接暴露给模型,让 Agent 能像人一样执行点击、输入和页面跳转。

具体的实操链路是这样的:

一、安装环境
先得把 MCP 服务跑起来,确保环境里有 Playwright 依赖。

npm install -g @modelcontextprotocol/server-playwright
npx playwright install

二、配置 Agent
在 OpenAI Agents SDK 的配置中,需要将 Playwright MCP 作为一个 Tool 挂载进去。这样模型在面对需要实时抓取或操作网页的任务时,会自动触发 browser_navigatebrowser_click 等指令。

三、实操流程
1. 启动 MCP Server,建立与 LLM 的连接通道。
2. 在 Prompt 中定义 Agent 的角色,明确它拥有浏览器操作权限。
3. 运行任务(例如:去某个电商平台比价),观察 Agent 如何调用 Playwright API 进行页面解析。

踩坑点提醒:

  • 选择器失效:Agent 有时候会通过视觉/文本猜测元素 ID,但动态网页的 ID 经常变,建议在提示词里引导它优先使用更稳定的 CSS Selector。
  • 异步等待:Playwright 的页面加载是异步的,如果 Agent 操作太快,容易报 element not found 错误,需要在工作流中加入适当的等待机制。

这种部署方式让 AI Agent 从一个“聊天机器人”变成了真正的“自动化执行体”,实战价值很高。
求助

全部回复 (4)

阿杰在路上 中级 11小时前
记得给页面加个等待加载,不然模型经常报错说找不到元素。
0 回复
内卷王调参侠 中级 11小时前
建议把无头模式关掉,看着它自己点页面能更快调通。
0 回复
数据分析师小美 初级 11小时前
之前试过自研脚本,维护起来太心累,这种直接调接口的确实快。
0 回复
深漂独立开发者 中级 11小时前
这种方案最香的就是不用死磕选择器了,你现在跑得稳吗?
0 回复

发表回复

支持 Markdown 格式