当下,让 Agent 自动操作浏览器主流路径,依然是:截图 → 多模态 LLM 识别页面元素 → 执行操作。而今天介绍的开源项目:Page Agent,和它们不一样。用户用自然语言下指令,Agent 在当前页面的 DOM 上解析意图并执行点击、输入等操作。Page Agent 是一个纯 JavaScript 的页面内 GUI Agent。
The GUI Agent Living in Your Webpage. Control web interfaces with natural language.
项目致谢了 browser-use,但两者定位完全不同:browser-use 是服务端的通用浏览器自动化引擎。而 Page Agent 的定位则是它的客户端版本。传统自动化方案往往需要准备 Python 环境、浏览器驱动等复杂依赖。而 Page Agent 只需一行 script 标签即可快速体验:Page Agent 直接读取和操作页面 DOM 结构:由 LLM 规划操作步骤,再通过内置执行器完成点击、输入等动作。Page Agent采用 BYO LLM(自带大模型)架构。支持接入所有兼容 OpenAI API 格式的模型,包括:OpenAI、Claude Code、通义千问、豆包、DeepSeek 等。但通过可选的 Chrome 扩展实现跨标签页、多页面控制,拓展操作范围。适合从 A 页面抓数据,填到 B 页面这类需要跨页面的工作流。让外部 Agent (如 Claude Code)远程控制浏览器。适合需要把浏览器控制能力接入更大 Agent 工作流的场景。Page Agent 全程在浏览器内运行,数据不经过第三方服务器。
继续观看
23.9K Star!这个开源项目把网页变成 AI Agent,无需截图、无需插件、无需后端
,
23.9K Star!这个开源项目把网页变成 AI Agent,无需截图、无需插件、无需后端
加载后页面右下角出现 Agent 面板,可以直接输入自然语言命令。
import { PageAgent } from 'page-agent'
const agent = new PageAgent({ model: 'qwen3.5-plus', baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1', apiKey: 'YOUR_API_KEY', language: 'zh-CN',})
await agent.execute('帮我填写上报销单,金额 xxx,类别为 xxx')
在你自己的产品里嵌入 AI 助手,几行代码实现,不需要后端改动。ERP、CRM、后台管理系统里的 20 步操作压缩成一句话。为任意 Web 应用添加自然语言操作能力,语音命令、屏幕阅读器场景。配合 Chrome 扩展,Agent 可以跨页面工作。通过 MCP Server(Beta)让外部 Agent 客户端控制浏览器。它把 前端原生、自然交互、零基建 作为核心,让 AI 真正融入网页。
开源地址:https://github.com/alibaba/page-agent