纯文本驱动网页自动化,无需截图
推荐指数 65.0 NO. 003 · 2026.07.05
Stars22,965
为什么值得看
Page Agent 是一个运行在浏览器页面内的 GUI 自动化工具,通过纯文本 DOM 操作实现自然语言控制网页,无需多模态 LLM 或特殊权限。对需要嵌入 AI 能力的 Web 产品团队来说,集成成本远低于传统浏览器自动化方案。
JavaScript in-page GUI agent. Control web interfaces with natural language.
媒体预览
编辑判断
目前网页自动化的主流方案是 Playwright、Puppeteer 这类浏览器控制库,或者依赖截图+多模态 LLM 的 Agent 如 Multion、Browser-use,前者需要服务端部署成本高,后者调用 GPT-4V 费用贵且延迟高。Page Agent 的创新在于完全在页面内通过 JavaScript 执行,把 DOM 转成文本结构给 LLM 理解,既保留了 Browser-use 的自然语言交互,又省去了截图和浏览器驱动的开销。
阿里开源这个项目的时机很准:MCP 协议正在快速成为 AI 工具连接标准,Page Agent 同时提供了 MCP Server,意味着它可以被 Claude、Cursor 等 MCP 客户端直接调用。如果你在构建需要操作网页的 AI 产品(比如自动填表、数据抓取、网页测试),但不想维护一套浏览器集群,这个方案值得优先评估。Chrome 扩展的多页面支持目前还是可选功能,复杂跨页流程的稳定性需要实测验证。
Star History
生态分析
Beta
面向Web产品团队的轻量级嵌入式页面自动化中间件
独特价值:纯文本DOM操作实现零依赖嵌入,无需多模态LLM和浏览器扩展
竞品: