1.5k stars！阿里开源 PageAgent：让 AI 直接“住进“你的网页，用自然语言操控一切！

Ne0inhk

24 Mar 2026 — 6 min read

阿里开源 PageAgent：让 AI 直接"住进"你的网页，用自然语言操控一切

不需要浏览器插件，不需要 Python，不需要截图——一行 JS，让你的网页秒变 AI 智能体。

一、先说痛点：Web 自动化为什么这么难？

如果你用过 Selenium、Playwright，或者最近流行的 browser-use，你一定遇到过这些头疼的问题：

环境太重：得装 Python、headless 浏览器、各种依赖，部署复杂，维护成本高；
依赖截图 + OCR：很多方案靠多模态模型"看图操作"，慢、贵、还不准；
权限门槛高：要控制浏览器，往往需要特殊权限甚至操作系统级别的访问；
对现有产品改造成本大：想给自己的 SaaS 产品加个 AI Copilot？对不起，可能要重写后端。

这些问题的根源在于：传统 Web 自动化思路是"从外面控制浏览器"，就像隔着玻璃操作键盘，自然别扭。

阿里巴巴开源的 PageAgent，换了一个思路：让 AI Agent 直接住进网页里面。

二、PageAgent 是什么？

PageAgent（GitHub: alibaba/page-agent）是一个纯前端的 JavaScript GUI 智能体框架。

它的核心理念用一句话概括：

The GUI Agent Living in Your Webpage（住在你网页里的 GUI 智能体）

它能做什么？

用自然语言控制网页界面。你告诉它"点击登录按钮"、“把表单里的公司名改成阿里巴巴”、“帮我找到最近的订单并导出”，它就真的去做。

它有多轻量？

✅ 纯 JavaScript，直接嵌入页面
✅ 不需要浏览器扩展（有可选插件用于多 Tab 场景）
✅ 不需要 Python / headless 浏览器
✅ 不需要截图，不需要 OCR，不需要多模态大模型
✅ 不需要特殊权限

它通过直接读取和操作页面 DOM 来理解和控制界面，把清理后的 DOM 结构发给 LLM，由 LLM 决策操作步骤，再由 PageAgent 执行。整个过程全在浏览器里完成。

典型应用场景：

SaaS AI Copilot：几行代码给你的产品加上 AI 副驾，不用改后端
智能表单填写：把原本要点 20 下的操作，变成一句话
无障碍访问：让任何 Web 应用都能通过自然语言、语音操控

ERP / CRM 系统提效：这类系统交互复杂，PageAgent 特别适合

三、架构设计：它是怎么工作的？

PageAgent 是一个组织清晰的 monorepo，核心模块分工明确：

packages/ ├── core/ # 核心 Agent 逻辑（无 UI） ├── page-agent/ # 带内置 UI 面板的主入口 ├── page-controller/# DOM 操作层（独立于 LLM） ├── ui/ # 面板 UI（与 Agent 解耦） ├── llms/ # LLM 客户端适配层 └── extension/ # Chrome 扩展（多 Tab 支持，WIP）

工作流程大致如下：

用户输入自然语言指令（如"帮我搜索最新订单"）
PageAgent 清理当前页面 DOM，提取语义化结构
将简化的 DOM + 指令发送给 LLM（支持 Qwen、OpenAI 等）
LLM 返回操作步骤（点击哪个元素、输入什么内容）
page-controller 执行具体 DOM 操作
循环直到任务完成

关键亮点：不依赖截图

绝大多数竞品（包括 browser-use 的原始方案）要截图发给视觉模型识别。PageAgent 直接用 DOM 结构，这意味着：

速度更快（无需图像处理）
成本更低（无需多模态模型）
准确性更高（结构化信息比图像识别可靠）

四、怎么用？三种接入方式

方式一：最快体验——Demo LLM

打开官网 alibaba.github.io/page-agent，使用项目提供的免费 Demo API（仅供技术评估，有频率限制），直接在页面上输入指令体验。

方式二：编程接入（BYOK，自带密钥）

npminstall page-agent

import{ PageAgent }from'page-agent'const agent =newPageAgent({model:'qwen3.5-plus',baseURL:'https://dashscope.aliyuncs.com/compatible-mode/v1',apiKey:'YOUR_API_KEY',language:'zh-CN',})// 用自然语言执行操作await agent.execute('点击登录按钮')await agent.execute('把用户名填写为 admin')await agent.execute('找到最近7天的订单，导出为 Excel')

支持任何兼容 OpenAI 接口的 LLM 服务，包括阿里云百炼（Qwen）、OpenAI、Anthropic 等。

方式三：多 Tab 场景——Chrome 扩展

对于需要跨多个标签页操作的复杂任务，可以安装配套的 Chrome 扩展（目前仍在开发中，标注为 WIP）。配置好 API Key 后，Agent 的操作范围可以从单页面扩展到整个浏览器。

隐私与安全

PageAgent 采用 BYOK（Bring Your Own Key） 架构：

数据只在你的浏览器和你配置的 LLM 服务商之间流动
项目本身没有任何后端，不收集用户数据
API Key 仅存储在浏览器本地（localStorage）
所有配置不会同步到外部服务器

五、与其他方案对比

特性	PageAgent	browser-use	Playwright/Selenium
运行环境	纯浏览器 JS	Python + 浏览器	Python/Node + 无头浏览器
是否需要截图	❌ 不需要	✅ 需要	❌ 不需要
多模态模型	❌ 不需要	✅ 需要	❌ 不需要
嵌入现有产品	✅ 极易	❌ 困难	❌ 困难
适合场景	前端增强/Copilot	服务端自动化	测试/服务端自动化

值得一提的是，PageAgent 在 README 中坦诚地致谢了 browser-use 项目——DOM 处理组件和部分 Prompt 设计借鉴自该项目，并遵循 MIT 协议开源。开放的态度让人好感度倍增。

六、总结：它适合谁？

PageAgent 是一个思路清晰、定位精准的开源项目，核心价值在于"轻量嵌入"。

适合这些人用：

🎯 想给自家 SaaS / 后台系统快速加上 AI Copilot 的前端开发者
🎯 做 RPA 或自动化工具的工程师，想降低环境依赖
🎯 希望让老旧内部系统（ERP/CRM）支持自然语言交互的团队
🎯 对 Web Agent 技术感兴趣、想研究客户端 Agent 方案的研究者

需要注意的是：

目前 Chrome 扩展仍在开发中（WIP）
跨域、登录态等复杂场景可能需要额外处理
Demo API 仅供评估，生产使用需自备 LLM API Key

AI 与 Web 的结合，正在从"服务端控制浏览器"向"Agent 住进页面"演进。PageAgent 是这个方向上一个值得关注的实践。

GitHub 地址：https://github.com/alibaba/page-agent
官网文档：https://alibaba.github.io/page-agent/

如果觉得有帮助，欢迎点个在看 👇

当 AI 嚼碎数据吐模块，人类开发者的创意还能留几行？—— 老码农的反编译式安心剂

前言：哈喽，大家好，今天给大家分享一篇文章！并提供具体代码帮助大家深入理解，彻底掌握！创作不易，如果能帮助到大家或者给大家一些灵感和启发，欢迎收藏+关注哦 💕 目录 * 当 AI 嚼碎数据吐模块，人类开发者的创意还能留几行？—— 老码农的反编译式安心剂 * 📚 一、那些被 AI 吓得半夜查招聘网站的日子 * 📚 二、AI 生成功能模块的底层逻辑：它不是创意家，是数据缝合怪 * 📘 2.1 AI 生成功能的三板斧：统计、模仿与排列组合 * 📘 2.2 人类创意 vs AI 生成：核心差异在哪？ * 📘 2.3 代码演示：AI 能生成 "正确" 的代码，但生成不了 "贴心&

OpenClaw视觉操作实战：不写接口，让AI直接点按钮、操作软件

文章目录 * 前言 * 一、OpenClaw是啥？你的数字长工 * 二、视觉操作的核心：Snapshot快照系统 * 1. 告别元素定位地狱 * 2. 自适应界面变化 * 3. 跨应用操作 * 三、实战：手把手教你让AI自动填表 * 步骤1：安装与环境准备 * 步骤2：启动视觉模式 * 步骤3：编写自动化脚本 * 步骤4：进阶：自动下载报表 * 四、不止浏览器：桌面软件也能点 * 五、定时任务：让AI自己起床干活 * 六、数据安全：你的隐私留在本地 * 七、避坑指南：新手常踩的雷 * 1. 动态加载的坑 * 2. 弹窗处理 * 3. API额度控制 * 4. 元素编号会变 * 八、总结：从“码农”

人工智能：自然语言处理在医疗领域的应用与实战

人工智能：自然语言处理在医疗领域的应用与实战学习目标 💡 理解自然语言处理（NLP）在医疗领域的应用场景和重要性 💡 掌握医疗领域NLP应用的核心技术（如电子病历分析、医学文本分类、智能问答） 💡 学会使用前沿模型（如BERT、GPT-3）进行医疗文本分析 💡 理解医疗领域的特殊挑战（如数据隐私、多语言处理、专业术语） 💡 通过实战项目，开发一个电子病历分析应用重点内容 * 医疗领域NLP应用的主要场景 * 核心技术（电子病历分析、医学文本分类、智能问答） * 前沿模型（BERT、GPT-3）在医疗领域的使用 * 医疗领域的特殊挑战 * 实战项目：电子病历分析应用开发一、医疗领域NLP应用的主要场景 1.1 电子病历分析 1.1.1 电子病历分析的基本概念电子病历分析是对电子病历中的文本内容进行分析和处理的过程。在医疗领域，电子病历分析的主要应用场景包括： * 病历摘要：自动生成病历摘要（如“患者基本信息”、“病情描述”

告别重复劳动：用AI数据标注工具提速3倍的实战经验

👋 大家好，欢迎来到我的技术博客！ 📚 在这里，我会分享学习笔记、实战经验与技术思考，力求用简单的方式讲清楚复杂的问题。 🎯 本文将围绕AI这个话题展开，希望能为你带来一些启发或实用的参考。 🌱 无论你是刚入门的新手，还是正在进阶的开发者，希望你都能有所收获！文章目录 * 告别重复劳动：用AI数据标注工具提速3倍的实战经验 * 为什么数据标注是“效率黑洞”？ * AI标注工具的核心优势：不只是快，更是智能 * 实战经验：从0到1的AI标注落地 * 项目背景：一个真实的数据标注挑战 * 工具集成：代码示例详解 * 步骤1：安装依赖库 * 步骤2：加载预训练模型（使用PyTorch） * 步骤3：集成到Label Studio工作流 * 步骤4：人工审核界面优化 * 速度与质量实测数据 * 流程优化：用Mermaid重构标注工作流 * 避坑指南：实战中的常见陷阱 * 陷阱1：AI模型不匹配业务场景 * 陷阱2：数据格式不兼容