Web-Rooter 概述
这是一个面向 Claude Code、Cursor 等 Vibe Coding 或 AI Agent 工具的本地化联网能力 CLI 集合。它提供深度搜索、分析、爬虫等能力,旨在解决 AI 生成内容缺乏来源、不可追溯的问题。
'Web-Rooter 不是给人长期手敲的爬虫工具,而是给 AI 调用的标准化联网协议层。'
GitHub 项目地址:https://github.com/baojiachen0214/web-rooter
适用场景包括个人研究者快速检索文献并生成带引用的报告、小团队统一 AI 联网执行规范、技术调研对比方案记录来源、合规报告确保结论可追溯以及隐私敏感场景避免数据发送至第三方云服务。
核心机制:IR + Lint
Web-Rooter 借鉴编译器思想设计了 IR + Lint 机制,用于显著降低幻觉率。以 wr do 指令为例,其执行流程为:
Intent → Skill → IR → Lint → Execute
它将自然语言任务'编译'为中间表示(IR),再进行语法和语义检查(Lint),最后才执行。这就像一位严厉的老师不断提醒 AI:'你要先复习技能,再执行任务。'实际测试表明,这套机制能显著提升 AI 调用工具的灵活性与稳定性。虽然目前仍处于早期阶段,但设计思路非常清晰。
架构设计:CLI 是一等接口
从源码分析,Web-Rooter 采用分层架构设计:
┌─────────────────────────────────────────────────┐ │ Interface Layer (接口层) │ │ main.py / tools/ / scripts/ │ │ CLI / MCP / HTTP Server 启动分发 │ ├─────────────────────────────────────────────────┤ │ Orchestration Layer (编排层) │ │ agents/web_agent.py │ │ 任务编排:visit/search/research/crawl │ ├─────────────────────────────────────────────────┤ │ Capability Layer (能力层) │ │ core/crawler.py, browser.py, search/* │ │ HTTP 抓取、浏览器自动化、搜索引擎聚合 │ ├─────────────────────────────────────────────────┤ │ Configuration Layer (配置层) │ │ config.py, core/engine-config/*.json │ │ 全局运行参数、引擎配置 │ ├─────────────────────────────────────────────────┤ │ Validation Layer (验证层) │ │ wr doctor, ir-lint, safe-mode │ │ 环境检查、IR 语法验证、安全模式 │ └─────────────────────────────────────────────────┘
这一设计的精妙之处在于:CLI 是一等接口,MCP 只是适配层。很多 MCP 项目本末倒置,把 MCP 当成主入口,CLI 当成调试工具。Web-Rooter 反其道而行——CLI 是核心,MCP 只是让 Claude/Cursor 能调用 CLI 的适配器。这意味着即使 MCP 协议变了,核心功能不受影响。
此外,配置层支持热扩展,通过环境变量可以动态加载 Cloudflare 挑战配置文件、登录态配置文件及抓取后处理扩展。
工具生态:28 个 MCP 工具
截至最新版本 v0.2.2,该版本暴露了 28 个 MCP 工具,覆盖 AI 联网的全场景。
基础工具
| 工具 | 用途 |
|---|---|
web_fetch | HTTP 网页访问 |
web_fetch_js | 浏览器网页访问(JS 渲染) |
web_search | 在已访问内容中检索 |
parse_html | HTML 解析 |
get_links | 链接提取 |
搜索工具(核心)
| 工具 | 用途 |
|---|---|
web_search_internet | 多引擎互联网搜索 |
web_deep_search | 深度并行搜索(多引擎 + 多查询) |
web_search_combined | 搜索 + 抓取组合 |
web_research | 主题深度研究 |
垂直领域工具(差异化优势)
| 工具 | 用途 |
|---|---|
web_search_academic | 学术搜索(arXiv, Google Scholar 等 10 源) |
web_search_social | 社交媒体搜索(小红书、知乎、微博等) |
web_search_commerce | 电商/本地生活平台搜索 |
web_search_tech | 技术社区搜索 |
web_mindsearch | MindSearch 图研究 |
运维工具(生产级思维)
| 工具 | 用途 |
|---|---|
web_budget_telemetry | 运行时预算遥测快照 |
web_workflow_schema | 声明式 workflow schema |
web_workflow_run | 运行 workflow 任务流 |
web_auth_hint | 指定 URL 的登录态匹配与提示 |
web_context_snapshot | 全局深度抓取上下文快照 |
使用建议上,推荐先通过 web_workflow_schema 了解能力边界,再生成本地模板并按任务修改,最后组合执行。细粒度调试时再用基础搜索或抓取工具。
CLI 命令全集
核心命令
wr help
wr --version
wr doctor
wr do <任务> [--skill=name] [--dry-run] [--strict] [--js] [--top=N]
wr do-plan <任务> [--skill=name] [--strict] [--js] [--top=N]
wr do-submit <任务> [--skill=name] [--strict] [--js] [--top=N]
作业管理
wr jobs [--limit=N] [--status=queued|running|completed|failed]
wr jobs-clean [--keep=N] [--days=N] [--all]
wr job-status <job_id> [--with-result]
wr job-result <job_id>
快速查询
wr quick <查询> [--js] [--top=N]
wr visit <URL> [--js]
wr html <URL> [--js] [--max-chars=N]
搜索与研究
wr web <查询> [--no-crawl] [--crawl-pages=N]
wr deep <查询> [--en] [--crawl=N] [--engine=name]
wr mindsearch <查询> [--turns=N] [--branches=N]
垂直领域
wr social [--platform=xiaohongshu|zhihu|douyin]
wr shopping [--platform=taobao|jd]
wr academic [--papers-only] [--source=xxx]
wr crawl <URL> [pages] [depth]
工作流与扩展
wr workflow-schema
wr workflow-template [path] [--scenario=social_comments]
wr workflow <path> [--var key=value]
wr processors [--load=module:object]
wr auth-hint
运维观测
wr context [--limit=N]
wr telemetry [--no-refresh]
wr pressure [--no-refresh]
wr safe-mode [status|on|off]
wr skills [--resolve "<目标>"]
wr ir-lint <IR/JSON>
部署指南
Web-Rooter 上手比较容易,即使是一台完全空白、没有任何开发环境的电脑也能轻松部署。
方案 A:预编译安装(推荐) 从 Release 页面下载:https://github.com/baojiachen0214/web-rooter/releases/tag/v0.2.2
- Windows:运行
install-web-rooter.bat - macOS/Linux:运行
./install-web-rooter.sh
方案 B:源码安装
# Windows install.bat
# macOS / Linux
bash install.sh
验证安装
wr --version
wr doctor
wr help
重要:安装后默认入口是
wr,不是python main.py。python main.py仅用于源码调试和开发兜底。
系统要求
- Python 3.10+
- 网络访问(用于 Playwright Chromium 运行时下载)
- 推荐:Git
总结
在 AI 生成内容泛滥的当下,'可追溯、可审计'正在成为生产环境的刚需。Web-Rooter 用一套简洁的 wr 命令,给出了一个优雅的答案:
- 不是让 AI'看起来答对',而是让 AI'有执行链路、有引用、可审计'
- 不是堆砌功能,而是按 AI 的实际使用场景分层设计
- 不是玩具项目,而是有超时护栏、作业系统、预算控制的生产级工具
当然,Web-Rooter 也有局限:项目成熟度还在提升中(v0.2.2),社区规模有限。但这些不是致命问题,而是成长中的烦恼。如果你正在寻找一个轻量级的 AI 联网执行工具,并且重视'可追溯、可审计',Web-Rooter 值得尝试。它可能不是最成熟的,但它代表了一种正确的方向——让 AI 的联网行为变得透明、可验证。

