前言
现在的 AI Agent(Claude Code、Cursor、Gemini CLI、Codex CLI 等)自带的联网能力(WebSearch / WebFetch)大多只能"搜"和"取文本",遇到登录态页面、动态渲染、需要点击交互的场景就无能为力了。
今天给大家介绍一个开源 Agent Skill:web-access。它给 AI Agent 补上了联网策略 + CDP 浏览器操作 + 站点经验积累三块能力,让 Agent 真正像人一样"用浏览器上网"。本文基于其官方设计详解与 GitHub 项目整理而成。
一、web-access 是什么
web-access 是一个兼容所有支持 SKILL.md 的 Agent 的通用 Skill。它解决的核心问题是:
AI Agent 原本的联网能力缺少"调度策略"和"浏览器自动化能力"。这个 Skill 补上的是:联网策略 + CDP 浏览器操作 + 站点经验积累。
它兼容 Claude Code、Cursor、Gemini CLI、Codex CLI 等主流 Agent 框架,开箱即用。
二、核心能力(v2.5.4)
| 能力 | 说明 |
|---|---|
| 联网工具自动选择 | WebSearch / WebFetch / curl / Jina / CDP,按场景自主判断,可任意组合 |
| CDP Proxy 浏览器操作 | 直连你日常用的浏览器(Chrome / Edge / Chromium 系),天然携带登录态,支持动态页面、交互操作、视频截帧 |
| 三种点击方式 | /click(JS click)、/clickAt(CDP 真实鼠标事件)、/setFiles(文件上传) |
| 本地书签/历史检索 | find-url.mjs 跨 Chrome / Edge 查询公网搜不到的内部系统或你访问过的页面 |
| 并行分治 | 多目标时分发子 Agent 并行执行,共享一个 Proxy,tab 级隔离 |
| 站点经验积累 | 按域名存储操作经验(URL 模式、平台特征、已知陷阱),跨 session 复用 |
三、安装方式
四、它的设计哲学(重点)
作者把 Skill 的本质总结为一句话,非常值得做 Agent 工程的同学记下来:
Skill = Agent 策略哲学 + 最小完备工具集 + 必要的事实说明
展开来说有三点实践心得:
- 验证惰性知识边界,补充事实说明:模型知道很多知识,但不一定在任务中第一时间被调用。要在 Skill 中针对容易遗忘的边界直接补充事实与方法。
- 有最优路径的事,直接指定:哪怕是再通用的任务,也常存在唯一可直接执行的最优方式,用脚本/文件减少模型试错。
- 强调安全风险边界:CDP 模式直接操纵用户自用浏览器,Agent 可能误关或交叉使用原有标签。不想让它做的高危事,必须明确强调。
另外关于子 Agent 分治:联网任务常涉及多个独立目标(同时查 5 个竞品、调研 50 个网页)。主 Agent 串行处理不仅慢,中间内容还会涌入上下文导致 token 膨胀、推理质量下降。正确做法是写"目标"而不是写"步骤",让子 Agent 自主分治。
五、一个实战玩法
装好 Skill 后,把下面这个任务发给你的 Agent,就能见识到并行浏览器操作的威力:
开 10 个 sub agent,分别调研小红书、微博、B站、Boss直聘、github、知乎、即刻、豆瓣、36kr、虎嗅的首页,每个 sub agent 分别开 10 个 tab,并行调研今天内容、趋势、值得找的工作情况,汇总为更新报告。⚠️ 这个任务非常吃内存,运行前请确保文件均已保存完毕。作者纪录是 Chrome 占用 38.6GB、Claude Code 14GB 然后……卡死了。你的电脑配得上你的 Agent 吗?😏
六、结语
web-access 用通用模型 + Agent 框架,做出了体验丝滑的 Browser Use 效果,而且 MIT 协议开源。如果你也在折腾 AI Agent 的联网与自动化能力,强烈建议试一试。
更新快乐,也欢迎 Star 与分享 😊
评论 (0)