Agent上网查资料,碰到反爬就哑火?一个开源Skill,把浏览器变成AI Agent的专业手臂

你让 Agent 帮你搜集竞品资料。Agent 干劲十足,网页搜了一轮又一轮。
可一到需要登录的网站就卡壳:“我无法访问这个页面,可能需要登录”。
你换个页面试试,Agent 又告诉你“该网站有反爬保护,无法获取内容”。
如果你让 Agent 把知乎、公众号、什么值得买的数据汇总成一份报告,它要么逐个串行慢到你想关电脑,要么中途触发风控直接中断,要么遇到验证码干脆放弃。
你明明给 Agent 装了 WebSearch、装了各种扩展工具。但这些工具遇到登录墙、验证码、Cloudflare 盾、DataDome 检测这些互联网防护机制就集体哑火。网页数据明明就摆在那里,你的 Agent 就是够不到。
有没有一种方法,让 Agent 能像人一样打开网页、登录账号、绕过验证码、在反爬最严格的网站上也能正常干活?
有。就是今天要说的 BrowserAct。
01
这个 Skill 做了什么?
BrowserAct 是一个开源的浏览器自动化 CLI 工具,专为 AI Agent 设计。
它给你的 AI Agent 装上真实浏览器的操控能力:
启动 Chrome 打开网页、点击元素、填写表单、提取内容,同时内置三层「反爬」检测体系(「指纹伪装」+「TLS 轮换」+「验证码自动解决」)、多会话并发隔离、「登录态」复用,让 Agent 像真人一样在任何网站上干活,不管这个网站有没有反爬。
安装之后,直接向 Agent 发指令:
用隐身浏览器搜索“AI Agent 工具”相关内容,分别从小红书、知乎、公众号各提取前20条结果,汇总成一张表格。
Agent 会启动本地 Chrome,用你已经登录的各平台账号,真实地搜索、滚动、提取数据,最后输出一张结构化的表格:

简单说:BrowserAct 把 AI Agent 从“只能读静态 HTML 的读书人”变成了“能动鼠标键盘的实干家”。
你的 Agent 不再被「反爬」墙挡住:不管是 Cloudflare 的五秒盾、电商平台的滑块验证码、还是各种需要「登录态」的会员页面,它都能用你的登录状态、过你的验证码、并发地跑批量任务。
02
安装方法
安装极其简单,不需要你手动下载或配置任何东西。
一句话发给你的 Agent:
Install browser-act. Skill source: https://github.com/browser-act/skills/tree/main/browser-act . Verify it works after installation.
Agent 会自动完成下载、安装和验证。整个过程不超过 1 分钟。
如果你习惯用 CLI 也可以直接:npx skills add browser-act/skills --skill browser-act
03
三步上手:从打开网页到数据提取到固化复用
BrowserAct 的使用逻辑可以拆成三步:先用浏览器打开目标页面,再选择合适的方式提取数据,最后把高频场景固化为可复用的 Skill。
1、让 Agent 操控真实浏览器
BrowserAct 提供两种浏览器模式:
模式一:本地 Chrome 模式
直接复用你 Chrome 浏览器里已有的「登录态」,不需要重新登录任何网站:Agent 打开的就是“你已登录”的页面。微信公众平台、小红书、知乎、各类 SaaS 后台,统统不用再输密码。
模式二:隐身浏览器(Stealth Browser)
内置「指纹伪装」和代理自动切换,大幅降低被目标网站识别为机器人的概率。专门应对有 Cloudflare、DataDome 等专业反爬方案的站点。
用本地 Chrome 打开 用隐身浏览器
推荐日常用本地 Chrome 模式,最省事。遇到反爬严格的网站,加一句“用隐身浏览器”即可。
2、提取受保护页面的数据
BrowserAct 内置了 stealth-extract 服务,专门从有「反爬」保护的页面中直接提取结构化内容,不需要完整渲染整个页面,无论目标页面是简单的博客还是加了多重防护的商业网站,速度都极快。
用 stealth-extract 提取这个页面的正文内容,去掉导航栏、广告和页脚。
Agent 会自动调用该服务,返回干净的 Markdown 格式正文。相比传统方案(下载整个 HTML 再解析),token 消耗降低约 95%。
遇到滑块验证码也不用慌。BrowserAct 的 solve-captcha 云端服务会自动处理。
如果遇到复杂的人机验证(如图片选择、2FA 短信验证),它会生成一个链接推送到你的会话中,你点击处理完后 Agent 自动继续干活:人在公司也好、在通勤路上也好,不影响任务推进。
3、把抓取流程固化为可复用的 Skill
这是 BrowserAct 最独特的能力:【browser-act-skill-forge】。
它会观察你一次完整的数据抓取流程,自动生成一个包含代码和操作步骤的本地 Skill。下次同样的任务,一句话就能跑。
用 browser-act-skill-forge 分析这个网站的数据结构,为我创建一个自动抓取商品价格的 Skill。
Agent 的工作流程:探索网站结构、验证数据提取路径、完整跑一遍流程、生成带 Python 代码的 Skill 文件。
一次探索,永久复用。
这也是 BrowserAct 与 Playwright 等通用浏览器工具最大的差异:它的目标不是“每次帮你操作”,而是“把经验固化为技能”。
04
四个实战案例,直接复制使用
1、抓取受保护平台的搜索结果
用隐身浏览器打开小红书探索页,搜索“NAS 推荐”,提取前20篇笔记的标题、作者昵称、点赞数、收藏数,整理成表格发给我。
很多内容平台都有严格的「反爬」机制,但 BrowserAct 的隐身浏览器配合本地「登录态」,可以稳定抓取。返回的直接是结构化数据,无需二次处理。
同样适用于任何需要登录后才能搜索的平台:知乎话题页、会员制网站的内容区、各类知识付费平台等等。
底层逻辑相同:BrowserAct 用你的真实「登录态」+「隐身指纹」绕过反爬校验。
2、跨平台并发数据汇总
同时从 知乎、什么值得买、微信公众号 三个平台搜索“AI编程工具”,各取前10条结果,汇总为一份对比报告。
BrowserAct 支持多会话并发:每个平台独立开一个浏览器实例,会话、Cookie、指纹完全隔离。
知乎用「登录态」、什么值得买用 stealth-extract 直提、公众号先搜索再抓正文:各走各的路,互不干扰。
它还能智能判断不同平台的“软肋”:哪种采集方式最快最稳,就用哪种。
3、需要登录的后台数据批量导出
打开这个 SaaS 后台的报表页面,按月份依次点击导出按钮,把所有月度报表下载下来。
这是传统爬虫工具很难搞定的场景:必须先登录、再保持会话、逐页操作。
BrowserAct 直接复用你浏览器的「登录态」,Agent 像人一样逐项点击操作。
BrowserAct 提供了 50+ 标准化指令:click、input、scroll、wait 等,覆盖了几乎所有常见的页面交互。
涉及提交、删除等不可逆操作时,BrowserAct 会自动弹出确认门禁,需要你明确批准才会执行。
4、创建专属价格监控 Skill
用 browser-act-skill-forge 分析什么值得买的 NAS 商品列表页,创建一个每周自动抓取价格数据的 Skill,输出结果存为表格。
【browser-act-skill-forge】 会完整跑一次采集流程,然后输出一个包含操作步骤、Python 代码、容错逻辑的本地 Skill。
下次你只需要说“跑 NAS 价格监控”,Agent 12 秒内就能完成多款产品的价格抓取和对比。
有高频数据需求的人,这个功能是真正的效率杠杆。
调研竞品动态、跟踪行业报告更新、监控招标信息发布……
但凡你每周手动查一次的信息,都值得花 5 分钟固化为一个 Skill,让它从此自动跑。
05
小结
BrowserAct 解决的,不是 Agent “能不能打开网页”这种浅层问题。
它解决的是 Agent 在真实互联网环境里持续干活时,会遇到的那几个致命痛点:打不开、进不去、看不懂、「登录态」不能复用、不能并发、遇到风控、遇到验证。
它把浏览器的所有操控能力整合到了一起:指纹伪装、验证码自动解决、并发会话隔离、登录态复用、抓取流程 Skill 化,让 Agent 的浏览器操作真正进入了执行层。
从今天起,不要让你的 Agent 在「反爬」墙外干等。给它装一双真正的手,让它替你触碰整个互联网。