前言
现在谈论 AI Agent 的能力边界时,大多数人都会关注模型自身的推理能力以及上下文的长度。
但有一个经常被忽略的点:Agent 在真实的网络环境中的执行能力。
目前我们所使用的 Agent 工具,在浏览网页时仍然存在一些门槛,比如说当面对需要登录、验证码或动态渲染页面时,往往都无力解决。

所以,今天给大家介绍一款专门针对浏览器自动化的 CLI 工具。在 GitHub 上非常火,超 2.8k Star 
BrowserAct
大部分 Agent 是利用模型的视觉能力,而 BrowserAct 则是直接通过命令行来执行。
从环境伪装、执行策略和人工协作这三个层面,来解决 Agent 执行浏览器相关任务时的成功率问题。

三层递进的执行策略
我们先来看看 BrowserAct 的设计思路,前文提到,它整体分为环境层、执行层和人工层三个层次。当执行一个需要操作浏览器的任务时,会依次经过这三层。

一、环境层
这一层相当于是给 Agent 换了身衣服,让它看起来更像真人。
BrowserAct 通过浏览器指纹伪装和动态网络身份,让 Agent 的浏览环境看起来和真人用户几乎是一致的。
另外每个账号还可以绑定独立的登录空间和网络路径,就算多个账号同时跑也不会互相干扰。
它能帮你做的是:
1、同一个账号长期登录不会因为"自动化特征"被平台封号。2、同时运营多个店铺、社媒账号或地区站点,每个账号有独立干净的环境,不会因为串号被关联。3、Cookie、登录状态长期保持稳定,不用反复扫码或重新登录。
二、执行层
这一层解决的是遇到验证码或者遇到反机器人检测,被阻隔在页面外时该怎么办的问题。
BrowserAct 可以自动处理这些常见的反机器人检测,降低被识别为自动化行为的概率。
它能帮你做的是:
1、登录需要人机验证的网站时,Agent 可以自动通过验证,不需要你手动点"我不是机器人"2、抓取需要登录态才能看到的数据(比如后台数据、会员内容),Agent 能自动跨越验证屏障3、遇到比较复杂的页面检测时,Agent 会自主尝试突破,而不是直接放弃任务
三、人工层这一层解决的是 AI 实在搞不定时,接下来该怎么办的问题。答案也很显然,人工介入。当然需要人工介入并不是 BrowserAct 的能力不行,而是有些情况只有人类可以做到。例如短信验证码、扫码验证或者涉及敏感操作需要二次授权等等。但 BrowserAct 不同的是,它会生成一个远程协作链接,在任何设备中打开这个链接完成验证后,Agent 会从刚才终端的地方继续往下进行,而不是从头再开始,陷入无限循环。它能帮你做的是:1、AI 遇到短信验证码时,不会终止整个任务,你把验证码输进去,它还能接着干2、处理企业后台需要 SSO 登录或敏感审批的场景,你帮它过一道,后面全自动3、复杂长流程任务里,AI 和人工交替配合,你不需要重新执行已经做完的部分
所以总结一下,这三层的设计可以理解为,BrowserAct 先将 Agent 行为伪装成真人,如果没有被识破,就进入网页获取数据,如果被识破了,就进入下一层。下一层的执行层来解决被识破后网站设立的“栏杆”,如果“栏杆”实在是拆不掉,就呼叫真人进场帮助解决。这三层设计,就能让 Agent 更稳定地完成浏览器操作。 额外功能设计 除了这三层设计,BrowserAct 还有一些额外的能力,这里简单总结一下它额外的功能:1、多任务并发:支持在同一个浏览器环境下同步执行多个任务,各个窗口共享 Cookie 及登录状态2、多账号隔离:每个账号都运行在独立的 Stealth 浏览器中,账号之间互不影响。3、三种浏览器模式:chrome 模式复用本地登录态,适合需要登录的场景;stealth 隐私模式可以每次会话使用新的指纹+代理,配合动态代理,适合需要大批量抓取数据的爬虫场景,可以做到自动轮换IP,没有残留。Stealth 固定身份模式可以在隐私模式基础上,提供稳定的指纹+IP,配合静态代理,适合需要多个账号独立、稳定运行的场景,可以确保账号环境不变,不被系统判定为机器人。
4、技能沉淀:这是一个独立的Skill,需要单独安装。它可以将跑通的流程沉淀为可复用的 Skill,后续再次跑相同流程时直接运行这个Skill就可以了。 使用场景 ① 电商数据监测618 过去,各位电商人肯定还在忙得不可开交。都在忙着收集数据,监测同行数据也是任务的一环。因为电商平台都有严格的反制机制,正常 Agent 的浏览器控制是无法进入获取数据的,我们尝试让 BrowserAct 来跑一下这个任务。
由于我的电脑没登录过,所以 BrowserAct 找不到登录态,触发了人机接力。
可以看到它人机接力的方式是给我们发送一条链接,这条链接是 BrowserAct 的云实例,相当于一个云端虚拟机,所以这条链接在任何设备中打开都可以。打开后会进入云实例的登录页面,这里我们直接扫码登录就可以了,登录完成后就可以直接把页面关掉。
此时 BrowserAct 就获取到了登录状态,继续开始接下里的任务。在 Agent 中可以看到 BrowserAct 的操作汇报,每一步都在告诉你具体做了什么事情。
如果搜索词输入错了,它还会自己检查并进行纠正。
然后会自己按照销量去进行商品排序。
最终成功获取了销量前10的溜溜梅价格。
整个过程除了因为没有登录态,需要进行人机接力之外,其余 反制机制都被 BrowserAct 自行解决了。如果这类任务你每天要重复好几次,那可以使用上文提到的技能沉淀能力,将这个流程沉淀为一个Skill,后续直接运行这个 Skill,任务不管跑多少次,都会是我们预期的效果,也节省了 Agent 重复探索所消耗的 Token 和时间。
使用也很简单,直接让 Agent 安装 BrowserAct Forge 这个技能:
在 Agent 输入:
安装这个技能,链接:https://github.com/browser-act/skills/tree/main/browser-act-skill-forge,并验证技能是否可用。
② 多店铺管理许多电商商家可能会同时开多家店铺,管理时需要频繁切换账号,很麻烦。使用BrowserAct可以创建多个隐私浏览器,账号相互隔离在自己的专属浏览器中,互相不会干扰。我这里直接问应该如何操作,它给了我两个方案:
我选择方案二,然后它问了我几个问题:
接着需要购买一个静态代理,这个代理的意思就是给你的浏览器分配一个不会变的IP地址,让你的账号处在一个稳定的环境中,这样才不会触发平台风控,降低封号风险。
如果是需要长期使用的商业用途,可以买一个用着,如果只是用一次的话,也可以不绑定静态代理,用本地自己已有的地址就可以。
接着它会把静态代理的购买链接发给我们,去购买就行。当然也不一定要购买BrowserAct的静态代理,在其他地方购买后也是一样能用的把ID告诉Agent就行。确认后,一个额外的隐私浏览器就创建好了,在使用Agent管理多个店铺账号时,也不用频繁切换登录了。③ 自媒体分发许多自媒体会将稿件分发到多个平台,提高自己的影响力,但是同一个稿件需要重复在多个平台发多次,有点麻烦。我们尝试用BrowserAct来跑一下这个任务。
我的浏览器已经登录过小红书和知乎,所以我让 BrowserAct 用 Chrome 模式来跑这个任务,可以自动获取我的登录态。
它也是成功进入了我的小红书主页,没有需要人机接力让我重复登录,也没有触发反制机制,直接开始发贴流程。
之后就是比较长的发帖流程,找发送按钮,编辑标题,编辑正文等等。
最后成功发了出来,但让我比较意外的是,它还做了一个封面图,然后内容也不是以文字形式发送的,而是做了一张图。
顺便还收获了一个收藏。
知乎也顺利发送完成。
傻瓜式安装
BrowserAct 的技能开源免费,基本大部分功能都能免费使用。
只有在需要使用代理时,例如上文创建绑定了静态代理的隐私浏览器,才会产生付费。

安装起来非常简单,打开 BrowserAct 官网,点击中间的白色按钮 👇

将复制的提示词发送给你所使用的Agent,就会自动安装。之后在执行浏览器操作的任务时,就会使用技能来完成了。
当然,也可以直接告诉你的 Agent:
在 Agent 输入:
安装browser-act这个技能,链接:https://github.com/browser-act/skills/tree/main/browser-act,安装完成后验证一下它是否可用。
写在最后
在这些具体的使用场景中,所遇到的问题并不是单纯的模型够强就能解决的。
我很庆幸有无数的开发者,做出了类似 BrowserAct 这种可以解决具体场景问题的技能,让 Agent 可以在实际工作中完成任务。
不过 BrowserAct 也不是万能的,验证码、短信确认、企业审批这类环节,依然需要人类介入,简而言之自动优先、人工兜底、无缝续接。
对于正在尝试将 Agent 引入生产环境的团队来说,这种务实的设计思路,可能比全自动化的噱头更有长期价值。
BrowserAct 官网:
https://www.browseract.ai/ML
Github:
https://github.com/browser-act/skills