摘要:8月11日,腾讯正式开源BrowserSkill,一款专为AI Agent设计的浏览器自动化工具。通过本地bsk CLI与浏览器扩展,AI可在独立Agent Window中操作已登录的真实浏览器,不打断用户当前工作。支持Cursor、Claude Code、Codex等任意能调用Shell的Agent,内置human-in-loop机制处理验证码等人工步骤。
让AI替你操作浏览器,过去一直是个尴尬的事情。现有的浏览器自动化方案要么需要你在一个无头浏览器里从头登录所有账号,要么干脆接管你正在使用的整个浏览器窗口——你正看到一半的页面被AI粗暴覆盖。腾讯最近开源的BrowserSkill,走了一条不太一样的技术路线。
本地桥接,而不是云端隔离
BrowserSkill的设计思路和那些基于云端无头浏览器的方案完全不同。它由两部分构成:一个本地的bsk命令行工具,和一个浏览器扩展。两者都在你的本地机器上运行,数据全程不出本机。AI智能体通过bsk CLI下发指令,扩展在独立的Agent Window里执行操作。
和传统Browser Use方案的区别在于:它不是一个插在大模型上的插件,而是一层专门为各类AI Agent设计的本地桥接层。不挑模型,不挑框架。任何能调用Shell的AI Agent——Cursor、Claude Code、Codex、OpenClaw、CodeBuddy、WorkBuddy、Pi、Hermes Agent——都能通过bsk CLI接入。
复用真实登录态,不需要单独测试账号
这是BrowserSkill在工程上最有意思的设计。AI操作网页时最难处理的问题之一就是登录态。传统方案要么让用户重新输一遍账号密码,要么在无头浏览器里从头配置一套测试环境。BrowserSkill的解法很直接:复用你当前浏览器里已经登录的所有网站。你登录过的站点,Agent可以直接操作,不需要额外测试账号。
这个设计背后有一个工程判断:真实用户的浏览器里已经积累了大量的登录态——邮件、社交媒体、后台系统、SaaS工具——让AI从头配置一遍是不现实的。复用现有登录态,是把AI接入真实工作流的必要前提。
独立Agent Window,不打断你的工作
BrowserSkill在浏览器里开了一个独立的Agent Window。AI的所有操作都发生在这个隔离窗口里,你正在看的页面、正在填的表单、正在写的邮件完全不受影响。
需要说明的是:Agent Window目前只支持Chrome和Edge,其他基于Chromium的浏览器通常也能用,Firefox的支持还在计划中。
显式借用机制:AI不能随便碰你的标签页
BrowserSkill有一个显式借用机制,可以看作是给浏览器操作加了把锁。如果AI需要操作你当前已经打开的某个标签页,它必须显式借用(bsk tab borrow)。任务完成后必须归还(bsk tab return),不能无限期占用。这个设计确保了AI不会在你不知情的情况下操作你正在使用的页面。
任务生命周期也有强制规范:必须bsk session start开启会话,所有操作带上--session <id>,结束后必须bsk session stop。会话空闲5分钟会自动超时。每个任务都应该是“有界目标”——不是无休止的浏览,而是完成一个具体可验证的动作后立即停止。
Human-in-the-loop:遇到验证码,AI会主动找你帮忙
AI操作网页一定会遇到人类才能处理的事情——验证码、登录确认弹窗、支付确认。BrowserSkill内置了人工介入机制:遇到这种情况,Agent会主动请求你接管。你处理完之后,AI继续往下走。这个设计把AI能自动化的事情和必须由人决策的事情做了清晰的切分。
实际跑起来是什么体验?
在WorkBuddy平台的实测中,开发者让AI在知乎上搜索热门科技话题并归纳核心观点,以及在社交平台上抓取高赞评论并生成群组情绪画像——整个过程在几分钟内闭环完成。因为底层采用了CLI独立驱动加扩展中介的架构,模型不需要直接识别繁琐的网页DOM元素,执行速度和稳定性都有保障。
浏览器自动化工具的开源方案并不少,但大部分是为人类操作设计的——帮你自动化一些重复操作。BrowserSkill的定位不同:它是为AI Agent设计的。让AI智能体拥有独立操作浏览器的能力,同时不打断人类用户自己的操作——这个方向,目前开源的方案里确实不多。



