← All posts

AI 控制浏览器

AI 控制浏览器,分三层看

我最近研究了"AI 控制浏览器"这件事。拆开一看,它至少有三层,市面上相关工具都能套进这个框架。

第一层:浏览器本身。 真正去加载网页、执行 JS 的是浏览器。这一层能做很"物理"的事:改 UA、模拟鼠标轨迹、过验证码——也就是反爬。

第二层:协议层。 外部程序要遥控浏览器,得走协议。最成熟的是 Chrome 的 CDP(Chrome DevTools Protocol),生态最全,本文默认都用它。注意 CDP 是 Chrome 系专属:Firefox 不支持,它用的是另一套叫 WebDriver BiDi 的协议 (Firefox 的实验性 CDP 支持已经在 2025 年彻底移除)。

第三层:怎么让 AI 用上 CDP。 CDP 是底层接口,AI 不能直接跟原始 JSON 打交道,于是这层有几种方案:

  • 让 AI 直接用 Playwright 这类自动化库。它把"找到按钮、点一下"翻译成 CDP 消息,省心,但有个问题,见下文。
  • Agent Browser(Vercel Labs 出的)专门解决那个问题。AI 控制浏览器最烧 token 的地方,是把页面状态喂给大模型:一个普通页面 HTML 几十万字符,喂一次几万 token。它取巧在两点:第一,喂给 AI 的不是 DOM,而是无障碍树——浏览 器本来就要给读屏软件生成的结构,已经把页面提炼成"按钮""输入框"这类语义元素,等于白捡的降维;第二,快照时给每个元素编短号 @e1、@e2,AI 全程只发 click @e1 这种命令,编号对应哪个真实元素由后台守护进程记着,AI 不必每次 重传整棵树。效果:同样 10 步流程,它约 7k token,Playwright MCP 这类方案要 100k+。

原理归原理,真在自己开发机上用,全是琐碎问题。 最典型一个:AI 开新标签页,标签页直接弹到最顶,把你正在看的页面顶掉。

Ego Lite 就是把这类细节聚合起来的工具:它只做第二层和第三层的事,不做第一层——不做反爬;而且默认就把 Skill 装好了,拿到手就能用。