
浏览器自动化正在分裂成 5 条路线。ego-lite 代表其中最少人讲清楚的那条——「共享浏览器」:它不是更好的 Playwright,而是让 AI agent 像一个同事,坐在你旁边、用你已登录的浏览器干活,互不打扰。
这个定位之所以重要,是因为它同时绕开了另外两条主流路线的死结:库派(Browser-Use、Vercel agent-browser)登录态老断、token 烧得心疼;AI 浏览器派(ChatGPT Atlas、Perplexity Comet)把你锁死在它自带的 agent 里。ego-lite 的答案是——浏览器归你,agent 随你换。
一句话:ego-lite 把浏览器从「被程序操控的对象」变成了「人和 agent 共用的工作空间」。
ego-lite 团队自己说了一句很准的话:「网页还是现实世界里最普遍的接口。」
不管你的 agent 多聪明,最后总有一半任务要落到浏览器:调研资料、操作 SaaS 后台、读登录后的页面、填表、抓没有 API 的网站。而现有方案在这个「最后一公里」几乎全军覆没,四个痛点反复出现:
这四条不是孤立的 bug,是同一个根因的不同症状——传统方案把浏览器当成「被远程操控的木偶」,而不是「一个可以共享的工作环境」。ego-lite 的全部设计,都是在反过来回答这四条。
讲清楚 ego-lite 最好的办法,是把它放回整张地图里。我把当代「让程序/agent 操作网页」的方案归成 5 条路线:

ego-lite 的位置很妙——它是 ② 和 ③ 之间的第三条路:像 ③ 那样自带一个为 agent 改造的浏览器,又像 ② 那样允许你接入任何 agent(Claude Code、Codex、Cursor……)。
判断:「自带浏览器」和「可换 agent」以前是互斥的——自带浏览器的产品锁死 agent,可换 agent 的库没有自己的浏览器。ego-lite 的核心赌注,就是这两者可以兼得。
很多评测只告诉你 ego-lite「快 2.5 倍」,但不讲为什么。这个「为什么」才是它真正值钱的地方。
关键在一个架构选择:代码优先(code-first),而不是逐条命令循环。
传统 agent-browser 库的工作方式是「逐步命令循环」——agent 调一条命令、看一眼结果、再调下一条。每一步都是一次模型↔浏览器往返,token 和时间都烧在这里。
ego-lite 反过来:它把浏览器能力(snapshot / fill / click / wait / navigate / capture)暴露成页面内的 JavaScript 函数,让 agent 把整个多步任务写成一段 JS,在页面上下文里一次执行完。
// 传统库:snapshot → 看 → click → 看 → fill → 看 → submit(4+ 次往返)
// ego-lite:一段 JS 里 snapshot→click→fill→submit 一次跑完(1 次往返)
第二个关键点是内核级语义 Snapshot。ego-lite 不是在原版 Chrome 上套一层 JS 适配,而是在定制的 Chromium 内核里直接做 Snapshot——把数万行 HTML 压缩成 agent 能读懂的语义结构,连深层嵌套的 iframe、Shadow DOM、Stripe/Salesforce 这类第三方组件都能稳定「看见」。这恰恰是 Playwright 用 CSS 选择器抓取时的常崩点。
反面案例:这套架构优势是「复杂任务越难差距越大」——但所有具体倍数(2.5 倍 / 3.45 倍)都是厂商自测,方法论未公开。官方 benchmark 是对 Vercel agent-browser 的 4 个任务,官网营销口径又写了 3.45 倍——两个数字都对标同一家却不一样,这本身就说明它们该打折看。
这才是和「你」最相关的一节。
ego-lite 的配套 skill 叫 ego-browser——你装了它,Claude Code 就能驱动 ego-lite。而 skill 真正的威力不在「能跑」,在于复用降本:
有人实测同一个生图任务,首次摸索花 1.04 美元,把流程固化成 skill 后只要 0.27 美元——约 4 倍 token 节省(Claude Opus 4.8)。
再进一步:如果是完全确定性的流程(比如「抓某电商前 100 条评论存 CSV」),根本不用 agent——固化成 Shell 脚本,零 token,效果一样。
官方正在把这个手动过程产品化,叫 Site Skills(体验积累系统):每次成功交互自动提炼成可复用工具,号称重复任务最多 5 倍加速。注意——这还是「即将上线」的承诺,不是现状,和你手动固化 skill 的 4 倍降本不是一回事。
这背后的通用规律:skill 复用是 agent 降本的最强杠杆。ego-lite 只是把这条规律在浏览器场景里做到了极致。它和你知识库里 agent-skill 讲的是同一件事——把「一次摸索」变成「反复调用」。
我自己刚好有一份一手印证。前两天我用 ego-browser 给 lovart.ai(一个 AI 生图产品)搭了一个生图 skill:第一次摸索花了大半个下午——弹层拦截要先清障、画布页视口异常只能改走纯 DOM 流、下载还得在页内 fetch 转 base64 落盘,来回试错了几十轮。把这些坑全部固化进 skill 之后,第二次给公众号文章生成封面底图,一条指令直接跑通。我没有精确计量 token,但「首次昂贵摸索、之后廉价复用」的曲线,和上面从 1.04 美元降到 0.27 美元的第三方实测是同一条。
评测不该替产品背书。把 8 个来源交叉对完账,有四条厂商不会主动告诉你的事,各用一句话说清:
• 「内存/进程开销降低几十倍」——单源口述(UP 主转述厂商演示),其余来源零佐证,听个响就行,别当真;
• 2.5 倍与 3.45 倍口径打架——README 和官网对标同一家(Vercel agent-browser)却写了两个数,数字该打折看;
• License 是双层的——skill 与连接层是 MIT 开源,但浏览器本体免费却闭源,「ego-lite 是开源项目」只对了一半,介意真开源的人这是硬边界;
• WorkBuddy 不在官方支持列表——官方列表是 9 个 agent(Claude Code / Codex / Cursor 等),早期教程里的 WorkBuddy 只是演示对象。
单看一个评测视频,你会笃信「几十倍提速、全开源、支持 WorkBuddy」——交叉 8 个来源后,三条全站不住。这几条裂缝是怎么被逐一揪出来的,我把完整的对账过程单独写成了一篇:《一个评测视频会骗你三次:我用知识库做产品调研》。
给个干脆的选型建议:
一个必须强调的用法原则——人在回路。Dan 的实测里有个很好的示范:让 agent 在 Expedia 把航班查到、选好、填完乘客信息,到付款那一步停下来,敏感操作人工接管。agent 干脏活累活,人在关键节点拍板。
这条原则我自己每天都在用:现在「飞说 AGI」每篇公众号文章的后台准备——排版粘贴、封面上传、摘要填写、名片插入——全是 agent 在 ego-lite 里完成的。草稿存好、逐项复核,但「发布」那颗键永远留给我自己按。agent 干完 90% 的机械操作,人只在最后一个不可逆动作上出场——这就是共享浏览器该有的分工。
ego-lite 不是把浏览器自动化做得更快,是重新定义了「谁在用浏览器」——从「程序操控木偶」变成「agent 和你共享工作台」。 它能不能成,不取决于那些没验证的速度数字,而取决于一个更朴素的问题:当 agent 真的坐在你的浏览器里干活时,你愿不愿意把登录态交给它。
💬 你愿意把已登录的浏览器交给 agent 吗?顾虑是什么——评论区聊聊,呼声最高的场景,我来实测一期。
本文事实均来自作者知识库 8 源交叉验证(ego-lite / 范式对比),标注处可溯源。个人实操段(lovart skill / 公众号后台自动化)为作者 2026-07 一手经验。对账方法论详见姊妹篇 《一个评测视频会骗你三次》。
飞说|feitalks

评论