把团队里三个人的浏览器代理从 Browser Use 的云端换到 Aside,花了一个下午。真正卡住的不是配置,是第二步:Aside 要接管已登录的浏览器会话,而我们那套跑在云端的脚本从来没有”已登录”这个概念——每次任务都是一个干净的容器,要什么身份就现场喂一份凭据进去。
这两种做法不是同一个东西的两种实现。它们是对”代理该站在哪一侧”的两个答案,而迁移的成本几乎全部产生在这条边界上。
Aside 这周登上 Product Hunt,主页挂着 Y Combinator 的背书和一张跑分表:Online-Mind2Web 99.0%,Browser Use 97.7%,GPT-5.4 92.8%,Claude Opus 4.8 84.0%,ChatGPT Atlas 70.0%。它同时声称在 Online-Mind2Web、BU-Bench-V1 和 Odyssey 三个榜上都是第一。
这张表有两个地方需要停一下。
Online-Mind2Web 是俄亥俄州立 NLP 组那套东西,300 个经人工核验的任务、跨 136 个真实站点,跑的是活网页不是缓存快照。它比那些靠缓存页面的老基准硬得多,但它有个众所周知的松动处:同一个 agent 的成绩会随评判方式变化。人工评判、WebJudge、各家自己写的 agentic judge,三种口径给出的分数不一样。所以 99.0% 和 97.7% 放在一张表里做 1.3 个百分点的比较,前提是这两个数用了同一个裁判——而这件事没人交代。
第二处更直接。ChatGPT Atlas 在 2026 年 8 月 9 日就停止工作了,OpenAI 把浏览器端的代理能力收进了 ChatGPT 和 Codex 本体。表里那个 70.0% 的对手,在这张表被做出来的时候已经下线一个多月。
拿一个已经退役的产品垫底,不算造假,但它让整张表的可信度打了折。
说回三家各自是什么。
Browser Use 的主体是一个开源 Python 库,GitHub 上十万多颗星,你可以完全自己跑,一分钱不付。它的云端是另一套生意:按量档 0 美元起订,Dev 每月 29 美元、Business 299、Scaleup 999,三档各自含等额月度额度,并发会话分别是 25、200、500 个,年付送两个月。会话本身 0.02 美元一小时,另计网络流量。
“另计网络流量”这五个字是它账单上最容易估错的一项。浏览器代理跑一个任务要加载完整页面——图片、字体、第三方脚本全都算进去,一个电商站单页几兆是常态。会话费便宜到可以忽略,流量费不一定。
它的短板很清楚:这是个给开发者的框架,不是给业务人员的工具。要让它在你公司的内部系统里干活,登录、双因素、会话续期全得自己写,而且每个系统写一遍。
ChatGPT 这一侧现在的形态是代理能力内置。Atlas 时期的 Agent Mode 需要 Plus 每月 20 美元起才能用,这条门槛延续下来了。好处是它跟你已有的订阅在一起,不用再管一套凭据;坏处是它的自主度被刻意压着,遇到登录墙、支付页、内部工具就停。OpenAI 自己也不打算让它替你按下付款按钮。
Aside 走的是最激进的那条:它本身就是浏览器,直接用你的账号和登录态,像你一样点。它做的两件工程上比较实在的事——密码由浏览器的自动填充注入网页,凭据不经过模型;支付、发帖、发消息这类动作强制等人确认。记忆也留在本地设备上。
这套设计解决的是别家绕不过去的问题。靠 API 集成的代理只能做集成商支持的事,而绝大多数公司内网系统永远不会有 API。
代价也在同一处。你把一个日常浏览器交给了一家 A 轮前的初创公司,它能看到你所有的登录态。”凭据不暴露给模型”和”凭据不离开这台设备”是两件事,前者是它的产品设计,后者需要审计才能确认。
| 维度 | Aside | Browser Use | ChatGPT 内置代理 |
|---|---|---|---|
| 形态 | 独立浏览器 | 开源库 + 云端会话 | 订阅内功能 |
| 自报最高跑分 | Online-Mind2Web 99.0% | bu-max 97.0% | 未公布对应口径 |
| 起步成本 | 未公开定价 | 自托管 0 元 / 云端 29 美元起 | Plus 20 美元/月 |
| 登录态 | 直接用你的 | 自己注入 | 基本不碰 |
| 能自己审计吗 | 不能 | 能,代码全开 | 不能 |
三家里只有 Browser Use 能被完整审计,这一条在很多公司是硬门槛,跑分再高也换不来。
如果要给一条实际的分派办法:需要跑在自己基础设施上、要留审计轨迹、任务形态固定且量大的,用 Browser Use 自托管;只是想让助手帮着查点东西、写点东西,账号敏感度不高的,ChatGPT 那套已经够,多付的钱是零;日常工作大量发生在没有 API 的网页系统里、且愿意承担一家新公司的信任风险的,Aside 是目前唯一真能把活干完的。
关于那个 99.0%,多说一句。把 Aside 的数字跟公开榜单上其他成绩摆一起看更有参照意义:Yutori Navigator 64.7%、OpenAI Operator 58.3%、Gemini 2.5 Computer Use 57.3%,而 2026 年 3 月时的榜首是 78.7%。半年之内从 78.7 冲到 97 以上,这个斜率本身就说明基准正在被做饱和。一个所有人都能考 97 分的考试,区分度已经不在分数上了。
它在哪儿呢。在你愿不愿意把 Cookie 交出去。
相关对比:《Kimi K2.7 Code、DeepSeek V4.1 Flash、GPT-5.6 Luna:便宜五分之一的前提,没人写在价格页上》、《Meta Muse、豆包工作、OpenClaw:三条智能体路线,差的是谁替你兜底》、《GPT-Live-1、GPT-Realtime-2.1、Gemini 3.1 Flash Live:每分钟 5 美分只是前台价,三份规格表各藏一个坑》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Aside、Browser Use、ChatGPT 浏览器代理:99% 的跑分和一次真实迁移,中间差了三件事