Aside、Browser Use、ChatGPT 浏览器代理:99% 的跑分和一次真实迁移,中间差了三件事

AI资讯6分钟前发布 Cezary
594 0

把团队里三个人的浏览器代理从 Browser Use 的云端换到 Aside,花了一个下午。真正卡住的不是配置,是第二步:Aside 要接管已登录的浏览器会话,而我们那套跑在云端的脚本从来没有”已登录”这个概念——每次任务都是一个干净的容器,要什么身份就现场喂一份凭据进去。

这两种做法不是同一个东西的两种实现。它们是对”代理该站在哪一侧”的两个答案,而迁移的成本几乎全部产生在这条边界上。

Aside 这周登上 Product Hunt,主页挂着 Y Combinator 的背书和一张跑分表:Online-Mind2Web 99.0%,Browser Use 97.7%,GPT-5.4 92.8%,Claude Opus 4.8 84.0%,ChatGPT Atlas 70.0%。它同时声称在 Online-Mind2Web、BU-Bench-V1 和 Odyssey 三个榜上都是第一。

这张表有两个地方需要停一下。

Online-Mind2Web 是俄亥俄州立 NLP 组那套东西,300 个经人工核验的任务、跨 136 个真实站点,跑的是活网页不是缓存快照。它比那些靠缓存页面的老基准硬得多,但它有个众所周知的松动处:同一个 agent 的成绩会随评判方式变化。人工评判、WebJudge、各家自己写的 agentic judge,三种口径给出的分数不一样。所以 99.0% 和 97.7% 放在一张表里做 1.3 个百分点的比较,前提是这两个数用了同一个裁判——而这件事没人交代。

第二处更直接。ChatGPT Atlas 在 2026 年 8 月 9 日就停止工作了,OpenAI 把浏览器端的代理能力收进了 ChatGPT 和 Codex 本体。表里那个 70.0% 的对手,在这张表被做出来的时候已经下线一个多月。

拿一个已经退役的产品垫底,不算造假,但它让整张表的可信度打了折。

说回三家各自是什么。

Browser Use 的主体是一个开源 Python 库,GitHub 上十万多颗星,你可以完全自己跑,一分钱不付。它的云端是另一套生意:按量档 0 美元起订,Dev 每月 29 美元、Business 299、Scaleup 999,三档各自含等额月度额度,并发会话分别是 25、200、500 个,年付送两个月。会话本身 0.02 美元一小时,另计网络流量。

“另计网络流量”这五个字是它账单上最容易估错的一项。浏览器代理跑一个任务要加载完整页面——图片、字体、第三方脚本全都算进去,一个电商站单页几兆是常态。会话费便宜到可以忽略,流量费不一定。

它的短板很清楚:这是个给开发者的框架,不是给业务人员的工具。要让它在你公司的内部系统里干活,登录、双因素、会话续期全得自己写,而且每个系统写一遍。

ChatGPT 这一侧现在的形态是代理能力内置。Atlas 时期的 Agent Mode 需要 Plus 每月 20 美元起才能用,这条门槛延续下来了。好处是它跟你已有的订阅在一起,不用再管一套凭据;坏处是它的自主度被刻意压着,遇到登录墙、支付页、内部工具就停。OpenAI 自己也不打算让它替你按下付款按钮。

Aside 走的是最激进的那条:它本身就是浏览器,直接用你的账号和登录态,像你一样点。它做的两件工程上比较实在的事——密码由浏览器的自动填充注入网页,凭据不经过模型;支付、发帖、发消息这类动作强制等人确认。记忆也留在本地设备上。

这套设计解决的是别家绕不过去的问题。靠 API 集成的代理只能做集成商支持的事,而绝大多数公司内网系统永远不会有 API。

代价也在同一处。你把一个日常浏览器交给了一家 A 轮前的初创公司,它能看到你所有的登录态。”凭据不暴露给模型”和”凭据不离开这台设备”是两件事,前者是它的产品设计,后者需要审计才能确认。

维度 Aside Browser Use ChatGPT 内置代理
形态 独立浏览器 开源库 + 云端会话 订阅内功能
自报最高跑分 Online-Mind2Web 99.0% bu-max 97.0% 未公布对应口径
起步成本 未公开定价 自托管 0 元 / 云端 29 美元起 Plus 20 美元/月
登录态 直接用你的 自己注入 基本不碰
能自己审计吗 不能 能,代码全开 不能

三家里只有 Browser Use 能被完整审计,这一条在很多公司是硬门槛,跑分再高也换不来。

如果要给一条实际的分派办法:需要跑在自己基础设施上、要留审计轨迹、任务形态固定且量大的,用 Browser Use 自托管;只是想让助手帮着查点东西、写点东西,账号敏感度不高的,ChatGPT 那套已经够,多付的钱是零;日常工作大量发生在没有 API 的网页系统里、且愿意承担一家新公司的信任风险的,Aside 是目前唯一真能把活干完的。

关于那个 99.0%,多说一句。把 Aside 的数字跟公开榜单上其他成绩摆一起看更有参照意义:Yutori Navigator 64.7%、OpenAI Operator 58.3%、Gemini 2.5 Computer Use 57.3%,而 2026 年 3 月时的榜首是 78.7%。半年之内从 78.7 冲到 97 以上,这个斜率本身就说明基准正在被做饱和。一个所有人都能考 97 分的考试,区分度已经不在分数上了。

它在哪儿呢。在你愿不愿意把 Cookie 交出去。

相关对比:《Kimi K2.7 Code、DeepSeek V4.1 Flash、GPT-5.6 Luna:便宜五分之一的前提,没人写在价格页上》《Meta Muse、豆包工作、OpenClaw:三条智能体路线,差的是谁替你兜底》《GPT-Live-1、GPT-Realtime-2.1、Gemini 3.1 Flash Live:每分钟 5 美分只是前台价,三份规格表各藏一个坑》

© 版权声明

相关文章

Aside、Browser Use、ChatGPT 浏览器代理:99% 的跑分和一次真实迁移,中间差了三件事 暂无评论

none
暂无评论...