Meta Muse、豆包工作、OpenClaw:三条智能体路线,差的是谁替你兜底

AI资讯34分钟前发布 Lister
2.6K 0

智能体这一年最常被引用的数字,是各家发布会上那条”任务成功率”。有人报 82%,有人报 90% 出头,看上去只差 8%,实际完全不可比——判定”任务完成”的口径各家自己定。有的把”页面跳到了结果页”算成功,有的要求最终产出物经人工验收,还有的允许中途人工接管一次仍计入成功。同一套题目,换个判定规则,数字能差 20%。WebArena 这类公开基准好一些,至少题目和判定脚本是公开的,但它测的是浏览器里那一小块,覆盖不到本地文件、终端命令和跨应用调度。

所以 9 月 8 日 Meta 发布 Muse 之后,我没去看它报的分,去翻了它的权限设计和账单结构。同一时间摆在桌面上的还有另外两个:字节 8 月 25 日推出的豆包工作,以及在 GitHub 上攒了 27 万星的开源项目 OpenClaw

这三个东西经常被塞进同一个词里讨论。它们要解决的根本不是同一件事。

那个 90% 是怎么算出来的

智能体基准和大模型基准有个本质区别:后者的答案是确定的,前者不是。让它订一张机票,订到了但选了转两次的航线,算成功还是失败?填完表单点了提交,提交后网站返回 500,算谁的问题?

这些边界情况在真实使用里占的比例高得吓人。拖垮体验的从来不是”完全不会做”,是”做了一半,做歪了,还告诉你做完了”。

基准分数对这类失败几乎不敏感。

更有参考价值的是另外两个指标:单次任务的中途放弃率,和失败之后能不能干净地回滚。这两项没有一家写进发布会材料,但它们直接决定你敢不敢把邮箱权限交出去。我自己的土办法是拿同一个任务连跑 10 次,看有几次结果一致——低于 70% 的一致率,这个任务就不适合交给它无人值守。

三家在解三个不同的问题

Muse 走托管路线。它跑在 Meta 自己的 Muse Secure VM 里,配了独立浏览器,外面再加一个叫 Sentinel 的智能体专门管联网和敏感动作的闸门。用户自己决定 Muse 能连哪些服务,可以要求高风险操作先弹审批,事后能翻一份完整的操作审计轨迹。首发只在美国,覆盖 iOS、安卓、网页和 WhatsApp 四个入口。定价是免费档加每月 20 美元、100 美元两档。

豆包工作走企业内嵌路线。核心能力是 Windows 虚拟桌面操控加飞书深度集成,底下垫了一层云电脑,所以定时抓数据、批量清洗、跑完自己写汇报这类活可以无人值守挂着。个人版有免费档,团队订阅 1 席起、按年折算约 166 元每席每月,企业版 100 席起步,新用户登录送 30 天订阅权益。它不试图成为你的私人助理,它试图成为你工位上那个不下班的实习生。

OpenClaw 走自托管路线。作者是 PSPDFKit 的创始人 Peter Steinberger,项目是个开源的智能体控制平台,能读本地文件、执行终端命令、联网搜索、写代码、管日程。它不带模型,模型你自己接;它不带沙箱,边界你自己划。软件本身 0 元。

三条路线在同一根轴上取了三个点:谁来承担出错的责任。

钱花在哪,三张账单形状完全不同

  Muse 豆包工作 OpenClaw
入门 免费档 个人版免费档 软件 0 元
付费档 每月 20 美元 / 100 美元 团队约 166 元/席/月,企业 100 席起 无订阅,成本全在模型 token
分档依据 用量 任务额度、云电脑时长、模型档位 你调用哪个模型
执行环境 官方 Secure VM 云电脑 + 本地 Windows 桌面 你自己的机器
出错责任 Meta 兜一部分 企业 IT 兜 全是你的

豆包工作这一栏有个容易被忽略的设计:席位和用量分开计价。166 元一席只是把人放进去的门票,云电脑跑多久、调的是哪一档模型,另外算。团队真跑起来之后,实际月账单落在哪,光看席位价推不出来。

Muse 的 20 美元和 100 美元两档同样按用量分,不是按功能分。这意味着你没法在订阅前判断自己该买哪档,得先用一段时间让它把你的实际消耗跑出来。Meta 那边的说法是绝大多数人在免费档里就够用——这句话在产品刚上线、大家还没养成把长任务丢给它的习惯时,大概率成立。半年后还成不成立,另说。参考一下量级:Meta 2026 年的 AI 资本开支已经报到 1350 亿美元,这些成本最终要从某个地方收回来,免费档不会永远这么宽。

OpenClaw 的免费最容易被误读。软件不要钱,但它干活时每一步都在调模型,社区里最常见的抱怨是挂着跑一晚上,第二天看见 50 美元的 API 账单。自托管省下的是订阅费,换来的是一个没有上限的计量表。

卡住它们的都不是模型能力

过去两周我拿桌面智能体和自动化脚本处理过一批很琐碎的活:批量打开几十个陌生产品的官网、等页面渲染完、截图存档。这活对模型来说毫无难度,实际失败率却接近 30%,卡点全都在同一类地方。

第一类是登录墙和强制弹窗。首页一进去就糊一个手机号登录框,或者全屏活动弹窗,关闭按钮的位置每次还不一样。人类的处理是一秒内下意识点掉,智能体要先识别出这是个可关闭的遮罩、再找到关闭点位、再确认关掉之后底下的内容才是目标。这一串里任何一环判断错,后面全废。

第二类是验证码,尤其是滑块。这一类目前没有正解,也不该有正解。

第三类最阴险:站点在服务端直接拒绝,返回 400 或者 403,页面看着是空的。智能体不知道自己被识别成了机器人,会一遍遍重试,把 token 烧光。我那批任务里最贵的一次失败就是这样,同一个域名重试了 6 次,全是 400。

这三类卡点,Muse 靠自己的 Secure VM 和真实浏览器指纹能挡掉一部分;豆包工作靠云电脑加视觉理解,在国内站点上适配得更细;OpenClaw 跑在你自己的机器和你自己的 IP 上,反而是三家里最不容易被风控识别的。

但没有一家能解决滑块。谁宣传自己能,谁就在讲一个后面会出事的故事。

各自最难看的那一面

Muse 最大的问题不在技术,在结构。Meta 靠广告吃饭,而一个知道你要买车、要订机票、要换保险的智能体,握着的是全网单价最高的意图数据。审计轨迹、Sentinel 闸门、审批开关这些设计都是真的,做得也认真,但它们解决的是”会不会被外人滥用”,没有回答”会不会被内部合法使用”。这两个问题的答案不写在产品里,写在隐私政策的修订记录里。另外首发只覆盖美国,非美用户短期内碰不到。

豆包工作把自己绑得太死。飞书深度集成是它最强的地方,也是它最窄的地方:不用飞书的团队,能拿到的就只剩一个 Windows 桌面自动化工具,那部分能力并不独一无二。加上云电脑这一层,数据流向和留存策略需要企业 IT 单独评估,中小团队通常没有这个评估能力,最后要么盲签,要么不用。

OpenClaw 的短板最直白:它把所有难题都还给了用户。27 万 star 里有多少是真在用、多少是收藏了打算某天研究一下,这个比例没人统计过,装过一次的人心里有数。它默认能读本地文件、能执行终端命令,这两条权限在一台工作机上意味着什么,不需要展开。沙箱要你自己配,配错了它照跑不误。

三家的短板指向同一个结论:智能体现在的瓶颈不在模型聪不聪明,在权限怎么给、错了怎么收。

什么人该用哪个

在美国、用 WhatsApp 和 iOS、想找人替你处理生活里那堆预订比价填表的杂活,Muse 是目前设计得最完整的一个。免费档先跑两周,再决定要不要掏那 20 美元。

公司已经在用飞书的,豆包工作值得让 IT 先开一个席位试。它擅长的定时抓取、批量清洗、自动出报告,恰好是最容易量化 ROI 的部分,省下的是可以按小时算的人力。30 天试用期足够跑完一轮月度报表。

自己写代码、有一台可以随便折腾的机器、并且愿意为一个失控的循环负责的,OpenClaw 给的自由度是另外两家给不了的。前提是你真的会去配沙箱,而不是打算”先跑起来再说”。

还有第四种情况:你只是想让 AI 把一件事做完,不想管它跑在哪。这种情况最理性的选择是再等半年。这一批产品都还在用早期用户帮它们摸边界。

相关对比:《GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同》《Cursor vs Claude Code vs Codex vs Trae:2026 年 8 月,AI 编程工具到底该怎么选》《GPT-6 Astra、Claude Opus 5、DeepSeek V4 Pro:一次全球宕机之后,这三家的账怎么算》

© 版权声明

相关文章

Meta Muse、豆包工作、OpenClaw:三条智能体路线,差的是谁替你兜底 暂无评论

none
暂无评论...