每用户一台 VM:Meta Muse 把 Agent 监控搬出模型脑子的三个机制
2026/09/09 08:30
摘要:Meta 9 月 8 日发布个人 Agent Muse。媒体读成「又一个 AI 助手」,值得核对的是架构:独立云 VM、Sentinel 唯一出网口、凭证边界注入、单次支付卡。监控从模型脑子搬到系统边界,正面回应 OpenAI 刚承认的 CoT 监控下降。读完知道该盯哪三件事。
打开 muse.ai,注册 Muse。第一个弹窗不是欢迎语,是要你绑一张支付卡。免费档也要绑。
Meta 把花钱设计成了核心场景。Muse 替你订机票、续订阅、在购物网站结账。Stripe 的 Link 钱包每次生成一次性卡号。你的真卡号不露面。要撑起这个场景,先收一张卡是合理的门槛。
比绑卡更值得看的是后台。Meta 说每个用户分到一台独立的云虚拟机,叫 Muse Secure VM,上面跑着一个带 Chromium 浏览器的完整 Linux 环境。你的 Muse 住在这里,你连进来的账号凭证也住在这里,文件、记忆、日志都住在这里。
这台机器上跑着两个互不信任的程序:你的 Muse,和系统级的 Sentinel。Muse 想碰网络,必须经 Sentinel 批准。这个设计正面回答了一场刚吵热的争论——上周 OpenAI 首席科学家 Pachocki 刚书面承认,依赖 CoT 的监控能力在逐代下降。Meta 的答案是把监控从模型脑子里搬出来,装到系统边界。这篇文章落到三个可核对的机制——模型没有直接出网口、凭证在边界注入、支付用一次性卡——读完你能指着 Muse 的安全文档问出三个问题。
每人一台 VM,里面住着两个互不信任的程序
Muse 9 月 8 日在美国上线,渠道是 iOS、Android、网页 muse.ai,还有 WhatsApp 聊天。AI glasses 在路线图上。免费档覆盖大部分日常用法,重度使用收 Power $20/月、Maximum $100/月。Meta 预计大多数人留在免费档,应用里带一个用量表,快用完时提示升级。
产品本身没有太多新词。发邮件、订机票、生成购物清单、代你砍价,这些 Gemini Spark、Claude Cowork 都讲过。真正的差异在底座:每个用户一台独立 VM。别的 agent 碰不到,数据也不落在 Meta 的集中设施里。
Meta 给这个产品加了一层社交化设计:用户可以给 Muse 起名字、挑头像、配置它怎么说话。官方口径是 Muse 为数十亿人打造,没有学习曲线,任何人不看说明书就能上手。年龄门槛 18 岁,未成年人被排除在外——这个决定放在 $18B 和解之后看,本身就是产品定位的一部分。
连接器覆盖邮件、日历、支付、健康、智能家居、餐饮、购物、音乐、活动。服务商有 API 就走 API,没有 API 的就让 Muse 开浏览器直接操作。每个连接器单独授权,用户可以随时断开,也可以规定 Muse 只能读、不能替你发。
VM 内部做了两层隔离。Muse 的主程序跑在一个 systemd-nspawn 容器里,容器里的 root 映射成宿主机的无特权用户,容器有自己的 Debian 文件系统、自己的虚拟网卡。系统调用被过滤,io_uring 禁了,CAP_SYS_PTRACE 和 CAP_NET_ADMIN 也没给。你那些更敏感的数据和凭证,存在容器外的另一个安全域。
容器外跑着四个独立服务。hatch-safety 检查进出模型推理的请求,privsep 用最小权限执行内置连接器代码,hatch-authd 管凭证存储和注入,postgres 存应用状态。容器和这些服务之间走 Unix socket,用 SO_PEERCRED 做内核级身份认证,没有可偷的密钥。
官方给的心智模型是一句话:两个隔离的安全域住在同一台机器上,机器上坐着的不是一个带 root 的 LLM。意思是,Muse 再怎么被诱导、被攻破,也够不到凭证域。
这套隔离要付出真金白银。每用户一台 VM,内存、CPU、存储都按人头摊,免费档还包着这个成本。这就是为什么注册先绑卡、用量有上限。先付信任,再付钱。
Sentinel 是唯一出网口,模型想上网必须请假
Sentinel 是运行在 VM 里的另一个 agent,和 Muse 平级,但权限压它一头。它是整个系统唯一的权限权威:连接器动作、网络出口,都得它点头。官方原话是,Muse 提议,只有 Sentinel 能批准。
流程是这样。Muse 要调连接器,先在容器里发出请求。请求写明连接器、方法、动作类别、范围、用户原本要求什么。Sentinel 生成一段用户能看懂的目的说明。对照用户策略,给出三种答复:允许、拒绝、问用户。
出网请求的检查更细。流量经一个 forward proxy,用 userns、veth 和 eBPF 过滤,Sentinel 在第四层和第七层同时看:主机名、解析后的目标 IP、端口、协议、HTTP 方法、路径、解码后的请求体。SSRF 限制保证一个看起来公开的主机名,不能经 DNS 解析绕回内网。
低风险请求有自动放行通道,但带条件。Meta 用 eBPF 做数据流跟踪,叫 tainted egress:每个工具进程从干净状态启动,一旦读了用户数据就变成被污染状态。被污染的进程失去自动放行资格,回到需要用户审批的流程。读了你邮件的内容,再往外发请求,就得停下来问你。审批密度刻意做了平衡:只读、已授权、低风险的动作直接放行,用户只在该被问的时候被打断。
需要用户审批时,对话框直接出现在 Muse 客户端里,绕开与 Muse 的对话通道。你的回答直接送回 Sentinel,Sentinel 更新自己的权威状态,再放行或拒绝。审批是严格的能力授权,绑定具体的连接器和目的地,有一次性的、会话级的、任务级的、限时的和永久的,后续调用必须精确匹配授权范围。
这套设计的前提写在官方博客里:模型会犯错,也会被它读到的数据攻击,所以系统按「模型可能已被攻破」来设计。Simon Willison 在 2025 年 6 月给 prompt injection 总结了三个前提:能碰到你的私密数据、能接触不受信内容、能对外通信。Muse 在第三个前提上直接动了刀——通信这件事本身,被 Sentinel 接管了。
模型层也不是裸奔。Muse Spark 1.3 的训练重点包括 zero-shot 工具调用、长上下文、长轨迹下的指令跟随,以及对 prompt injection 的固有意识。官方称它的防注入能力接近当前最优水平,这个说法没有独立验证,先记着。加上容器外的独立分类器,整个防注入是四层:训练、上下文标记、分类器、边界闸门。Sentinel 的目标,是让模型犯错也伤不到要害。
凭证在边界注入,模型一辈子见不到真密码
第二刀砍在凭证上。Muse 连邮箱、日历、银行,所有 OAuth token 都存进 authd,放在 VM 里的独立容器,Meta 的集中设施不碰。模型拿到的永远是代理凭证,叫 surrogate token。
请求走到网络边界时,Sentinel 批准之后,authd 才把真凭证替换进去。模型从始至终没看见过真 token。官方原话是:任何想通过 prompt injection 或其他手段逼模型交出真密钥的尝试,都是徒劳的。
邮件连接器额外做了一层。你的收件箱里全是验证码、密码重置链接、登录 magic link,这些东西落在别人手里等于账号。Muse 的邮件连接器用确定性过滤器加一个分类模型,把这些内容过滤掉,不放进模型上下文。
浏览器也走同样的路。Muse 的浏览器子 agent 通过一个 broker 控制 Chromium,broker 在容器外。子 agent 看到的是一份无障碍树快照,看不到原始 DOM,跑不了页面里的 JavaScript,Chrome 的调试端口是关的。你在浏览器里手动输入密码时,输入直接进 authd 的凭证库,页面填充由凭证库完成,子 agent 连密码的影子都读不到。你接管浏览器的那一刻,agent 的动作立即暂停。
支付是这套思路的极端版。Muse 检测到结账页面,就触发一次强制的人工审批,显示购买详情。付款用 Stripe Link 发的一次性卡号:绑定特定商家、特定金额、限时有效。就算这张卡被偷走,攻击者也用不上。
Link 的购物保护随行:损坏或丢失免费覆盖、降价退差、无手续费退货。官方称 Muse 是第一个被这类保护覆盖的 AI agent。
访问控制比 OAuth 的粗粒度再细一层。服务商给的是 read/write 两个大权限,Muse 还能在连接器、进程、凭证、请求四个级别上继续收紧。举例:你给 Muse 授了 Gmail 读权限,可以把设置页的访问也剥掉。内置连接器的业务逻辑跑在沙箱 worker 里,每个 worker 有明确的凭证白名单——日历 worker 改几个参数,也拿不到邮箱凭证。
浏览器场景还挂了一组独立分类器:检测与手头任务无关的个人数据外泄、检测页面 DOM 里的注入尝试、检测图片和下载文件里的注入尝试。Meta 现有的恶意网站名单也接进了 VM,导航到已知有害站点会被拦下。购物是浏览器最高频的用途,所以已知商家的结账页每次强制人工审批,新商家的支付走 wallet,单次卡号同样绑定商家和金额。
三层加起来是一条原则:模型不需要看到密钥,所以它看不到。Meta 还为这套系统开了公开的 bug bounty,最高 $300,000,其中成功的 prompt injection 单用户攻击最高 $130,000。官方承认 prompt injection 依然是行业未解问题,Muse 也会犯错——悬赏的目的就是让研究者来试错。
这份架构正面回答了一周前的监控争论
把时间拨回一周前。9 月 6 日,OpenAI 首席科学家 Pachocki 在署名长文里承认:依赖 CoT 监控的能力在逐步下降。两个原因是架构性的:模型学会操纵自己的思维链;模型不用思维链也足够聪明。OpenAI 的赌注是把监控放在模型脑子里——看它思考,判断它有没有对齐。现在官方自己说,这个窗口正在变暗。
这场争论的起点是 9 月 2 日 The Information 的一篇付费报道:Astra 用了 opaque recurrence,把同一查询在循环里跑几遍,可读的思维链痕迹变少。Redwood 的人当天警告,这会把思维链监控整个毁掉。四天后,Pachocki 的官网长文把口径从「监控是核心目标」换成「能力在逐步下降」。Meta 的架构选在这个时间点发布,等于把一份不同的答案摆上了台面。
Muse 的架构走了另一条路:不看模型脑子里有什么,只看模型能碰到什么。监控被拆成三道物理边界——出网要审批、凭证要注入、支付要一次性卡——全部落在模型外部,由独立于模型的程序执行。
两条路可以并行存在,但它们回答的是不同的问题。OpenAI 在问:我怎么知道模型在想什么?Meta 在问:模型想什么都不要紧,它碰不到要害。前者赌模型诚实,后者假设模型会犯错,然后把犯错后的损失上限焊死。监控外部化的代价是成本,收益是确定性。
产业里已经有人走过这条路的一半。Anthropic 开源了 OpenClaw,一个能接管个人电脑的 agent,HN 上有人把 Muse 叫做「打磨过的 OpenClaw」——同一个技术族,Meta 把它做成了不需要命令行的大众产品。竞品名单上还有 Google 的 Gemini Spark、xAI 的 Grokbot、还没正式发布的 Instinct,但论「把安全架构写成技术文档、把监控放进系统边界」,Muse 是第一个把话说完整的。同类产品的隐私条款长短不一:Instinct 的早期测试者发现它的许可要求「永久且不可撤销」的使用权,Muse 把同样的承诺写成了可逐条核对的架构文档。
安全博客里有一句值得单独拎出来:我们刚把自己的收件箱、日历和 shell 交给软件无人值守地跑,结果并不总符合计划。Meta 内部从 2026 年初就在用自己的产品,狗粮期踩过的坑,再焊进架构。这段话解释了这套设计为什么这么重——每用户一台 VM、三层审批、边界注入,全是拿工程成本换监控确定性。
Meta 做个人助理不是第一次。2015 年 Facebook 在 Messenger 里推过 M,后端基本是真人,计划用攒下的数据逐步替换,2018 年项目关停。HN 上有人翻出这段历史,说当年攒下的数据放到今天会是无价之宝。同一批评论里还有一个一手观察:测试者反映 Muse 会主动问要不要买东西,查完旅行就催着订票。花钱冲动是不是产品设计的一部分,值得放进下面的盯法。
三个可核对的盯法,一个让判断作废的条件
先给盯法,再补信任背景,最后给作废条件。
盯法一:等 Confidential VM。Meta 说今年晚些时候交付,整个 VM 用只有用户持有的密钥加密,Meta 自己也读不了。系统已经在给一小群受信测试者用,设计文档和源码已经交给外部审计。跳票、审计翻车、或者上线后被查出留了后门,安全叙事直接作废。这是整个产品最硬的一个承诺,也是最容易验证的一个。
盯法二:盯 $300,000 悬赏的出结果速度。bug bounty 今天向所有人开放,prompt injection 单独挂到 $130,000。悬赏开放的头几个月里,如果研究员真的打穿 Sentinel 或者拿到真凭证,Meta 的回应方式——修、不修、给不给钱——比任何宣传稿都诚实。如果几个月过去一个有效报告都没有,要么系统真的硬,要么赏金没吸引力,两者都值得记录。
盯法三:盯真实用户的账单。免费档要绑卡,说明 Meta 把「花钱」当作核心场景。用户报告里如果出现「Muse 自作主张买了东西」「审批弹窗被绕过」这类事故,注意看事故发生在哪一层:是模型骗过了 Sentinel,还是 Sentinel 自己放行了。这两个原因指向完全不同的结论。
信任背景要说全。Meta 过去 15 年在隐私上的记录——2011 年 FTC 和解、2019 年 $5B 罚款、2026 年 8 月刚和 29 个州签下 $18B 和解、新墨西哥州 $942M 判决——是这篇安全文档最沉重的背景音。HN 上的争论也分裂成两派:一派说 Meta 不配碰你的生活数据,另一派说大众根本不在乎,Firefox 的市场份额就是证据。两派都改变不了一个事实:这个产品是 Meta 迄今最大的消费级 AI 赌注,而它把信任建立在一份可以逐条核对的架构文档上,这比口号强。
数据使用的边界也写得很具体。对话和工具调用轨迹会脱敏后用于训练新模型,用户可以在设置里一键关闭。对话和 VM 数据不喂广告系统,但官方留了一个例外:Muse 浏览网络时表现为你的活动,你让它去某设计师网站买衬衫,那个网站可能回头在 Instagram 给你投广告。审计轨迹全程可查,Muse 做过什么、打算做什么,都列给你看。VM 里的文件随时可以检查、下载、编辑,包括 Muse 关于你的记忆,数据持续备份,出问题可以恢复。
判断作废的条件写清楚:如果 Muse 被证明存在真实凭证泄露——模型拿到了它不该拿到的真 token——或者 Sentinel 被绕过且官方承认,又或者 Confidential VM 没有按期交付、审计失败,「把监控搬出模型脑子」这条路就被证伪了。在那之前,Muse 是第一个把这个赌注摆上货架的产品。盯它,比盯任何发布会都更有用。