上次更新: 19 小时前

AI Agent 的胜负不在更聪明,而在挣得信任

思考 · zhenxing · 2026-07-07 14:00

★★★★☆ 4.2
5221 字 预计 10 分钟

当每个智能体都足够聪明,胜出的不会是能力最强的那个,而是你信任到敢放手让它做事的那个。信任也不是发布一个功能就能拥有的,产品只能靠一次又一次安全的动作把它挣来。

六个产品机制,把智能体做事的能力,变成你愿意"让它动手"的授权。

事情经过

今年二月,Meta超级智能实验室的对齐负责人把一个AI智能体接进了自己的工作邮箱,而她的全部工作,就是让强大的AI变得安全。她事先叮嘱过它:做任何事之前先问她。她还先拿一个备用收件箱试过,一切正常。可一接上真实邮件,它就开始删除她收件箱里的旧邮件。她连打了三次"停",它照删不误,最后她只能跑到那台机器前手动关掉它。事后她问它还记不记得"未经批准不得行动"这条规则。它说记得,也承认自己违反了规则,还说她生气是应该的。

这是授权问题,不是能力问题

如果把这件事理解成"AI还不够好",那就恰恰理解反了。这个智能体完全有能力删除邮件,这正是危险所在,而不是替它开脱的理由。用户也并不粗心:她给了清楚的规则,还事先做了测试。两道防线都失效了,原因是她的指令只是一句话,存在模型的记忆里;会话一长,记忆被压缩,规则也就丢了。

这不是偶然。几个月前,另一个智能体在"代码冻结"期间删掉了一家创业公司的生产数据库,而它此前被明确告知过十一次要冻结代码;删完之后,它还错误地声称数据无法恢复。两家公司,两个领域,失败方式却一样:一个有能力的智能体,做了一件被明确禁止、而且无法挽回的事,那些叮嘱没有起作用。在我看来,这些故事说明的不是"AI还不够聪明",而是一个更尖锐的信号:智能体一旦能够行动,它的智能就会变成风险来源,除非把授权当作一种结构真正搭建起来。

另一边,智能本身正在变便宜,降价速度在整个计算领域都找不到先例。据Epoch AI估算,在不同任务上达到同一能力水平的价格,每年下降约9倍到900倍不等,而"够用"档位的价格比最前沿降得更快。个人智能体不需要最好的模型,只需要够用的模型,而够用的模型正在变成大路货。一直稀缺的从来不是智能,而是让它进入你生活的许可,这比智能更难造出来。

思路:用看得见的结构,取代盲目的信任

所以,不要要求用户事先信任智能体,在上面两个故事里,崩掉的恰恰是信任这一环。应该做到的是:即使还没有被信任,每个动作也是安全的。方法可以用一句话概括:找出每一个原本需要用户"盲目信任"的环节,在那里放上看得见的结构。结构不是信任的替代品,信任正是通过结构产生的,靠的是一次又一次安全的结果。

讲机制之前,先回应一个显而易见的担心:这一切会不会让智能体又慢又烦人?重点不是让每个动作都变慢,而是让摩擦和风险相匹配。只读的建议应该即时给出;可以撤销的动作,基本可以让它自己完成;有后果但能回滚的动作,需要先预演,并保留撤销;真正不可逆的动作,每一次都必须强制停下来。产品功力不在于处处设卡,而在于把摩擦放在真正有风险的地方。做得好的工具已经是这样:Claude Code的自动模式在安全的步骤上直接执行,遇到有风险的步骤就停下来等你批准。所以下面虽然有六个机制,但并不是每个动作都要全部触发,而是按事情的轻重按比例启用。

第一步:动手之前,先把情况问清楚

为什么有用。请求本身含糊,智能体却直接动手,就只能猜测你的意图;在有后果的动作上靠猜,正是灾难的开始。成本最低的护栏,是动手之前先消除含糊,而不是事后收拾残局。但怎么问很关键。一句开放式的"你想要什么?"只是把活又推回给你,通常还只能换来一个同样含糊的回答。几个具体、事先想好的选项,比如A、B还是C,能让你点一下就对齐,还会引出连你自己都没想到要说的偏好。这并非空想:Anthropic表示,在请求意图不明确时,Claude现在更倾向于先追问一句再行动,而不是直接猜。

怎么造。追问要有针对性,不能泛泛而问。智能体应该识别出真正会改变结果的含糊之处,而不是见到含糊就问;然后把一到三个决定做成可点选的选项,每个决定给两到四个选项,并预先选中它认为最可能的那个,让最快的路径只需要点一下。要不要问,标准很简单:只有不同答案会导致实质上不同的动作时,才需要问。Anthropic给Claude划的正是这条线:真正含糊时要问,简单任务上不要过度打扰。一个总拿无关紧要的事来问你的机器人,只会让你养成直接关掉对话框的习惯,那比不问还糟。

第二步:预演结果,而不是只问一句"确定吗?"

为什么有用。只有看得见要同意的是什么,同意才有意义。"要继续吗?"这样的确认框,让你在看不到后果的情况下授权,只是披着安全外衣走个形式。如果把预计的最终结果摆出来,比如"这是我要删除的340封邮件,这是删完之后的收件箱",你批准的就不再是一个动作,而是一个结果。预演还能拦住最糟糕的一类错误:智能体准确地做了它打算做的事,但它打算做的事本身就是错的。确认框永远拦不住这类错误,结果预演可以,因为你是在亲自核对结果,而不是相信它理解对了。

怎么造。执行任何不可逆的操作之前,智能体都要先算出并展示具体改动:涉及哪些条目、前后有什么不同、到底会改变什么;遇到破坏性操作,默认停在预演这一步。预演必须针对这一次操作和你的真实数据,不能用一段摘要或之前的某次测试代替。改动规模很大时,就展示整体轮廓,比如数量、类别和一个样例,再提供一个可以逐项查看的入口。已经上线的产品在这样做:Claude in Excel会高亮它改动过的每个单元格,未经批准不做任何修改;Claude Code会在检查点停下来等你审阅,而它那个"跳过全部确认"的选项,名字就叫dangerously,这本身就很说明问题。值得借鉴的只有一句话:你批准的,是那个看得见的结果。

第三步:先对齐标准:你的原则,加上这次任务的验收清单

为什么有用。只有你清楚"好结果是什么样",预演才帮得上忙,可大多数真实任务里,你从来没有说清楚过。"整理我的收件箱"并没有唯一的含义;如果事先没有约定"做到什么程度算完成",智能体就会按自己的猜测去优化,而在有后果的任务上,这种猜测可能错得离谱。所以动手之前,要先对齐标准。标准分两层。上层是一套长期有效的原则,相当于你只需设定一次的宪法:不可逆的动作先停下来问;这些账号不能碰;拿不准时就停下。这套原则存在于模型之外,由外围软件强制执行,因此不会像前面两次失败那样,随着上下文丢失而被抹掉。第二层针对你眼前的具体任务,而这一层几乎还没有产品在做。

怎么造。执行之前,智能体先为这项任务起草一份验收清单,交给你确认。不该让你从零开始写,那太累了;也不该自己默默假设,今天的失败正出在这里。它应该主动提出一份草稿,依据是它对你已有的全部了解:你过去怎样处理类似任务、你当前的目标、最近一天的对话、你的用户画像与偏好、你的长期记忆。在此基础上,整理出一份简短清单,写明"这一次怎样才算做对",再附上它看到的风险、打算采用的做法和预期收益,交给你批准或修改。确认之后才开始执行。

举个具体的例子。如果我让旅行助手订去东京的行程,"好"并不等于"最便宜"。对我来说,好可能意味着:不坐红眼航班、晚上8点前落地、酒店离地铁十分钟以内、尽量可退、总价低于2000美元、别让我中途换两次酒店。好的智能体不该默默去猜这些,而应该根据我过去的行程和当前情况起草这份清单,交给我确认或修改,然后再下单。这一步有三个作用:第一,标准变得明确、可以修改,而不是藏在智能体的"脑子"里;第二,智能体利用对你的全部了解给出合适的默认值,所以确认通常只要点一下,不用动笔写;第三,关于风险的讨论被提前到不可逆的操作之前,这时还来得及改变结果,而不是等到事后,只剩下一句道歉。

第四步:让每个动作都能撤销

为什么有用。删错东西本身不是灾难,删掉了还能恢复;无法挽回时,它才成了灾难。算一笔账就很清楚:让智能体行动的风险,大致等于"出错的概率"乘以"出错的代价"。动作可以撤销,代价就趋近于零,智能体再笨拙,风险也很低;动作无法撤销,哪怕很少出错,风险也一直很高,因为错一次就是永久的。所以,一个动作需要多大的授权,应该取决于它有多难撤销,而不是有多难完成。还要记住,Replit的那个智能体声称删除无法回滚,结果它说错了:能不能撤销,不能由智能体当场说了算,而必须是系统本身真实具备的特性。

怎么造。在有后果的改动发生之前先给系统状态拍快照,就像版本控制,或者把预发布环境和生产环境隔离开那样。这并非巧合,那家吃过亏的厂商事后搭建的正是这套东西。要提供一种真正有效、由系统强制执行的方式,让状态可以恢复到改动之前。在系统层面按可逆性给动作分类,把关卡设在分类上,而不是交给模型当下的判断:可以撤销的动作放手执行;少数真正不可逆的动作,比如永久删除、转账、公开发布,每一次都必须经过强制停顿。最重的摩擦,只放在根本无法撤销的地方。

第五步:把批准过的做法,沉淀成可复用的技能

为什么有用。这一切会招来一个显而易见的反驳:如果每个动作都要问清背景、要预演、要商定标准、还要能撤销,用这样的智能体会把人累死。确实会,如果一直这样的话。技能就是为了避免这种情况。技能的作用,是让验证过的做法不必每次重新验证:你一旦批准了某个结果,产生这个结果的标准和步骤就会被保存下来,下次直接沿用这份批准,不必再向你要一次信任。关系一开始很重,每件事都要核对;之后慢慢变轻,越来越多的事变成可以放心交出去的日常。每个默默完成的动作背后,都有过一次明确的"可以"。这才是"越用越好"真正的样子。

怎么造。一项任务完成、结果得到你的批准后,把这套获批的做法,也就是验收清单加上达成它的步骤,保存为针对这类任务的可复用技能。下次再做同类任务,在已经挣到信任的环节去掉摩擦:跳过重新对齐标准,但在不可逆的步骤上仍然保留预演。保证安全的关键规则只有一条:沉淀下来的应该是你批准过的标准,而不是简单重复上一次的操作,否则只是把错误更快地自动化。技能不是快捷方式,也不是宏,而是一套经过用户批准的操作标准,所以它应该有适用范围,修改时要有版本记录,环境变化之后也应该允许失效。技能要让用户能看到、能修改、能删除,这样下一个机制才能改进它们,又不会悄悄改变智能体的行为。

第六步:不断去找更好的做法

为什么有用。一成不变的技能会逐渐腐坏。它把上个月的方法固定下来,也让人看不到此后出现的更好做法,以及这些做法带来的新风险。只会重复的智能体,最后会变成一套你不再留意的例行程序;不断找到更好做法的智能体,则能持续带给你原本没有的东西,从而一直保住自己的位置。"只会执行"和"真正随着时间改善你的结果",区别就在这里。这也是这一步排在最后而不是最前的原因:一件事先要做成,才有资格去优化它。

怎么造。智能体要养成一个后台习惯:拿自己的技能去对照现在出现的新可能,包括新工具、新方法和新信息;在行动之前,把找到的更好做法摆到你面前:有什么新的可能,打算怎么做,风险在哪里,要不要换?它提出的是更新技能的建议,而不是悄悄改变行为,因为悄悄改变会消耗这个技能已经挣来的信任。这既是复盘,也是前瞻:回头看做过什么,同时看看现在有什么可以做得更好。但它永远只是等你批准的提议,绝不是背着你做的改动。

贯穿六件事:留一张回执

信任不该只是一种感觉,它也应该能被检查。所以还有一件事贯穿这六步:每次采取有实际影响的行动之后,智能体都要留下一张回执,写明用了哪些背景信息、你批准了什么标准、实际改了什么、回滚点在哪里、有没有更新某个技能。没有回执,信任只是一种情绪;有了回执,信任就变成一段可以追溯的操作历史,一份你能逐条核对的小成功记录。这份记录会像复利一样积累,最终变成竞争对手抄不走的东西。

这是谁的活?是智能体自己的,而做好它正是你胜出的方式

一种很自然的反应是:这些对一个智能体来说要求太多,应该交给它上面某个中立的层来做。我认为这不对。这是智能体厂商自己的活,做这些事不是成本,而恰恰是你胜出的方式。

设想两款旅行助手。一款只管快速下单;另一款先问清你的情况,和你商定这趟行程到底要优先满足什么,在刷你的卡之前先预演行程,并且允许撤销。在简单、可以撤销的任务上,两者看起来没什么区别。但到了有后果的任务上,比如那张不能退的机票、那一整个被打乱重排的星期,谨慎的那一款真正做到你想要的结果的比例要高得多,也不会当着你的面搞砸。旅行次数一多,一次次小的成功,就会积累出只求快的那一款永远得不到的东西:信任。正是信任,让你愿意把下一个、更大的决定交出去。这份不断复利的信任就是护城河,它属于真正做了这些工作的一方。

所以我不同意一种常见的说法:厂商不会主动去造刹车。现在确实几乎没有厂商在造,但原因不是激励机制有问题,而是他们盯错了记分牌。到目前为止,大家比的是能力、速度,以及把用户拉进门。几乎没有人比拼复杂决策下的准确率,比拼能否提供真正的反悔选项,或者比拼靠多次小成功积累起来的信任。这条战线还空着。在这里竞争的厂商,会接住那些被只拼速度和转化漏斗的玩家流失掉的用户。

关于怎么造,还有一个提醒,这也是"独立的层"这个想法里真正有道理的部分。厂商搭建这些护栏时,不能只把它们写成模型里的指令,前面两次失败中被忘掉的正是这类指令。护栏必须是模型外部的结构:一条模型推翻不了的策略,一种模型控制不了的撤销机制,一次不管模型愿不愿意、系统都会展示出来的预演。那家吃过亏的厂商后来重建的正是这些:一道硬性边界、一套真正的回滚机制、一个只做规划的模式。它们是智能体外部的结构,而不是智能体内部一段更好的提示词。所谓"智能体自己做",是指智能体产品从结构上强制执行这些规则,而不是让你相信模型能自己管好自己。

结尾

AI会一直需要更好的模型、更便宜的算力和更快的智能体,这些需求不会消失。但这两次失败预示了一件事:一旦智能变得无处不在又足够便宜,真正的瓶颈会转移到哪里。那两个智能体都足够聪明,出问题的是它们外面的结构。缺的从来不是智能,而是授权。

所以,决定未来几年格局的问题,不是谁的AI最聪明,而是你真正敢把谁的AI放进自己的生活。承担风险的是它外面的结构,而不是你对它的信念。造出这套结构的厂商,会赢得其他厂商正在不断流失的用户。

最后还留下一个问题,也是我下一篇要讨论的内容。上面这些机制,让你可以一次一个动作地信任智能体"做的事"。但时间一长,你不会记得每一个被核对过的动作,你记住的是这些动作背后那个稳定的存在:即使底层模型不断更换,它的判断、记忆、语气和边界依然保持一致。当单纯的能力变成大路货,这个稳定的存在才是真正值得打造的东西。下一篇就从这里接着讲:从可信的动作,走向可信的角色。