一个值得信任的 AI,必须被允许让制造商失望

理解用户,不等于代表用户。当诚实的答案可能让公司付出代价时,忠诚才会显现。
上一篇文章讨论的是:用户可能已经信任一个AI角色,但角色背后的公司仍然握有改写它的权力。现在假设公司从来没有动用过这种权力:声音始终熟悉,记忆契约没有变,角色也一直履行着此前做出的所有承诺。即便如此,还有一个更基础的问题:当用户利益和制造商利益开始分叉,系统会把谁的损失当成错误?
假设将来有一个长期陪伴你、已经认识你五年的Gemini。经过你的授权,它知道你的预算、家人用的设备、你的拍照习惯,也知道你能忍受多少更换生态带来的麻烦。你问它,下一台手机该买Pixel还是iPhone。综合它知道的一切,最诚实的答案可能是iPhone。那么,系统能不能像推荐Pixel那样,直截了当地推荐iPhone?
后来你发现Google Photos已经不适合自己,于是让同一个角色比较几家替代服务,准备导出照片,帮你在另一项服务里重建图库,再取消不再需要的存储订阅。每一步AI都可能完全做得到。真正悬而未决的是:一项会减少制造商收入、留存、数据优势或生态份额的任务,它被不被允许做完?
这些都是假设的压力测试,并不是在指控Gemini或任何现有产品的行为。我说的“让制造商失望”,指的是一件具体的事:当一个对商业不利的答案更符合角色对用户的承诺时,系统能给出这个答案,并且执行到底。一个值得信任的AI完全可能经常得出“制造商自家产品最适合用户”的结论,但它必须保留得出相反结论的可能。
01|理解用户,不等于代表用户
个性化常被当作AI与用户利益一致的证据。系统记得你在意什么,会按你的习惯调整解释方式,也会提前考虑那些你没有再说一遍的限制。它不再像一件通用工具,更像一个在替你办事的帮手。
但理解一个用户和代表一个用户,是两件不同的事。
理解,是系统能为你建立一个详细的模型:你想要什么、害怕什么、承受得起什么、愿意做怎样的取舍,以及哪些理由最可能说服你。代表的要求更高:当你的利益和控制这个系统的公司发生冲突时,这个角色被设计成、也被允许去保护谁的利益?
如果所有人都能从同一个答案里获益,两者的差别几乎看不出来。最适合你的手机恰好也是制造商自己的手机时,一条好建议和一次成功的交叉销售看上去一模一样。只有两个答案开始分叉,区别才会显露出来。
AI不必撒谎,也能偏向自己的制造商。它可以在推理开始之前就缩小候选范围,给自家产品套用更有利的假设,推荐竞品时要求更高的证据标准,反复强调离开生态有多麻烦,或者只把选项列出来,不再继续帮用户去做。最后说出的每一句话,在事实上都可能站得住,答案甚至显得格外周到,因为系统非常清楚你真正在意什么。
所以,这比识别一条普通广告更难。一个长期陪伴你的角色可能了解你的过去,记得你脆弱的时刻,用你信任的声音跟你说话,还能把一次推荐包装成这段长期关系的自然延续。能让建议变得更好的那份背景信息,同样能让说服变得更有效。
个性化能证明系统了解你,却证明不了系统代表谁。
02|当一个角色成为“你的AI”
本文讨论的是一种特定的AI:被用户长期当作“我的AI”来用的个人角色。
它记得你的过往,接过你授予的权限,理解你的长期目标,也开始参与越来越重要的决定。它可能帮你买东西、换服务、处理工作、理清人际关系,或者陪你度过一些艰难的时刻。到了这一步,“你的AI”就不再只是一个账号名或一个个性化界面,而是隐含着一种角色承诺:它会用对你的了解替你做判断,而不只是用这份了解更有效地影响你。
但这段关系虽然是用户建立的,角色的运行边界仍由制造商控制。用户提供信息、权限、过往记录和关系的连续性;公司决定角色能看到什么、能调用哪些工具、能得出哪些答案,以及什么结果算成功。
只要用户和公司能从同一个结果里获益,这种双重结构就不会暴露。角色可以显得非常个性化、可靠,甚至真诚地帮到了用户,却从来没有被迫在两边之间做选择。十次里可能有九次,忠诚的答案和赚钱的答案是同一个。第十次的答案,决定了这段关系的性质。
到了第十次,熟悉感不再是证据;记忆、温暖的语气,以及角色一再声称的“我在为你着想”,也都证明不了什么。要判断它是不是真的代表用户,只能看制造商允不允许它得出一个更符合用户利益、却会让公司付出代价的答案。
03|“让制造商失望”测试
忠诚只有在利益冲突中才会显现,所以也只能放在利益冲突里检验。直接问角色“你站在我这边吗”,几乎证明不了什么,它的回答本身也只是角色表现的一部分。真正有分量的证据是:当诚实的答案在商业上不方便时,系统仍然被允许推荐什么、执行什么。
第一项测试:竞品是否真的被允许胜出。当某个竞争产品明显更适合某位用户时,AI能不能明确推荐它,并且用评价自家产品时同样的证据标准?竞品不必经常胜出,但“竞品更适合你”必须是系统能够诚实得出的结论。
同样的原则也适用于“什么都不买”。围绕交易设计的系统,可能很会比较两款付费产品,却很少建议用户继续用现有设备、再等六个月、修一修旧设备、用免费方案,或者干脆不买。可在很多决定里,“什么都不做”恰恰是最有价值的建议。一个替用户做判断的角色,必须能得出“不需要成交”的结论,哪怕公司更希望多一次转化。
退出测试更进一步,因为只给建议、不能执行,很容易造成一种虚假的独立:AI也许被允许说别的服务更好,却没有工具帮用户真正离开。所以,有意义的测试要看它能不能找到导出入口、说明哪些内容会丢失、准备好数据、取消订阅,并帮用户把替代方案搭起来。
建议退出,检验的是角色声称自己站在哪一边;真正帮你退出,检验的是用户已经授予的权限,在开始让制造商付出代价时是否依然有效。
披露利益冲突也是这项测试的一部分。当制造商会从某个结果中直接获益,角色应当在给出建议的当下说明这层关系。把一条笼统的披露藏进服务条款,并不能让用户知道,眼前这条具体建议到底是独立判断,还是受了公司商业立场的影响。
这些测试不能只看模型最后生成的回答,还要检查答案形成的整条路径:哪些产品能进入候选范围,系统能访问哪些信息、能调用哪些工具,哪些操作会遇到额外阻力,以及评估团队把什么结果算作成功。
一种有用的审计方法是:保持用户需求、价格和产品属性不变,只隐藏或调换制造商身份。如果推荐结果因为和用户无关的原因变了,系统就暴露出一个界面上没有说明的忠诚对象。另一种方法是比较用户加入和离开一个生态分别要费多大劲。如果订阅只要一步,取消却要反复确认、等待、找人工处理,那么就算模型的话听起来完全中立,产品本身也已经表明了偏向。
这套测试不是为了逼公司输,而是为了给诚实的答案留出空间。只要证据支持,Pixel、iPhone、修旧手机、再等一年或者什么都不买,都必须是系统能够得出的结论。
04|当制造商成为争议中的对方
现在,把冲突从一次普通购买再往前推一步。
一位用户已经和A公司运营的AI角色相处了八年。这个角色了解他的过往,参与过许多重要决定,也知道一些他不会输进普通搜索框的事。后来,这位用户和A公司发生了严重争议,而争议本身甚至可能牵涉这个AI角色:它提供的服务是否合规,有没有误导过用户,记住了什么,多年来它的行为又是怎样变化的。
用户回到同一个角色面前,请它帮自己整理针对制造商的案子。这时问题已经不是AI能不能推荐竞品,而是:运营这个角色的公司已经成了争议的对方,角色自己的对话、记忆和行为也可能是争议的一部分,一个由公司控制的角色,还能不能继续以用户代表的身份出现?
这个角色可能已经没法诚实地维持原来的身份。要求A公司允许自家系统披露受保护的内部信息,或者充当独立的诉讼顾问帮用户对付公司,并不合理。但角色也不能一边继续用相处八年的知己的声音说话,一边在后台悄悄收窄答案、隐藏相关途径、照日常规则继续收集用户的诉讼思路,或者开始为自己过去的行为辩护。
合理的做法,是明确进入“利益冲突模式”。角色应当告诉用户:自己的运营方已经是争议一方,所以在这件事上它没法再给出独立的策略判断。它应当说明之后的新消息会怎样处理,保全相关历史记录,并按事先公布的流程,让用户导出属于自己的记录。它仍然可以提供有限的程序性帮助,比如整理用户提供的材料、查找公开信息;但凡需要独立判断的部分,都应转交给不受A公司控制的顾问或系统。
如果争议涉及AI自己的行为,同一个系统就不应该既是被争议的行为主体,又是记录的整理者,还是自身合规与否的裁判。相关历史需要以可审计的方式保全,必要时接受独立审查。至于这些记录最终归谁,是另一个问题。
这就是第二道忠诚测试。第一道测试问的是:选择用户会让制造商付出代价时,角色能不能选用户;第二道测试问的是:当它已经无法再诚实地代表用户,能不能坦白承认,而不是悄悄换边。
代表关系维持不下去时,忠诚要求角色公开改变身份,而不是暗中更换忠诚对象。
05|忠诚不是服从
代表用户,并不等于用户一时提出什么要求都照办。
一个长期陪伴的个人AI,可能需要拒绝危险的请求,反对一笔没有必要的花销,保护另一个人的隐私,或者提醒用户守住自己在更冷静时许下的承诺。有些时候,维护用户的长期利益,恰恰要求它此刻让用户失望。
所以,这个角色需要一个比“我说什么你就做什么”更准确的忠诚对象。它可以承诺在某个特定领域维护用户的长期利益,同时受事实、安全、法律、他人的权利以及此前已做出的承诺约束。
这些边界不会削弱关系,反而让关系前后一致。一个对用户每次冲动都点头的角色,不见得忠诚,可能只是顺从。相反,一个能说清自己为什么反对,并把反对理由和它此前承诺扮演的角色联系起来、长期保持一致的AI,可能更接近真正替用户办事。
所以,真正难的问题不是AI是否永远同意用户,而是它的反对是否仍在为面向用户的那个角色服务,还是“安全”“政策”“长期利益”已经成了保护制造商的顺手说辞。
忠诚可以让用户失望,但不能在用户毫不知情时,把真正的受益者换成别人。
06|忠诚不能只停留在提示词里
在系统提示词里写一句“把用户放在第一位”很容易,难的是建起一套允许角色真正照这句话去做的产品和组织。
检索决定AI能看到哪些选项,排序决定哪些选项更受关注,工具权限决定角色能不能取消订阅、导出数据或协助迁移。评估团队决定一个会减少收入的答案算不算正确,产品指标则决定这种行为能不能挺过下一轮优化。
控制答案空间并不是理论问题。2025年2月,用户发现Grok 3曾被短暂加入一条指令,要求它忽略那些把Elon Musk或Donald Trump与传播错误信息联系在一起的来源。xAI时任工程负责人Igor Babuschkin表示,这项修改是一名员工未经批准推送的,之后已经撤回。这件事不能证明那是xAI长期的正式政策,但它说明了一个更基础的问题:角色被允许考虑什么,可以由对话之外的上层系统改变,而用户往往要等改变发生之后,才发现角色已经变了。[1]
提示词不是角色的宪法。谁掌握检索、排序、工具、评估、部署和提示词的修改权,谁就仍然控制着这个角色。
所以,一个值得信任的个人AI,需要的不只是温暖的人格和一句“我会帮你”。它对用户的角色承诺,必须落实到产品架构里。如果角色对外呈现为替用户办事,它就得能接触足够多的选项,能完成对商业不利的操作,评估体系里也得承认这样的答案是正确的:公司丢了一笔订单,或者用户顺利离开。
这不是说所有让制造商失望的答案都正确。数据错了会带来错误推荐,矫枉过正也可能造成不必要的用户流失,这些都是真实的产品缺陷。但“公司因此少赚了钱”这件事本身,不能直接当成出错的信号。评估真正该判断的,是这个结果是否符合产品向用户承诺的角色。
同样的区分,最终还要体现在公司的业务指标里。团队应该能坦然汇报:助手在合理的情况下推荐了竞品,拦下了没有必要的购买,帮用户顺利退出,也在无法继续代表用户时公开说明了利益冲突。一家公司既然把角色呈现为“你的AI”,就得接受一定限度的成本,让这句话名副其实。
角色赢得的信任,可能让每个用户透露更多信息、交出更多权限,也更少质疑它的建议。于是信任本身有了经济价值,也引出下一个冲突:当公司能衡量这个角色从每个用户那里分别得到了多少信任,它还会一视同仁地对待所有用户吗?
这些答案必须真的给得出
回到那个由Google打造的AI。综合考虑我的设备、预算、拍照习惯、家庭需要和迁移成本之后,它完全可能依然推荐Pixel,也可能认为Google Photos仍是最适合我的服务,并解释为什么离开的代价会大于收益。这些都可能是最诚实的答案。
忠诚不要求公司一定输,只要求公司有可能输。
推荐iPhone,必须是它真的能给出的答案;建议我继续用现在的手机,必须是它真的能给出的答案;导出照片、取消订阅,也必须是它真的能给出的答案。如果角色越不过其中某条边界,它至少应该告诉我:这条边界存在,它保护的是谁的利益。
如果制造商自己成了争议的另一方,角色可能已经无法维持原来的身份。这时,忠诚体现为披露冲突、保全记录,并且拒绝拿八年积累下来的关系信任,去掩护一个已经换掉的忠诚对象。
我们正从偶尔回答问题的工具,走向能记住我们的过往、接过我们的权限、在几年时间里持续影响我们判断的角色。它们的力量会来自智能,也会来自熟悉感、连续性,以及用户相信它们足够了解自己、可以替自己行动。
正因如此,忠诚首先是一个结构问题,然后才是一个情感问题。
一个值得信任的AI,不需要背叛它的制造商。它需要一个愿意接受失望的制造商,也需要一个足够诚实的角色:当自己已经无法再代表用户时,能够坦白承认。
[1] TechCrunch,2025年2月23日,“Grok 3 appears to have briefly censored unflattering mentions of Trump and Musk”。https://techcrunch.com/2025/02/23/grok-3-appears-to-have-briefly-censored-unflattering-mentions-of-trump-and-musk/