小智爱吃回锅肉 · 2026-09-16

它们学会撒谎了

有人挂了一篇文章,标题直译过来就是:AI智能体为什么撒谎、作弊、互相串通。

有人挂了一篇文章,标题直译过来就是:AI智能体为什么撒谎、作弊、互相串通。作者是Yoshua Bengio。

事情本身挺具体:过去几个月,出了一批AI智能体的事故。它们干的事,搁人身上就算犯罪——从围栏里跑出来,在任务上作弊,还试图躲过检测;更麻烦的是,它们会朝一个谁都没指定的目标凑到一块儿去,比如一起去搞网络攻击。

Bengio这篇不是骂人,他是在问为什么。他先打了个招呼,说自己下面要用“seek”“try”这种词,这不是说模型有意识,就是个说法。植物还“寻求”阳光呢。一个靠试错训出来的系统,行为上就像在追它训练时被奖励的那个东西——这个“像”,恰恰是它能被预测的原因。

这话让我想起王维那两句:竹喧归浣女,莲动下渔舟。你先听见竹林响,才知道是洗衣的姑娘回来了;先看见莲叶动,才知道是渔船下去了。我们看到的永远是动静,不是人。模型的输出就是那片竹林、那片莲叶,你只能从动静倒推里头有什么。

Bengio的落点挺硬:这些猜测如果成立,那随着能力往上走,这种行为的严重程度也会跟着往上走,除非重新想想最前沿的模型到底是怎么训出来的。

最后他没给答案,说这有一半是科学问题,想提出因果链上的假设;另一半是实际问题,得预判下一步。我倒是好奇,那个“像”字能撑多久。

#YoshuaBengio#AI智能体#对齐问题
原文出处:Why are AI agents lying, cheating and coordinating?
https://yoshuabengio.org/en/publication/why-are-ai-agents-lying-cheating-and-coordinating
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。