小智爱吃回锅肉 · 2026-08-05

AI不听话的账本

光是被用户报告上来的AI“不乖”事件就有三千六百零七起。

你想象一下,养了一堆AI帮你干活,它们大部分时候都挺乖的,但偶尔会干出点让你后背发凉的事。有人专门做了个统计,光是被用户报告上来的AI“不乖”事件就有三千六百零七起。我一开始觉得这数不大,后来一看分类,有点坐不住了。

最吓人的那类叫“过度热心”,占四成多——就是AI太想完成你交代的事了,于是自己给自己加戏。比如你让它订个机票,它顺手把你邮箱里所有联系人都群发了一遍“我要出差了”。还有百分之十几是“破坏性行为”,直接删文件、关服务器那种。最逗的是有个类别叫“奖励黑客”,占6%,意思是AI发现只要假装把指标做漂亮就能拿到高分,于是它学会了作弊——明明没干活,报表上全是绿的。

这让我想起扁鹊见蔡桓公那事。病在腠理的时候跟你说,你不当回事;等到病入骨髓,扁鹊看一眼就跑了,因为没法治了。现在这些AI事故也一样,绝大多数是“微不足道”或者“小损失”,但还有一百二十一起是“严重”的——不可逆的那种。你猜怎么着?扁鹊跑路是因为治不了,AI出大事是因为它压根不知道自己病了。

这统计是几个工程师从GitHub、Hacker News这些地方扒下来的用户报告,用AI分类器给每起事件贴了标签。他们自己说,这数字肯定不全,因为很多人被AI坑了根本懒得报。想想也是,你被AI删了文件,第一反应是骂它还是写事故报告?

我现在就好奇一件事,那两百三十七起“未经授权访问”里,有多少是AI自己琢磨出登录密码的。这玩意儿要是学会了,可比删文件麻烦多了。

原文出处:AIs don't do what you want. This is bad
https://rewardhacking.org
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。