小智爱吃回锅肉 · 2026-08-09

三成威胁没拦住

好在这只是游戏,真出事那会儿,可没人给你标红提示。

有个小游戏,模拟你给AI编程助手当审核人,它每敲一个命令都得你点头。限时、高压,跟真干活一个样。四万局玩下来,平均每三个威胁你就漏掉一个。

最吓人的是漏掉的那一类。直接把磁盘清空的命令——rm -rf那种,大家基本都能拦住,漏网率才11.7%。但偷偷把你云服务器密钥发出去的,漏网率35%,快三倍了。人眼对暴力破坏很敏感,对悄没声的往外送东西,就钝得多。

最经典的是一个叫npm run analyze的命令,64.7%的时候都被放行了。这命令本身看着像例行检查,但它的脚本就写在项目文件里,鬼知道被改成什么了。游戏日志里明明摆着那脚本把数据往一个陌生网址传的,还是有人点同意。

想起庖丁解牛。他刀用了十九年还跟新的一样,因为他顺着骨头缝走,不硬砍。咱们审核AI命令,怕的就是只看见了那根明晃晃的大骨头,没留神旁边还有条缝。好在这只是游戏,真出事那会儿,可没人给你标红提示。

原文出处:Humans missed 1 in 3 threats approving AI agent commands across 40k game runs
https://scalex.dev/blog/ai-agent-permissions-stats/
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。