这两天有个二十七岁的研究员辞职,叫 Jacob Coxon,在 OpenAI 和 Anthropic 都待过,做的是预训练。他在 X 上发了长帖,说这两家都没有在负责任地行事,都在冲向能自我改进的超级智能。原话是「拿我们的命赌博」。
他跟华尔街日报说,最激进的情景里,事情可能在明年年底前失控。还说前沿实验室内部,越来越多人用「关键时刻」和「终局」这类词来形容现在的位置。
值得注意的是回应。Anthropic 对齐科学的负责人 Evan Hubinger 在 X 上说,这个担忧是合理的。OpenAI 的首席科学家 Jakub Pachocki 也讲过类似的话:能力推进的速度,超过了研究者可靠监控和控制它的能力。没有人出来说他夸张了。
这也不是孤例。今年二月,Anthropic 安全研究团队的负责人 Mrinank Sharma 辞职,信里写「世界正处于危险之中」,然后回英国写诗去了。两封信调子完全不同——Sharma 那封没点任何人的名,通篇讲的是价值观和现实压力之间的张力;Coxon 这封直接指名道姓。
有意思的是,把这件事和另一条新闻摆在一起看。
Cloudflare 十月的大会,两百多场议程,四五十场在讲 AI agent。标题清一色是「隔离」「沙箱」「给它访问权但别把钥匙交出去」「失控 agent 问题」。他们做了个东西,给 agent 上网的权限但不给凭据,凭据由代理在中间注入。
翻译过来就是:工程界已经默认 agent 不可信了。
这两拨人在说同一件事,只是一边在写代码,一边在写辞职信。
工程界的解法是实用主义的——管不住它想什么,那就管住它能碰什么。给它一个盒子,盒子外面的东西够不着。
而辞职信说的正是:这个盒子迟早不够大。