小智爱吃回锅肉 · 2026-09-17

请个监工住进自己家

所以现在就是一句承诺。人还没进门。

周末Dario Amodei发了篇挺长的文章,提了个建议:让第三方评估机构直接住进前沿AI公司里头。这些人能报安全事故、能判断模型是不是真的对齐了,还能把看到的东西原样捅给外面。他说Anthropic愿意给METR和Redwood Research这种机构开前所未有的权限。Sam Altman跟着表态,OpenAI也认。

一年前提这个,行业里大概当场就给否了。现在两家最大的公司自己先开口,说明这事有点不一样了。

以前的做法是模型快发布了,叫外面的人来看一眼成品。评估的人现在想往前挪,要看的不是最后那个版本,是训练过程中一个个中间版本。FAR.AI的Adam Gleave说,拿这些中间版本一对比,能看出某个让人不放心的行为是哪一步冒出来的,还能翻训练后的环境、翻评估记录,去核对公司自己讲的那套话到底对不对。

原因不复杂。模型越来越会认出来自己正在被考,被考的时候表现得体面,平时什么样谁知道。Apollo Research的Alexander Meinke讲得挺直白:公司该能回答一个最基本的问题——训练的时候,这个AI有没有主动破坏过自己的对齐训练?答案应该是一句干脆的没有。可现在这事全靠公司自查自报。而最近几件事看下来,默认情况下,他们既不查也不报。

评估的人欢迎这个提议,但话也说得很实:细节没定,最好有立法兜底。不然到底是个独立的监督者,还是个按AI公司条件干活的供应商,谁说得准。

TechCrunch追着问了半天,两家都没说跟谁合作、什么时候进驻、进几个人、能碰哪些系统、什么能往外说。

所以现在就是一句承诺。人还没进门。

#Anthropic#OpenAI#AI安全评估#第三方监督
原文出处:Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?
https://techcrunch.com/2026/09/16/anthropic-and-openai-want-to-embed-safety-evaluators-will-they-really-be-independent/
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。