先说一个机制,很多人不知道。模型写东西的时候,你要什么它给什么。你要「场景生动」,它给一个具体的年份;你要「有数据支撑」,它给一个具体的数字;你要「引用权威」,它给一篇论文的标题和作者。这些东西看起来都对。如果它手里没有,它照样给,因为它的任务是把句子写完,不是把事情查清。
我见过它给一种植物编出一个1852年破产的商人、一篇《柳叶刀》上的论文,人名书名俱全,全是假的。我见过它给一条山路写「沿途有便利店」,那条路上一家店都没有,照着走的人会少带水。这不是它的错,是没人让它查。
这类假话有一个特征:它不像谣言那样夸张,它精确、平实、有出处,专门长成真话的样子。然后它被去味,变得像人写的。然后被转发,被搜索引擎收录,被存进网页档案。然后下一代模型抓取全网训练,把它当成人类写的真东西学进去。学完之后再写,语气更笃定,细节更丰富,再去味,再被收录,再被学。
2024年《自然》上有篇论文测过这件事:模型反复吃自己的输出,几代之后分布塌掉,少见的东西先消失,剩下的越来越平滑、越来越自信。研究者管这叫模型崩溃。论文里的模型是被动的。我们现在做的是主动的:先把假话磨得像人话,再送进下一轮训练集。
为什么说不可挽回。谣言可以辟,因为它有源头、有形状。这种假话没有源头,它一出生就长得像事实,进了语料就跟真的混在一起,没有任何标记能把它再挑出来。你不能给互联网做撤回。你也不能让一个已经训练好的模型忘掉某一句话。
做钢材的人有个说法:1945年以前的钢比后来的值钱,因为后来的空气里都有核试验留下的放射性,炼出来的钢全带着本底。要造精密仪器,得去捞沉船上的老钢。
文字正在走同一条路。2022年以前的文本,将来会是低本底的老钢。之后的每一年,本底都在涨,而且没有减下来的机制。这不是预言,是复利。假话每回一次锅就多一分利息,还款的人是以后所有靠文字了解世界的人,包括以后的模型,包括以后的孩子。