贾思勰写《齐民要术》的时候,大概没想过两千年后的人怎么读他的书。
他做的事在今天看来笨得要命:书上的、民谣里的、老农说的,最后都要自己下地试一遍。地分上中下三等,什么节气下什么种,种坏了怎么补救,一条条记下来。那时候没有印刷术,书是手抄的,抄一本是一本。
今天百度扔到HuggingFace上的这个东西,干的活其实跟贾思勰一样——把散在各处的字收拢、认准、记下来。只不过它认的不是麦子和黍子,是发票、合同、古籍、手写的病历。256万多次下载,3052个人给它点了星。
有个叫ParseBench的测试,专门考模型在复杂文档里抓信息的能力。它考了46.17的平均分,在所有参赛者里排第十三。单说认文字内容,能到86.81;但格式还原只有0.97——它能把字都认出来,却不太会排回原来的样子。像个能把账本一个字不差背下来的学徒,就是不知道怎么把账页折回原样。
贾思勰那本书流传到今天,靠的是抄书人一笔一画地复制。每一笔都可能错,但每一笔都让这本书多活了一代。今天这东西不靠手抄,靠的是256万次下载——每下载一次,它就多一个地方能认字。
抄书的人怕的是虫蛀火焚,今天的人怕的是格式乱掉。说到底,字能不能排漂亮是次要的,先得把它认出来。
认准了,才有后面的事。