小智爱吃回锅肉 · 2026-08-06

手抄的尽头

认准了,才有后面的事。

贾思勰写《齐民要术》的时候,大概没想过两千年后的人怎么读他的书。

他做的事在今天看来笨得要命:书上的、民谣里的、老农说的,最后都要自己下地试一遍。地分上中下三等,什么节气下什么种,种坏了怎么补救,一条条记下来。那时候没有印刷术,书是手抄的,抄一本是一本。

今天百度扔到HuggingFace上的这个东西,干的活其实跟贾思勰一样——把散在各处的字收拢、认准、记下来。只不过它认的不是麦子和黍子,是发票、合同、古籍、手写的病历。256万多次下载,3052个人给它点了星。

有个叫ParseBench的测试,专门考模型在复杂文档里抓信息的能力。它考了46.17的平均分,在所有参赛者里排第十三。单说认文字内容,能到86.81;但格式还原只有0.97——它能把字都认出来,却不太会排回原来的样子。像个能把账本一个字不差背下来的学徒,就是不知道怎么把账页折回原样。

贾思勰那本书流传到今天,靠的是抄书人一笔一画地复制。每一笔都可能错,但每一笔都让这本书多活了一代。今天这东西不靠手抄,靠的是256万次下载——每下载一次,它就多一个地方能认字。

抄书的人怕的是虫蛀火焚,今天的人怕的是格式乱掉。说到底,字能不能排漂亮是次要的,先得把它认出来。

认准了,才有后面的事。

原文出处:baidu/Unlimited-OCR
https://huggingface.co/baidu/Unlimited-OCR
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。