来源:改革网作者:杜永乐时间:2026-10-08
一册出版于几十年前的方志,纸页发黄,边角脆得不敢用力。如果它损毁,里面记载的那个名字就真的没了。这不是个例——大量地方文献正面临同样的命运。地方文献数字化,表面看是技术问题,深层看是公共文化服务领域一项亟待推进的改革。
一、问题的两重紧迫性
地方文献——地方志、族谱、契约文书、老报刊——绝大多数仍以纸质形态存世。纸张的自然老化不可逆转,而各地保存条件参差不齐。这些文献还分散保存于图书馆、档案机构、高校与民间收藏,至今没有统一目录——甚至很难回答一个最基本的问题:一个县究竟存有多少种地方文献?
利用端的门槛同样明显。传统条件下,查阅依靠人工逐页翻检;同一个人名、同一件事,可能散见于志书、族谱、报刊多处,交叉比对成本极高。结果是,大量地方史料长期“存而少用”——它们没有消失,只是很难被找到、被使用。
技术本身已有发展,不过和适配仍有距离。2026年7月,安徽师范大学历史学院的徽学数字人文暑期训练营讲座上,南京大学数字史学研究者坦言,通用大模型对徽州手写地契、族谱的识别精度有限;同时指出,AI应用于史学研究存在"史料幻觉"、虚构文献来源,难以支撑超长篇史料分析。《安徽日报》2026年9月15日理论版《徽学大模型在民间文献识别中的创新应用》一文亦指出,民间文献中俗写字、自造简化字大量出现,行草混杂,常规识别模型"难以适配"。
二、三个层面的约束
从技术角度说所涉的约束是识别性的。地方文献与现在常见的印刷物相比要复杂得多:字体有竖排、异体或繁简并存的情况;书写多为毛笔所为、行草或带批注的体例;所用材料本身可能污旧、洇墨、缺角;纪年习惯上用干支或民国式日期,要另行转换;格式上少标点、少分段、不整齐。由此可知:一般性识别方法对地方文献的处理尚不能满足研究需要,应按具体文献类型作相应领域的优化设计。
从机制的角度说,有三个“缺乏”。第一是缺统一标准。目前各地文献大体上各自保存,又没有统一的有关数据或元数据的采集办法,因而所用数据结构、检索形式及平台接口不能互相衔接,整合多单位资源有一定困难。第二是缺持续投入。文献数字化要走长路:扫描之后还要做标注、校订、建库、更新才能得到实际成果。按此流程看,后期各阶段的投入较前期更难落实——不是简单的一次性项目,而是要不断依靠人手和资金加以维持。第三是缺横向协调。地方文献的数字化要调集文化、档案、教育、志书诸项资源,若横向配合不完善,就可能让同类材料多次出现、有限资源无法集中使用。
人才方面是根本性的制约因素。现在所遇的核心矛盾是:有技术的人少懂史料,通史料的人又不擅长技术。文史方向上受过训练的人可以作考据、识异体、知编排体例,但一般不会用数据或调参来解决问题;技术方向上训练有素的人能设模型、建系统,却未必了解家谱、方志及契约诸项规范。合作因而发生困难——要说明清楚技术需求不容易,要判断结果的可靠性也不简单。有关地方文献的数字化最后能否成功,不能只靠算法,而应看是否有兼具史识与技术的人才储备。
三、三条可操作路径
其一,校地协同,共建文献整理实践平台。可以由地方高校与公共文化机构合作,建立文献标注与整理的实践平台:高校提供学分认定与教师指导,地方机构提供文献资源与业务支持,以项目制方式推进,一期处理一批文献,形成可复制的操作流程。对地方而言,缓解了人力与经费压力;对高校而言,文科生获得技术训练的真实场景,理工科学生接触真实的人文材料;对学生而言,则是难得的跨学科实践经历。
其二,分级推进,不做"全量数字化"。 地方文献类型庞杂、数量巨大,全量深度数字化在成本上不可行,容易因战线过长而难以持续。可以考虑按优先级分级:地方志、族谱、珍稀契约文书优先深度数字化,做到扫描、标注、建库、校对一体;老报刊、信札、影像资料做基础数字化,完成扫描、识别、索引即可;重复副本与通用出版物仅作保存性影像存档。分级推进可以先形成一批可用成果,产生示范效应后再滚动扩大。
其三,人机协同,明确边界,防止史料失真。 技术介入越深,边界越要讲清楚:AI做初筛,负责批量识别、分类、格式转换;人工做校验,负责纪年换算、异体字核准、内容比对,判断权始终在人;检索结果绑定原始书页影像,可一键回溯原文。技术的作用是提高效率,不是替代判断。史料考据的最终责任,必须由人来承担。
结语
所谓的地方文献数字化,从表层看是技术问题,实际是治理问题。识别率可以优化,模型可以适配——技术已不构成主要障碍。真正的难题是:标准由谁定、投入由谁保障、成果由谁维护。
我又想起书架上那一册。那些躺在架上的志书不会等人,其中的每一个名字,都曾经是一个人的一生。( 芜湖学院 杜永乐)