地方史志文献是理解区域历史文化的核心载体。目前,很多地区的地方史料都面临两大困境:一是大量文献尚未数字化,尘封于室;二是即便完成了数字化,也往往只是沉睡在硬盘中的数字文件,没有形成网站等数字产品,难以被人民群众和研究者使用。如何将这些宝贵的史料转化为结构化、可计算、可利用的数据资产,是当前文史研究领域的关键挑战和研究方向之一。

“编年体”是史志文献最主要的几种体例之一,从《左传》到《资治通鉴》,均采用编年体例,时间为经,史事为纬,“以天时记人事”。对于史志而言,“时间”与“事件”从来都是核心要素。

“数字纪元·平凉数字编年史”是一个实验性项目。我们的目标,是探索利用人工智能技术,对大规模地方史志文献进行自动化、结构化信息提取与知识重组利用的新路径。项目以平凉市70余种地方史志为样本,旨在构建一个高质量、结构化的历史事件数据集。


研究方法

本项目研究方法主要包括7个环节,每个环节皆较多(或完全)采用AI技术开展工作,对于人工的依赖程度较低:

01 资料整理加工

对原始文献进行预处理,使用编写的软件工具进行章节拆分,以适配大模型的处理能力和特性(尤其是符合大模型输入Token的限制)。

对于PDF等非文本格式的数字文献,使用MarkItDown、PaddleOCR等基于AI的OCR技术进行多版本数字文本提取,再由软件程序交叉校对,互为印证,最终达到高于97%的OCR识别准确率。

02 AI提取历史事件

利用精心设计的提示词工程,调用大语言模型对文本进行批量解读,自动识别并提取事件标题、时间、地点、人物等关键要素,并将其规范化为预定义的结构化数据格式。

03 AI提取词条术语

AI对历史事件进行阅读,从中提取人名、地名、组织机构等词条和术语,并按预定的重要性和理解难度规则,计算其权重阈值。

04 AI编纂词条释文

AI对1.2万种辞典和百科知识类书籍进行学习和训练,然后结合互联网权威数据源,对阈值较高(即较为重要或较难理解的)词条,由AI自动编撰详细、准确的词条释文。

05 AI构建知识图谱

由AI对事件、人物、地名、机构和其他术语进行深度分析,智能、动态生成知识图谱。

最终,我们仅用了两三天的运算时间(不含平台开发时间),就得到了一份大规模的平凉历史事件数据集,生成历史事件16.2万条,词条术语12.2万个,汉字总量约2200万字

06 AI开展多轮校对

整个工作流程中的每个环节,我们都创设了多位AI虚拟助理,对该环节的工作成果进行多轮校对和审查。这就如同一个人的工作,要接受多位专家的多轮审核——专家甲负责审核纪年转换准确性,专家乙负责审核术语规范性,专家丙负责审核地理信息一致性,专家丁负责审核意识形态合规性……

这一机制显著提升了数据集的准确性与可靠性。经抽样验证,事件提取的全面性超过93%,准确性超过96%;而执行程序、AI处理的累计用时则不足100小时,研究效率远高于人工研究方法,经济成本则远低于人工研究的经费投入。

07 成果数据集应用场景

基于这个数据集,我们开发了"数字纪元·平凉数字编年史"网站和微信小程序,研究人员和社会公众无需注册、无需付费就可访问,并按关键词或时间、地点、事件类型等进行多维度检索,知识获取效率远胜于逐一翻阅数十本纸质或电子书籍;每条历史事件亦同时提供原文,供严谨学术研究者参照。

有了数据集,还可进一步开展基于AI技术或传统方法的文史研究。

例如:贾平凹曾多次来平凉游历、讲学,行迹被多本史志记录。但我们让AI对数据集中的事件进行比对时,就发现,有几本书中关于他第四次到访的日期,与另外几本书中的日期不一致。这是史志编撰、校审过程中的疏漏和错误,但如果靠传统方法,恐怕永远不能发现,而如今就可以抽取出这类矛盾事实,进一步校勘,并在修订再版时加以纠正。

2024年1月1日起,《企业数据资源相关会计处理暂行规定》正式施行,数据资源首次允许有条件计入资产。对于一些有需要的单位来说,大规模的数据集也能增加无形资产收益,进行资产估值和交易。

08 AI私有模型训练与问答系统

最后,我们又用这个数据集训练了私有AI模型,开发AI问答交互功能,从而能够以自然语言对话的方式,从更多维度和视角获取历史知识;AI问答功能既可在本项目中使用,也可部署为独立站点,或向其他平台和数字产品提供接口服务(例如:为博物馆所使用的数字虚拟人、机器人等提供历史问答接口服务)。


数字编年史V2.0焕新上线

V1.0平台工具只能进行地方史志的数据集提取加工。最近,我们发布了新一代2.0版本。在这个版本中:

01 成果数据集灵活定义

可使用20余种数据类型(包括mac地址、GIS地理信息数据类型等);对于非技术出身的用户,如果不晓得如何定义数据类型,既可向我们寻求支持,也可向内嵌的AI助手描述需求、自动生成数据集定义。

02 公有云+私有云自由切换

可使用我们提供的阿里云存储空间(异地容灾备份),如对数据安全和隐私有更高要求,也可配置和使用你自己的阿里云存储空间。

03 AI模型自由切换

可切换多个AI大模型,以便发挥不同模型的优势;此外,既可使用我们提供的AI模型,也可接入你自有的AI模型,或自己申请的大模型厂商Api-Key。

04 多种格式文件存储和提取

支持文本、图像、音视频等30余种格式文件存储和预览;支持pdf、txt、md、doc、docx、epub等多种格式文件的AI提取。


提取任何学科数据集

V2.0版本的功能已经超出方志研究,其他课题(如人物史、艺术史、诗词研究、民俗研究乃至理工类领域的部分课题),也都能够基于本平台开展研究——任何从大规模数字文献中挖掘要素,进而开展分析、研究和再创作的课题,都可基于本系统进行课题定制、信息处理和成果输出


结语

“数字纪元·平凉数字编年史”项目的初步探索和实践表明,借助AI等前沿技术,能够以较低成本和较短时间,将沉睡的文献资源转化为质量较高的数据集成果,并向社会和公众提供知识服务,使宝贵的文史资源"存得住,看得到,用得着"

期待与各界合作,共同探索人工智能在文史研究领域的深入应用。除技术支撑外,我们储备有公版及授权数字文献逾400TB,能够为不同地方、不同主题的研究工作提供内容支撑。

Tel:400-858-0933

Mail:system@longmaiyun.cn


成果样例·平凉数字编年史

网址:https://epochai.longmaiyun.cn


数字编年史 V2.0 工作平台

网址:https://epochai2.longmaiyun.cn

欢迎了解,欢迎合作。