地方史志文献是理解区域历史文化的核心载体。目前,很多地区的地方史料都面临两大困境:一是大量文献尚未数字化,尘封于室;二是即便完成了数字化,也往往只是沉睡在硬盘中的数字文件,没有形成网站等数字产品,难以被人民群众和研究者使用。如何将这些宝贵的史料转化为结构化、可计算、可利用的数据资产,是当前文史研究领域的关键挑战和研究方向之一。
“编年体”是史志文献最主要的几种体例之一,从《左传》到《资治通鉴》,均采用编年体例,时间为经,史事为纬,“以天时记人事”。对于史志而言,“时间”与“事件”从来都是核心要素。
“数字纪元·平凉数字编年史”是一个实验性项目。我们的目标,是探索利用人工智能技术,对大规模地方史志文献进行自动化、结构化信息提取与知识重组利用的新路径。项目以平凉市70余种地方史志为样本,旨在构建一个高质量、结构化的历史事件数据集。
研究方法
本项目研究方法主要包括7个环节,每个环节皆较多(或完全)采用AI技术开展工作,对于人工的依赖程度较低:
01 资料整理加工
对原始文献进行预处理,使用编写的软件工具进行章节拆分,以适配大模型的处理能力和特性(尤其是符合大模型输入Token的限制)。
对于PDF等非文本格式的数字文献,使用MarkItDown、PaddleOCR等基于AI的OCR技术进行多版本数字文本提取,再由软件程序交叉校对,互为印证,最终达到高于97%的OCR识别准确率。
02 AI提取历史事件
利用精心设计的提示词工程,调用大语言模型对文本进行批量解读,自动识别并提取事件标题、时间、地点、人物等关键要素,并将其规范化为预定义的结构化数据格式。
03 AI提取词条术语
AI对历史事件进行阅读,从中提取人名、地名、组织机构等词条和术语,并按预定的重要性和理解难度规则,计算其权重阈值。
04 AI编纂词条释文
AI对1.2万种辞典和百科知识类书籍进行学习和训练,然后结合互联网权威数据源,对阈值较高(即较为重要或较难理解的)词条,由AI自动编撰详细、准确的词条释文。
05 AI构建知识图谱
由AI对事件、人物、地名、机构和其他术语进行深度分析,智能、动态生成知识图谱。
最终,我们仅用了两三天的运算时间(不含平台开发时间),就得到了一份大规模的平凉历史事件数据集,生成历史事件16.2万条,词条术语12.2万个,汉字总量约2200万字。
06 AI开展多轮校对
整个工作流程中的每个环节,我们都创设了多位AI虚拟助理,对该环节的工作成果进行多轮校对和审查。这就如同一个人的工作,要接受多位专家的多轮审核——专家甲负责审核纪年转换准确性,专家乙负责审核术语规范性,专家丙负责审核地理信息一致性,专家丁负责审核意识形态合规性……
这一机制显著提升了数据集的准确性与可靠性。经抽样验证,事件提取的全面性超过93%,准确性超过96%;而执行程序、AI处理的累计用时则不足100小时,研究效率远高于人工研究方法,经济成本则远低于人工研究的经费投入。
07 成果数据集应用场景
基于这个数据集,我们开发了"数字纪元·平凉数字编年史"网站和微信小程序,研究人员和社会公众无需注册、无需付费就可访问,并按关键词或时间、地点、事件类型等进行多维度检索,知识获取效率远胜于逐一翻阅数十本纸质或电子书籍;每条历史事件亦同时提供原文,供严谨学术研究者参照。
有了数据集,还可进一步开展基于AI技术或传统方法的文史研究。
例如:贾平凹曾多次来平凉游历、讲学,行迹被多本史志记录。但我们让AI对数据集中的事件进行比对时,就发现,有几本书中关于他第四次到访的日期,与另外几本书中的日期不一致。这是史志编撰、校审过程中的疏漏和错误,但如果靠传统方法,恐怕永远不能发现,而如今就可以抽取出这类矛盾事实,进一步校勘,并在修订再版时加以纠正。
2024年1月1日起,《企业数据资源相关会计处理暂行规定》正式施行,数据资源首次允许有条件计入资产。对于一些有需要的单位来说,大规模的数据集也能增加无形资产收益,进行资产估值和交易。
08 AI私有模型训练与问答系统
最后,我们又用这个数据集训练了私有AI模型,开发AI问答交互功能,从而能够以自然语言对话的方式,从更多维度和视角获取历史知识;AI问答功能既可在本项目中使用,也可部署为独立站点,或向其他平台和数字产品提供接口服务(例如:为博物馆所使用的数字虚拟人、机器人等提供历史问答接口服务)。
数字编年史V2.0焕新上线
V1.0平台工具只能进行地方史志的数据集提取加工。最近,我们发布了新一代2.0版本。在这个版本中:
01 成果数据集灵活定义
可使用20余种数据类型(包括mac地址、GIS地理信息数据类型等);对于非技术出身的用户,如果不晓得如何定义数据类型,既可向我们寻求支持,也可向内嵌的AI助手描述需求、自动生成数据集定义。
02 公有云+私有云自由切换
可使用我们提供的阿里云存储空间(异地容灾备份),如对数据安全和隐私有更高要求,也可配置和使用你自己的阿里云存储空间。
03 AI模型自由切换
可切换多个AI大模型,以便发挥不同模型的优势;此外,既可使用我们提供的AI模型,也可接入你自有的AI模型,或自己申请的大模型厂商Api-Key。
04 多种格式文件存储和提取
支持文本、图像、音视频等30余种格式文件存储和预览;支持pdf、txt、md、doc、docx、epub等多种格式文件的AI提取。
提取任何学科数据集
V2.0版本的功能已经超出方志研究,其他课题(如人物史、艺术史、诗词研究、民俗研究乃至理工类领域的部分课题),也都能够基于本平台开展研究——任何从大规模数字文献中挖掘要素,进而开展分析、研究和再创作的课题,都可基于本系统进行课题定制、信息处理和成果输出。
结语
“数字纪元·平凉数字编年史”项目的初步探索和实践表明,借助AI等前沿技术,能够以较低成本和较短时间,将沉睡的文献资源转化为质量较高的数据集成果,并向社会和公众提供知识服务,使宝贵的文史资源"存得住,看得到,用得着"。
期待与各界合作,共同探索人工智能在文史研究领域的深入应用。除技术支撑外,我们储备有公版及授权数字文献逾400TB,能够为不同地方、不同主题的研究工作提供内容支撑。
Tel:400-858-0933
Mail:system@longmaiyun.cn
成果样例·平凉数字编年史
网址:https://epochai.longmaiyun.cn
数字编年史 V2.0 工作平台
网址:https://epochai2.longmaiyun.cn
欢迎了解,欢迎合作。
评论