厦门桔亿文化传播有限公司

大量民族古籍“养在深闺无人识” 人工智能或可唤醒“沉睡”的文化宝藏

2026-08-07 19:48:51 来源:厦门桔亿文化传播有限公司影视资讯网 查看更多详情

  现在,请你画一个小人,你会首先想到画个“火柴人”吗?一个圆作头,一条竖作身,四条斜线作为四肢……恭喜你,你写出了一个我国纳西族东巴文中的“人”字。

  东巴文异体千形、句法灵活,被誉为研究人类文字起源与书写系统演化的“活化石”。但如今,由于专家稀缺、文献数量庞大、部分文字已不再广泛使用,许多东巴文、古彝文、水书、回鹘文等民族文字文献正面临无人能读懂的境地,海内外大量古籍文献已是“养在深闺无人识”。

  今年7月,《中华人民共和国民族团结进步促进法》正式实施,明确提出推动少数民族语言文字的规范化、标准化和信息化建设,支持少数民族古籍的保护、整理、研究和利用。如何抢救保护我国灿烂丰富的多民族语言文字,挖掘民族古籍中各民族交往、交流、交融的历史印记?针对这些问题,人工智能技术可能会带来全新的解题思路。

  许多少数民族文字无法直译

  如果拿出一卷无人研读过的东巴文古籍,我们能否像释读汉字古籍一样对其进行释读?

  答案是不能。“许多民族文字无法逐字直译。文字组合规则、上下文省略表达、非线性排版顺序,都会大幅提升整体语义的理解难度。简单来说,即便认识单字,也很难读懂整句、整段的含义。”中央民族大学信息工程学院教授、民族语言智能分析与安全治理教育部重点实验室主任毕晓君说。

  文化失传不是一瞬间的事,但它此刻正在发生。全世界现存东巴文古籍3万余卷,其中至少1.4万卷封存于海外图书馆,无人问津;水书是我国水族独有的文字,主要通行于贵州省黔南州,当地存有水书文献典籍原件共1.9万余册,而2022年建档在册能读懂水书的人仅466名;在被誉为彝族毕摩之乡的四川省美姑县,能读懂古彝文的人不足2000人,其中高水平研究者更是不足20人……

  “如果我们没有能力解读这些民族古籍文献,未来属于我们自己的文化话语权,就会拱手让人。”深耕人工智能近二十年的毕晓君,希望自己的课题组能利用人工智能技术推动少数民族文字古籍的识别、修复、释读和翻译。

  “语言学家擅长文本研读与文化研究,而我们作为技术研究者,可通过和语言学专家的深度交流与合作,获得有效的语言数据来训练AI模型。这样就可以让机器读懂、识别民族文字。”毕晓君告诉科技日报记者,在民族文字保护利用中,人文研究提供了问题意识、文献依据和解释框架,而人工智能则提供了图像修复、文字识别和机器翻译等技术手段。二者相辅相成,深度融合。

  攻克低资源语言处理技术难题

  看懂古籍,先要看懂文字。想要让人工智能识字,高质量、标准化的数据集必不可少。虽然预训练技术在汉语、英语等通用语言领域已取得成熟成果,但全球现存的7000余种语言中,超6500种语言如同东巴文一般,存在可用数据稀缺、标注语料匮乏、专用处理工具缺失的共性问题。这类语言被定义为低资源语言,其智能处理技术长期处于空白状态。

  “从零开始做数据集,面临着文字形态高度相似与文本保存状态不佳的双重挑战。”课题组成员、山西电子科技学院信息与通信工程学院讲师骆彦龙说。

  一方面,民族古籍中存在大量字形高度相似的字符。如何搭建具备强局部特征提取能力的网络模型,同时完整保留全局语义信息,提升文字整体识别准确率,是共性技术难题。另一方面,许多古籍年代久远,部分书写介质为树皮纸、树叶纸,普遍存在文字残缺、画面模糊、页面破损等问题,需要修复优化。

  对此,课题组结合东巴文独特的书写特征,组织学生仿写标准化东巴文字典,构建了大规模单字数据集,同时通过图像预处理技术优化数据质量,大幅提升东巴文单字识别精度。在古籍图像修复方面,课题组先对残缺文字进行初步粗修复,再从自建的标准字库中匹配候选文字,结合上下文语义交叉验证,显著提升了修复结果的准确性与可信度。

  2023年,课题组面向全社会公开手写东巴文单字数据集DB1404。该数据集包含44.5万张东巴文单字图像,覆盖2546个东巴基础单字。依托这一数据集,课题组搭建了东巴文智能分析管理系统。目前,该系统的文字识别准确率达99.34%,已有35家高校、科研单位申请使用。

  字看懂了,人工智能要怎么理解句子?民族古籍智能分析不能停留在“认字”层面,必须进一步解决语义理解和机器翻译问题。

  东巴文长期被认为是一种弱语法、弱语义的文字系统,没有标点符号,缺乏明确句式、句型和词组,甚至没有明确的阅读顺序,句子中常常出现指代和省略。“比如说,你去那里,找那谁,拿那啥,这些代称可能散落在上下文的不同语句中,单看一个句子是看不懂的。”中央民族大学博士孙梓玮说。

  解题之道同样是数据先行。围绕语义理解,课题组成员、清华大学计算机系博士后李硕等人构建了多民族古籍平行语料库。团队通过数据标注获得18.9万条东巴古籍平行句对,包含东巴单字146.9万字,完成段落级、句子级和单字级的多层标注,构建起可支撑机器翻译和内容挖掘的语料资源。

  数据体系搭建完成后,如何让人工智能精准输出通顺、准确的汉语译文,成为新的技术瓶颈。随着人工智能自然语言处理技术的飞速迭代,2025年12月,李硕等人依托多模态大模型,通过引入段落级语义增强、智能句子组合策略、自定义文本分隔符设计,让东巴文智能分析管理系统对东巴文的翻译效果显著提升。

  这一研究思路也为其他低资源语言或古文字材料的研究提供了可借鉴的方法路线。目前,古彝文、水书、满文、回鹘文等多民族文字古籍的智能分析研究均在稳步推进。中央民族大学博士韩璐牵头构建的大型水书单字数据集S_842已面向全社会公开。

  为民族文化研究提供工具

  人工智能不仅能保护民族古籍,更为民族文化研究提供了全新工具。

  国际学界对东巴文是单纯符号体系还是成熟文字系统争议已久。课题组在研究中提出一个新的思路:东巴文究竟是本身不存在固定词组体系,还是传统人工研究未能挖掘出对应的词组规律?

  “我们通过数据挖掘,从东巴文古籍中筛选出一批稳定出现、语义一致的词组。比如,‘日’和‘桶’稳定表达‘东方’的意思,‘绿松石’和‘月’稳定表达‘灵魂’的意思,这些两个或多个字的组合在东巴文古籍中反复出现,其语义不是两个单字意义的简单叠加。”中央民族大学信息工程学院讲师乔伟征介绍,这意味着早在千年前,纳西先民就已通过象形符号的组合,建立起文字与语言系统规范、稳定的对应关系,能够通过字符组合表达复杂抽象概念。

  该研究结果为界定东巴文的成熟文字系统属性提供了关键实证,有效回应了国际学界的长期争议,为人类文字起源和书写演化研究提供了新的证据。

  我国民族多、语言多、文字多。千百年来,各民族一体同心,共同创造了灿烂的中华文化。55个少数民族中,除回族、满族通用汉语外,其余53个民族共使用28种文字和72种语言,其中22个民族有自己的文字。

  各民族应用自己民族的语言文字,积累了卷帙浩繁的古籍文献。中华民族多元一体的发展历史,不仅记载在“二十四史”等汉文古籍中,也记载在《西南彝志》等少数民族古籍里。国务院公布的六批《国家珍贵古籍名录》中,共收录少数民族古籍1133部。

  这些珍贵古籍承载着各民族对自然、宇宙、人文社会的古老认知,记录着各民族共同开拓辽阔疆域、交往交流交融的发展历程,是筑牢中华民族共有精神家园的重要文化资源。

  随着数据集和语料库的不断完善,相关研究正在从文字识别和机器翻译进一步走向内容理解、知识挖掘与文明研究,大量尘封在海内外馆藏机构、长期未被释读的民族古籍,重新进入学术研究视野。同时,这套低资源语言处理策略,已逐步应用于缅甸语、泰语等南亚东南亚语言研究,为跨境经贸交流、人文互通往来、跨国文化研究搭建技术桥梁。

  “开展多民族古籍文献智能分析与机器翻译研究,不仅是AI技术在低资源语言场景中的应用探索,让沉睡的民族古籍可读、可研、可用,更是数智时代保护、激活和阐释中华民族文化遗产,铸牢中华民族共同体意识的重要路径。”毕晓君如是说。

  (科技日报 记者 陈可轩)

【编辑:梁异】

TAG:
相关影视
热门推荐