FP-THD:历史文档的全页转录

《Pattern Recognition》:FP-THD: Full page transcription of historical documents

【字体: 时间:2026年07月08日 来源:Pattern Recognition 9.1

编辑推荐:

  历史文档中手写和印刷文本的识别由于若干问题仍然是一个持续的挑战。一方面,识别受到硬拷贝文档退化(degradation)的影响。在这种情况下,必须应用降噪(noise reduction)、图像去噪(image denoising)、去模糊(deblurrin

  
历史文档中手写和印刷文本的识别由于若干问题仍然是一个持续的挑战。一方面,识别受到硬拷贝文档退化(degradation)的影响。在这种情况下,必须应用降噪(noise reduction)、图像去噪(image denoising)、去模糊(deblurring)、二值化(binarization)或对比度增强(contrast improvement)等技术来使文本更清晰。有时甚至需要应用文档重建(document reconstruction)技术。另一方面,大多数现代转录工具要么无法识别历史字符,要么将其转换为现代字符,从而改变了原始文本。例如,用于表示长“s”的符号s被错误地转换为“f”,或转换为现代“s”;连字(ligatures)(?, ?)被转换为“ae”、“oe”。然而,在历史文档中,旧字符和特殊符号通常具有应保留的独特含义。在中世纪拉丁文手稿中,波浪号(tilde)()?用作抄写速记形式,通常表示省略的字母或音节,尤其是鼻辅音如m和n,或常见的语法词尾。尽管当前的大语言模型(Large Language Models, LLMs)似乎是实现规范化转录(normalized transcriptions)的有前景工具,其中缩写被修正和扩展以便历史学家和语言学家更好地理解,但古文字学家(paleographers)仍然要求保留原始缩写和视觉特征的外交转录(diplomatic transcriptions),以便对历史文本进行鉴定和断代。此外,外交转录对于准确的信息提取和下游语言学任务(linguistic tasks)也是相关的,因为它们保留了源文本的重要细节。本论文旨在设计一个模块化流水线(pipeline),称为FP-THD,用于历史文档的全页转录,实现字符的忠实保留且无需后处理。该流水线可被视为一个端到端解决方案,因为它涵盖了从页面图像到最终转录输出的完整处理流程。它构建在一个名为ParseNet的模型之上,该模型最初设计用于识别文本行,经过修改后可接受整页图像作为输入并生成整页的转录结果。该流水线的第一步是检测文本行区域并将其裁剪为文本行图像。然后,一个带有视觉变换器(masked autoencoder with vision transformer, MAE-ViT)和词元跨度校正(token span correction)的掩码自编码器处理行图像,以识别每行中的文本。最后,系统对行和区域进行排序,然后重建页面。它生成一个包含布局基线(baseline)的XML文件,以及包含全页识别的Markdown和纯文本文件。
**论文解读:FP-THD——面向历史文档全页转录的模块化流水线**

**研究背景与问题**
历史文档(historical documents)的数字化转录是数字人文(digital humanities)领域的关键任务,但面临两大挑战:一是文档物理退化(degradation)导致图像质量下降,需借助降噪、去模糊、二值化等预处理技术;二是现有光学字符识别(Optical Character Recognition, OCR)工具普遍将历史字符(如长s、连字?/?、缩写符号)转换为现代形式,丢失了原文的学术价值。中世纪拉丁文(medieval Latin)手稿中广泛使用的波浪号(tilde)、缩写(abbreviations)和连字(ligatures)是古文字学家(paleographers)鉴真、断代的重要依据,但当前大语言模型(LLMs)虽能生成规范化转录,却无法满足对外交转录(diplomatic transcription)的要求——即保留原始字符形态和视觉特征。此外,多数端到端OCR系统(end-to-end OCR)在极端噪声和不规则布局下难以追踪错误传播,且缺乏对历史字符的专门支持。为此,研究人员提出了一种模块化流水线FP-THD(Full Page Transcription of Historical Documents),旨在实现无后处理、字符忠实保留的全页转录,并回答四个研究问题:如何保留历史文本的原始风格;深度神经网络对中世纪拉丁文字符的识别效果;端到端流水线能否无需后处理产生准确转录;如何提升全页转录流水线的效率。

**研究方法与关键技术**
研究人员设计了包含四个组件的模块化流水线:(1)布局分析(layout analysis)——采用ParseNet(基于编码器-解码器卷积网络)检测文本基线(baselines)、上行部分(ascenders)和下行部分(descenders),生成PAGE格式(Page Analysis and Ground-Truth Elements)的XML文件;(2)行图像提取(line image extraction)——根据基线坐标和高度估计裁剪并归一化文本行图像至统一高度(50像素);(3)OCR组件——基于掩码自编码器与视觉变换器(MAE-ViT),集成CNN特征提取器(ResNet-18)和跨度掩码策略(span masking),使用连接主义时间分类(Connectionist Temporal Classification, CTC)损失进行训练,无需后处理;(4)结果表示——生成PAGE XML、Markdown和纯文本文件。流水线仅OCR组件需要针对特定数据集训练,布局分析组件使用预训练ParseNet。实验使用了三个数据集:Rodrigo(853页手写古西班牙语,107个字符类)、Bentham(手写英语,94个字符类)以及自建打印数据集Molino(143页中世纪拉丁文,含缩写和特殊字符,来源包括1667年、1866年、1585年等四类文献)。

**研究结果**
**4.2 手写文本转录**
在Rodrigo数据集上,研究人员使用MAE-ViT(批量大小128)训练100,000次迭代,得到字符错误率(Character Error Rate, CER)为1.30%,词错误率(Word Error Rate, WER)为6.97%,优于对比的深度CRNN(CER 3.00%)和深度CRNN+时间Dropout(CER 2.43%)。在Bentham数据集上,模型(批量大小64)取得CER 4.46%、WER 7.68%,虽低于HTR-JAND(CER 2.02%,但依赖T5后处理),但证明了无需后处理的竞争力。

**4.3 打印文本转录**
在Molino数据集上,模型(126个字符类,批量大小64,100,000次迭代)在验证集上达到平均CER 1.38%、WER 5.16%。对10页测试页的全页转录对比显示,FP-THD的全局CER和WER分别为1.14%和4.85%,显著优于ABBYY(14.40%, 55.43%)、Pero-OCR(2.49%, 21.35%)和TrOCR(22.12%, 75.40%)。基于2000次自举(bootstrap)的95%置信区间(CI)显示FP-THD的误差区间最窄(CER CI [0.0098,0.0131], WER CI [0.0422,0.0553])。配对t检验(paired t-test)证实FP-THD与所有对比方法在CER和WER上均存在显著差异(p?0.05)。定性分析表明,FP-THD正确保留了波浪号、缩写等历史特征,而ABBYY和Pero-OCR存在长s与“f”混淆,TrOCR产生语义错误(如“manifestations tomorrow”代替“manifestationis bonorum”)。

**讨论与结论**
讨论部分指出,FP-THD的模块化设计(布局分析+行级OCR)降低了内存和计算需求,避免了后处理,尤其适合缺乏中世纪拉丁文语料库的场景。流水线对主文本转录准确,但对页边注(marginal notes)和短行(如catchwords)的识别存在局限性,因训练数据以长行为主。未来计划扩展数据集至非拉丁文字和孤立词,并集成到民法文档分析平台中。结论总结:FP-THD流水线使用ParseNet布局分析和MAE-ViT OCR,无需后处理即可实现高精度(打印文本CER 1.14%,手写文本CER 1.30%–4.46%),在Molino数据集上优于ABBYY、Pero-OCR和TrOCR。主要局限包括未测试非拉丁文字和短行识别困难。未来工作将扩展数据集并探索领域自适应技术。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号