OCR-Based Field Extraction for Archaeological Pottery Metadata: The CENTURIA Dataset

TL;DR

使用LoRA微调的OCR模型将手写陶器记录转为结构化数据,错误率降至1.5%以下。

cs.CV 🔴 高级 2026-08-31 4 次浏览
Gissu Valentina Naghavi Dominik Hagmann Martin Kampel Irene Ballester
OCR 考古学 手写识别 数据集 机器学习

核心发现

方法论

研究使用LoRA微调技术对五种OCR模型进行适应性训练,处理507份来自Carnuntum遗址的陶器记录。通过在57个样本上进行微调,显著提高了模型的识别精度。

关键结果

  • LoRA微调后,转录错误率从15-32%降至1.5%以下,字段级准确率提高到87%以上。
  • 在无微调情况下,领域特定字段的恢复率低于3%。
  • 通过57个样本的微调,模型在领域特定字段上的表现显著改善。

研究意义

该研究展示了如何通过少量专家验证的微调集,将手写陶器文档转化为结构化、可搜索的元数据。这一方法为考古数据库的自动化提供了新的可能性,减少了人工转录的工作量。

技术贡献

通过引入CENTURIA数据集和LoRA微调技术,研究为手写文档的自动化处理提供了新的视角,特别是在考古领域的应用。该方法在领域特定的手写记录上实现了前所未有的精度。

新颖性

这是首次在考古手写记录上使用LoRA微调技术,显著提高了OCR模型的领域适应性,填补了现有技术在处理复杂手写记录方面的空白。

局限性

  • 在领域特定术语和缩写的识别上,模型仍存在一定的错误率。
  • 数据集规模有限,可能影响模型的泛化能力。

未来方向

未来的研究方向包括扩展数据集规模,探索其他领域的应用,以及进一步提高模型在复杂手写记录上的表现。

AI 总览摘要

考古学家常通过手绘图和手写元数据记录陶器发现,这些信息对考古研究至关重要。然而,手写记录难以进行计算分析,需人工转录。研究引入CENTURIA数据集,包含507份来自Carnuntum遗址的陶器记录,提供转录、边界框和结构化字段标签。通过对五种OCR模型进行基准测试,发现无微调情况下,转录错误率高达15-32%,领域特定字段恢复率低于3%。然而,通过在57个样本上进行LoRA微调,错误率降至1.5%以下,字段级准确率提高到87%以上。研究表明,少量专家验证的微调集足以将手写陶器文档转化为结构化、可搜索的元数据,适用于考古数据库。

深度分析

研究背景

陶器是重建古代社会的重要资料。考古学家通常通过手绘图和手写元数据记录陶器发现,这些信息对年代测定、来源归属和跨地点比较至关重要。然而,这些记录难以进行计算分析,需人工转录。

核心问题

手写陶器记录的自动化处理是一个挑战。现有的OCR模型在处理复杂的手写记录时表现不佳,尤其是在领域特定术语和缩写的识别上。

核心创新

研究引入CENTURIA数据集和LoRA微调技术,显著提高了OCR模型在考古手写记录上的识别精度。通过少量样本的微调,模型在领域特定字段上的表现显著改善。

方法详解

  • �� 使用CENTURIA数据集进行基准测试
  • �� 对五种OCR模型进行LoRA微调
  • �� 在57个样本上进行微调,优化模型在领域特定字段上的表现

实验设计

实验在CENTURIA数据集上进行,包含507份陶器记录。使用五种OCR模型进行基准测试,并在57个样本上进行LoRA微调。评估指标包括转录错误率和字段级准确率。

结果分析

LoRA微调后,转录错误率从15-32%降至1.5%以下,字段级准确率提高到87%以上。模型在领域特定字段上的表现显著改善。

应用场景

研究结果可用于考古数据库的自动化处理,减少人工转录的工作量,提高数据的可搜索性和结构化程度。

局限与展望

模型在领域特定术语和缩写的识别上仍存在一定的错误率。数据集规模有限,可能影响模型的泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个古老的图书馆,里面有许多手写的书籍。你需要将这些书籍的内容转化为可搜索的电子格式,但这些手写记录难以识别。研究就像是一个聪明的助手,通过学习少量样本,能够快速准确地将这些手写记录转化为结构化数据,方便你进行搜索和分析。

简单解释 像给14岁少年讲一样

想象你在玩一个考古游戏,你发现了一些古老的手写记录。这些记录很重要,但你需要一个工具来帮助你快速识别和整理这些信息。研究就像是一个超级助手,通过学习少量样本,能够快速准确地将这些手写记录转化为可用的数据,让你在游戏中更快找到线索!

术语表

OCR (光学字符识别)

一种技术,用于将图像中的文字转化为可编辑的文本格式。

用于识别手写陶器记录中的文字。

LoRA (低秩适应)

一种微调技术,通过低秩分解来适应模型参数。

用于提高OCR模型在特定领域的识别精度。

CENTURIA数据集

包含507份手写陶器记录的考古数据集。

用于评估和微调OCR模型。

领域特定字段

特定领域中使用的术语和缩写。

在考古手写记录中常见,识别难度较大。

微调

通过少量数据对模型进行适应性训练。

用于提高OCR模型在特定领域的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的数据集上验证模型的泛化能力?
  • 2 在其他领域的手写记录上,LoRA微调是否同样有效?

应用场景

近期应用

考古数据库自动化

通过将手写记录转化为结构化数据,减少人工转录工作量,提高数据可搜索性。

远期愿景

跨领域应用

探索LoRA微调在其他领域手写记录上的应用,推动更多领域的自动化处理。

原文摘要

Pottery is a primary source for reconstructing the chronological and economic dimensions of past societies. Archaeologists often document ceramic finds through technical drawings and handwritten metadata. This metadata is critical for dating, provenance attribution, and cross-site comparison, but remains inaccessible to computational analysis, requiring manual transcription of every record. We investigate whether state-of-the-art document analysis models can address this task, and introduce CENTURIA, a dataset of 507 pottery records from the Roman site of Carnuntum, providing transcriptions, bounding boxes, and structured field-level labels across seven metadata categories. Benchmarking five OCR models reveals a substantial domain gap: zero-shot transcription error reaches 15-32% SpACER-M, far exceeding rates on printed archival documents, with domain-specific fields recovered in fewer than 3% of cases. LoRA fine-tuning on just 57 samples, reflecting a realistic archival annotation budget, closes this gap, reducing transcription error to below 1.5% and recovering overall field-level accuracy above 87%. Our results show that a small expert-validated fine-tuning set suffices to convert handwritten pottery documentation into structured, searchable metadata ready for archaeological databases.

cs.CV