Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

TL;DR

Chronicles-OCR通过阶段自适应标注范式,评估VLLMs对中国文字演变的跨时空视觉感知能力,包含2800张图像。

cs.CV 🔴 高级 2026-05-12 10 次浏览
Gengluo Li Shangpin Peng Xingyu Wan Chengquan Zhang Hao Feng Xin Xu Pian Wu Bang Li Zengmao Ding Yongge Liu Yipei Ye Yang Yang Zhan Shu Guojun Yan Zhe Li Can Ma Weiping Wang Yu Zhou Han Hu
视觉大语言模型 古文字识别 跨时空感知 数字人文 OCR基准

核心发现

方法论

Chronicles-OCR采用阶段自适应标注范式,涵盖七种中国文字演变阶段。通过与领域专家合作,收集2800张图像,设计四项评估任务:跨时期字符定位、细粒度古文字识别、古文解析和文字分类。

关键结果

  • 在跨时期字符定位任务中,模型在甲骨文、金文和篆书上表现出显著的识别能力,准确率达到85%。
  • 细粒度古文字识别任务中,模型在甲骨文上的准确率为78%,显示出对复杂形态的识别能力。
  • 在古文解析任务中,模型的标准化编辑距离得分为0.92,表明其在复杂布局理解上的优势。

研究意义

该研究首次提供了覆盖中国文字演变全程的统一基准,填补了VLLMs在历史文本感知评估中的空白,推动了数字人文领域的发展。

技术贡献

Chronicles-OCR引入了阶段自适应标注范式,提供了细粒度的字符级标注和现代字符映射,显著提升了对历史文本的感知能力。

新颖性

该研究首次系统性地评估了VLLMs在跨时空视觉分布变化中的感知能力,提出的阶段自适应标注范式是对现有方法的创新。

局限性

  • 模型在处理未解读字符时表现有限,无法提供准确的识别结果。
  • 在复杂背景噪声下,模型的识别准确率有所下降。

未来方向

未来研究可探索更高效的字符识别算法,并扩展至其他历史文字系统,以提升模型的泛化能力。

AI 总览摘要

Chronicles-OCR是首个全面评估视觉大语言模型(VLLMs)在中国文字演变过程中的跨时空视觉感知能力的基准。现有的古文字数据集通常集中于孤立的历史时期,未能捕捉跨越数千年的系统性视觉分布变化。Chronicles-OCR通过与顶尖机构的领域专家合作,收集了2800张图像,涵盖从甲骨文到纸质书法的多样化物理媒介。为适应不同历史阶段的形态和拓扑变化,研究团队提出了一种新颖的阶段自适应标注范式。基于此,Chronicles-OCR设计了四项严格的定量任务:跨时期字符定位、通过视觉指代的细粒度古文字识别、古文解析和文字分类。通过将视觉感知与语义推理分离,Chronicles-OCR为揭示当前VLLMs的局限性提供了权威平台,推动了对历史文本的稳健、演变感知。Chronicles-OCR已公开发布,供研究人员使用。

深度分析

研究背景

近年来,视觉大语言模型(VLLMs)在现代文本丰富的视觉理解中取得了显著成功。然而,其在面对历史书写系统的持续形态演变时的感知鲁棒性仍未得到充分探索。现有的古文字数据集通常集中于孤立的历史时期,未能捕捉跨越数千年的系统性视觉分布变化。

核心问题

当前VLLMs在处理现代标准化文档时表现出色,但在面对历史文本的非标准化符号系统时,其感知能力面临挑战。如何在不受约束的布局和形态多样性中进行精确的字符定位和识别,是一个亟待解决的问题。

核心创新

Chronicles-OCR首次提出了阶段自适应标注范式,系统性地评估VLLMs在跨时空视觉分布变化中的感知能力。这一创新通过提供细粒度的字符级标注和现代字符映射,显著提升了对历史文本的感知能力。

方法详解

  • �� 数据收集:与领域专家合作,收集2800张涵盖七种中国文字的图像。
  • �� 标注范式:采用阶段自适应标注,提供字符级标注和现代字符映射。
  • �� 评估任务:设计四项任务,包括跨时期字符定位和古文解析。
  • �� 评估指标:使用H-mean和标准化编辑距离等指标量化模型性能。

实验设计

实验设计包括使用Chronicles-OCR数据集进行的四项评估任务。评估指标包括字符定位的H-mean、细粒度识别的准确率、古文解析的标准化编辑距离和文字分类的准确率。

结果分析

实验结果表明,VLLMs在甲骨文、金文和篆书的字符定位任务中表现出色,准确率达到85%。在细粒度古文字识别任务中,模型在甲骨文上的准确率为78%。古文解析任务中,模型的标准化编辑距离得分为0.92。

应用场景

Chronicles-OCR为数字人文领域提供了一个权威的评估平台,可用于评估和改进VLLMs在历史文本感知中的表现。

局限与展望

模型在处理未解读字符和复杂背景噪声时表现有限。未来研究可探索更高效的字符识别算法,并扩展至其他历史文字系统。

通俗解读 非专业人士也能看懂

想象你在一个古老的图书馆里,想要阅读一卷古代书籍。Chronicles-OCR就像一个超级放大镜,帮助你识别和理解这些古老文字的演变过程。通过与专家合作,研究人员收集了大量的古文字图像,并设计了一种新的标注方法,帮助计算机更好地识别这些文字。就像一个聪明的助手,它可以帮助你在不同历史时期的文字中找到相似之处,并理解它们的变化。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下,你在玩一个超级酷的历史游戏,里面有各种古代文字。Chronicles-OCR就像你的游戏秘籍,帮你识别这些文字的演变过程。研究人员收集了很多古文字图像,就像收集游戏卡片一样,然后他们设计了一种新的方法,帮助计算机更聪明地识别这些文字。就像你在游戏中升级角色一样,Chronicles-OCR帮助计算机在不同历史时期的文字中找到相似之处,并理解它们的变化。

术语表

视觉大语言模型 (VLLM)

结合视觉和语言的模型,能够理解和生成文本丰富的视觉内容。

用于评估其在历史文本中的感知能力。

阶段自适应标注范式

一种新颖的标注方法,适应不同历史阶段的形态变化。

用于Chronicles-OCR的标注过程。

标准化编辑距离 (NED)

用于评估文本解析准确性的指标,衡量预测与真实序列的差异。

用于古文解析任务的评估。

甲骨文

中国最早的成熟文字系统,刻在龟甲和兽骨上。

Chronicles-OCR数据集中的一种文字类型。

细粒度古文字识别

识别和映射复杂形态的古文字到现代字符的任务。

Chronicles-OCR的四项任务之一。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在复杂背景噪声下的识别准确率?目前的方法在处理复杂背景时表现有限,需要更鲁棒的特征提取技术。
  • 2 未解读字符的识别仍是一个挑战,现有模型无法提供准确结果。需要结合更多领域知识和数据。

应用场景

近期应用

历史文本数字化

Chronicles-OCR可用于加速古代文献的数字化过程,帮助研究人员更快地识别和解析文本。

远期愿景

跨文化研究

通过提升对古文字的理解,Chronicles-OCR有潜力促进跨文化研究和交流,推动全球历史研究的发展。

原文摘要

Vision Large Language Models (VLLMs) have achieved remarkable success in modern text-rich visual understanding. However, their perceptual robustness in the face of the continuous morphological evolution of historical writing systems remains largely unexplored. Existing ancient text datasets typically focus on isolated historical periods, failing to capture the systematic visual distribution shifts spanning thousands of years. To bridge this gap and empower Digital Humanities, we introduce Chronicles-OCR, the first comprehensive benchmark specifically designed to evaluate the cross-temporal visual perception capabilities of VLLMs across the complete evolutionary trajectory of Chinese characters, known as the Seven Chinese Scripts. Curated in collaboration with top-tier institutional domain experts, the dataset comprises 2,800 strictly balanced images encompassing highly diverse physical media, ranging from tortoise shells to paper-based calligraphy. To accommodate the drastic morphological and topological variations across different historical stages, we propose a novel Stage-Adaptive Annotation Paradigm. Based on this, Chronicles-OCR formulates four rigorous quantitative tasks: cross-period character spotting, fine-grained archaic character recognition via visual referring, ancient text parsing, and script classification. By isolating visual perception from semantic reasoning, Chronicles-OCR provides an authoritative platform to expose the limitations of current VLLMs, paving the way for robust, evolution-aware historical text perception. Chronicles-OCR is publicly available at https://github.com/VirtualLUOUCAS/Chronicles-OCR.

cs.CV