BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams
BLUEX v2利用Brazilian二阶段高考题,结合多模态和深度推理,评估21个LLMs,表现差异达4.92分。
核心发现
方法论
采用基于官方参考答案和LLM生成评分标准的LLM作为评判者协议,结合多轮自动化数据处理,包括题目抽取、OCR、图像描述、学科分类和评分标准生成。评估涵盖21个前沿模型,利用API接口进行逐题逐子题的推理与评分,验证模型在复杂学科和多模态内容中的表现。引入结构化评分机制,确保自动评分的可靠性和一致性。通过人类评审验证LLM判定的有效性,达成较高的LLM-人类一致性。
关键结果
- 模型性能差异显著,最高Gemini 3.1 Pro评分9.10/10,最低LLaMA-3.2-11B Vision评分4.18/10,差距达4.92分,显示评估工具的区分能力。
- 数学推理和图像理解为最难能力维度,平均得分分别为7.52和7.79,图像题平均比纯文本题低0.54分,验证多模态内容的挑战。
- LLM判评器与人类评审的Kappa值达0.69,显示自动评估在学术内容中的实用性与可靠性。
研究意义
该研究填补了葡语环境中深度推理和多模态评估的空白,为未来多语言、多模态AI评测提供了标准化平台。通过多学科、多年份数据,验证了前沿模型的能力边界,推动了多模态理解和复杂推理的研究发展。其自动化评估方案降低了人工成本,提高了评测的客观性和可重复性,为教育、AI研发和学术评估提供了新工具。
技术贡献
提出基于官方答案的结构化评分标准自动生成机制,结合Sabiá-4模型实现多模态内容的统一评估框架。创新在于多轮自动化数据处理流程、结构化评分体系以及跨模型、多学科、多模态的综合评价策略。验证了LLM作为评判者的可行性,建立了高效、可靠的自动评分体系,显著优于传统二分类或模糊匹配方法。
新颖性
首次将Brazilian第二阶段高考题引入多模态、开放式评估,结合结构化评分和LLM判评,突破了以往多项选择题或单一文本评估的限制。创新点在于多学科、多模态、多模型的综合评估框架,验证了LLM判评的有效性,为低资源语言环境中的AI评测提供了新思路。
局限性
- 模型评估主要基于描述性字幕,未直接处理原始图像,可能影响视觉推理的真实性。
- 评估仅涵盖特定学科和题型,未来需扩展到更多学科和题型以验证通用性。
- 高成本的API调用限制模型规模和频次,影响大规模评测的可扩展性。
未来方向
未来将引入多模态模型直接处理原始图像,扩展多学科、多题型评估范围,提升自动评分的细粒度和解释能力。同时,结合人机混合评估策略,优化判评一致性,推动低资源语言环境中的AI评测标准化发展。
AI 总览摘要
BLUEX v2基于Brazilian第二阶段高考题,构建了涵盖9个学科、2022-2025年的多模态、开放式问答评测平台。该平台通过自动化流程提取题目、OCR识别、图像描述、学科分类和评分标准生成,结合结构化评分体系,评估了21个最先进的LLMs。实验结果显示,模型性能差异显著,最高模型得分达9.10,最低为4.18,差距达4.92分,验证了评估工具的区分能力。数学推理和图像理解为最难能力维度,模型在多模态内容上的表现明显低于纯文本题。引入的LLM判评器与人类评审的Kappa值达0.69,展示了自动评估的潜力。该研究不仅为低资源语言环境中的AI能力评测提供了新范式,也推动了多模态深度推理研究的发展。未来,将继续优化多模态模型、拓展学科范围,提升自动评分的细粒度和解释能力,为教育和AI研发提供强大工具。
深度分析
研究背景
近年来,深度学习和大规模预训练模型推动了自然语言处理的快速发展。代表性工作如GPT系列、BERT、T5等在多任务、多语言环境中取得突破。然而,现有评测多集中在英语,少数针对低资源语言如葡萄牙语的评估仍偏少。早期的BLUEX基于多项选择题,解决了葡语评估数据匮乏的问题,但未能涵盖深度推理和生成能力。随着模型能力提升,评估也需从单一正确答案转向开放式、多模态、多学科的复杂任务,推动了多模态理解和深度推理的研究。
核心问题
现有评测多偏重识别和选择任务,难以反映模型在复杂推理和生成能力上的真实水平。葡萄牙语环境中缺乏高质量、多模态、开放式的评估数据,限制了模型能力的全面衡量。尤其是在教育场景中,深度理解和多模态内容的评估需求日益增长,亟需建立标准化、多维度的评测体系,以推动模型在实际应用中的表现。
核心创新
本研究提出了多模态、结构化评分的BLUEX v2,首次引入Brazilian第二阶段高考题,结合官方答案、自动生成评分标准和多模态内容,建立了全面评估平台。创新点包括:• 利用OCR和图像描述技术实现多模态内容的自动处理;• 结构化生成评分标准,确保评估的细粒度和客观性;• 跨学科、多模型、多年份的评估框架,验证了LLM作为判评者的可行性。这些创新极大丰富了低资源语言的评测手段,推动了多模态深度推理研究。
方法详解
- �� 数据采集:从官方PDF提取题目和答案,结合OCR识别图像内容。• 数据清洗:多轮人工校验,去除重复和无关题目。• 图像描述:用Gemini 3.1 Flash Lite生成上下文感知的图像字幕。• 学科分类:利用Sabiá-4模型自动标注学科类别。• 评分标准:由Sabiá-4基于官方答案自动生成结构化评分准则。• 评估流程:每个子题通过API调用模型,结合题目、字幕和前序答案,生成回答。• 判评机制:Sabiá-4模型依据评分标准,逐项打分,输出二值判断。• 结果整合:模型得分按比例转换,统计整体表现。• 人类验证:随机抽样验证判评一致性,确保可靠性。
实验设计
采用2022-2025年Brazilian第二阶段高考题,评估21个模型,包括前沿API模型和开源模型。指标为0-10分制,验证模型在多学科、多模态内容中的表现差异。通过人机一致性验证,确保自动评分的有效性。设置对比实验,分析不同能力维度(如数学推理、图像理解)对模型性能的影响。还进行了不同题型和内容复杂度的子分析,验证模型在实际学术场景中的适用性。
结果分析
模型表现差异显著,最高Gemini 3.1 Pro得分9.10,最低LLaMA-3.2-11B Vision得分4.18,差距4.92分。数学推理和图像理解为最难能力,平均得分分别为7.52和7.79,图像题平均比纯文本低0.54分。判评器与人类评审的Kappa值达0.69,验证了自动评估的可靠性。模型在多学科表现存在差异,STEM科目表现较弱,验证了模型在符号推理方面的局限。
应用场景
该平台可用于教育评估、模型能力诊断和多模态AI研发。可帮助高校和企业快速评估模型在复杂学科和多模态内容中的表现,推动AI在教育、科研和自动化评分中的应用。未来还可结合实际教学场景,开发智能辅导和自动批改系统,提升教学效率。
局限与展望
目前评估依赖字幕描述,未直接处理原始图像,可能影响视觉推理真实性。题目范围有限,未来需扩展到更多学科和题型。API调用成本高,限制大规模评测的可扩展性。模型判评的准确性虽高,但仍存在偏差,需进一步优化判评机制。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂工作,工厂里有许多不同的机器,每台机器负责不同的任务。有些机器只会识别简单的指令,有些机器还能自己思考和做出复杂决定。现在,科学家们希望让这些机器像人一样理解复杂的指令,比如解答难题或理解图片中的内容。为了做到这一点,他们设计了一个特别的测试,就像考试一样,里面有很多不同类型的问题,包括文字和图片。通过让这些机器回答问题,然后用另一台“聪明的机器”来判断答案的好坏,科学家们可以知道这些机器到底有多聪明。这就像老师批改学生作业一样。这个方法帮助科学家们不断改进机器,让它们变得更聪明、更懂事,未来还能用在学校、医院和工厂里,让我们的生活变得更方便。
简单解释 像给14岁少年讲一样
想象你在学校参加一个超级难的考试,里面不仅有写作文的问题,还有很多图片,比如地图、图表和化学公式。你的任务是用自己的话回答问题,还要理解图片里的内容。现在,科学家们也在做类似的事情,他们用一种特别聪明的电脑模型来帮忙回答这些复杂的问题。这个模型就像一个超级聪明的朋友,能理解文字和图片,还能给出详细的答案。为了让这个“朋友”变得更厉害,科学家们让它参加了很多考试,看看它答得怎么样。他们还让另一台模型像老师一样,检查它的答案是否正确。结果显示,这些模型在一些科目,比如数学和图片理解方面还不够强,但在其他方面表现不错。未来,这样的技术可以用在自动批改作业、智能辅导甚至帮助老师设计更好的考试,让学习变得更有趣、更高效。是不是很酷?
原文摘要
Although Large Language Models (LLMs) excel in many tasks, their assessment in Portuguese has received less attention, particularly for open-ended, discursive tasks that demand deeper reasoning and generation capabilities. While the original BLUEX benchmark addressed the scarcity of Portuguese evaluation datasets through multiple-choice questions from Brazilian university entrance exams, it did not cover the more challenging second-phase examinations, which require free-form written responses. In this work, we introduce BLUEX v2, a benchmark derived from the second-phase entrance exams of Brazil's two leading universities: UNICAMP (Comvest) and USP (Fuvest), spanning exam years 2022--2025. Our dataset comprises 395 questions unfolding into 919 graded subquestions, with 55.7% of questions containing associated images (represented as context-aware captions during inference to enable evaluation across both vision-capable and text-only models). Each question is annotated with subject area, official reference answers, LLM-generated rubric criteria, and six cognitive capability tags. We evaluate 21 state-of-the-art LLMs using an LLM-as-a-judge protocol. Results reveal a 4.92-point performance spread across models (4.18-9.10 on a 0-10 scale), with Mathematical Reasoning and Image Understanding emerging as the hardest capability dimensions. The evaluation code, model outputs, and dataset are publicly available at https://github.com/TropicAI-Research/BLUEXv2 and on Hugging Face at https://huggingface.co/datasets/Tropic-AI/BLUEX-v2.