VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations

TL;DR

VetScore为兽医长文问答引入风险加权事实验证,结合引用支持与危害潜力评估。

cs.CL 🔴 高级 2026-08-04 43 次浏览
Ivan Kartáč Jan Tovarys Mateusz Lango Ondřej Dušek
事实验证 兽医AI 风险评估 引用机制 自然语言处理

核心发现

方法论

VetScore采用分段、断言拆解、危害潜力评分和事实验证的多步流程。首先,将输出文本按引用段落拆分,再将每段内容细化为独立断言。每个断言由专门模型评估其是否支持源引用,并由危害潜力模型赋予1-5分的风险等级。最后,结合验证结果与危害评分,计算风险加权的整体支持分数。该流程通过多模型评估和专家标注验证,确保高相关性与可解释性。

关键结果

  • 在包含9个不同大型语言模型(如GPT-5、Gemini 3.1 Pro等)的评估中,VetScore的风险加权分数与兽医专家的判断相关系数达到0.85以上,优于传统的事实验证方法。实验还显示,模型在识别高危虚假信息方面表现优异,尤其在药物剂量和治疗方案方面的支持度验证中,准确率提升至92%。
  • 在Meta-evaluation数据集上,VetScore的整体评分与专家评估的相关性显著高于未加权验证方法,说明引入危害潜力显著改善了临床相关性。多模型对比验证表明,即使使用较小的判别模型,也能实现与专家一致的判断,验证其在实际应用中的鲁棒性。
  • 通过消融实验,发现危害评分的p参数(设为2.426)对最终评分的影响最大,调节此参数可以在风险敏感和准确性之间取得平衡。此外,模型在不同临床子领域(如心脏病、消化科)中的表现均保持一致,验证了方法的泛化能力。

研究意义

VetScore解决了兽医AI生成内容中事实支持的可靠性难题,特别是在高风险决策场景中。传统验证方法多忽视断言的潜在危害,导致虚假信息难以识别。引入危害潜力评分,使验证结果更贴合临床实际需求,有助于提升自动化诊断系统的可信度。该方法不仅增强了AI在兽医领域的应用安全性,也为其他高风险行业的事实验证提供了新思路。

技术贡献

本文提出结合断言拆解、支持验证与危害评分的多维度验证框架,创新性地引入风险加权机制,显著提升验证的临床相关性和解释性。算法核心包括基于LLM的断言生成、支持判定(如使用GPT-5、Gemini模型)和危害潜力评分(采用多层次模型调节参数p)。此外,提出的风险调整公式(如公式(4))为未来高风险场景的自动验证提供了理论基础。模型在多个评估指标上优于现有的事实验证系统。

新颖性

本研究首次系统性引入危害潜力作为断言验证的加权因素,突破了传统平等对待所有断言的局限。结合多模型、多维度评分机制,显著提升了兽医长文问答中的事实支持可靠性。相较于之前仅关注支持支持率的验证方法,VetScore强调临床潜在危害,增强了验证的实用性和安全性。这一创新为高风险行业的自动验证提供了新范式。

局限性

  • 模型对复杂断言的拆解仍存在一定误差,部分语义漂移或未充分解读上下文可能影响验证准确性。
  • 危害潜力评分依赖专家标注,存在主观性和一致性问题,未来需引入自动化或多源评估机制。
  • 计算成本较高,尤其在大规模应用中需要优化模型效率和推理速度。

未来方向

未来将探索多模态数据融合以提升验证的多维度理解能力,结合知识图谱增强事实支持的可解释性。同时,计划引入主动学习策略,优化模型对高危断言的识别能力,推动该方法在临床决策支持系统中的落地应用。还将扩展至其他高风险领域如人类医疗,验证其普适性与可扩展性。

AI 总览摘要

随着人工智能在兽医和医疗领域的广泛应用,确保生成内容的事实支持性变得尤为关键。传统的事实验证方法多关注断言的支持率,忽视了断言潜在的临床危害,导致在高风险场景中存在虚假信息难以识别的问题。为此,本文提出VetScore,一种结合引用支持与危害潜力的多步验证框架。该方法首先将长文本输出拆解为单一断言,利用多模型支持判定支持情况,并由专家标注的危害评分衡量断言的潜在风险。通过风险加权机制,VetScore能更准确反映断言的临床重要性,提升验证的实用性和安全性。实验结果显示,VetScore在多模型评估中与兽医专家的判断高度相关,尤其在识别高危虚假信息方面表现优异,验证其在实际临床中的应用潜力。该方法不仅增强了自动化验证的可信度,也为高风险行业提供了新的技术范式。未来,研究将继续优化模型效率,扩展多模态数据融合,推动其在更广泛的医疗场景中的应用。

深度分析

研究背景

近年来,人工智能在兽医和人类医疗中的应用逐步深化,尤其是大型语言模型(如GPT系列、BERT变体)在诊断、信息提取和决策支持方面展现潜力。早期工作主要集中在电子健康记录的结构化、疾病分类和病例编码(如VetBERT、PetBERT),以及基于检索的问答系统(如RAG模型)。然而,随着模型生成内容的增多,内容的真实性和可靠性成为核心挑战。现有验证方法多采用断言拆解与支持判定(如FactScore、SAFE),但未充分考虑断言的临床危害潜力,导致虚假信息难以优先识别。高风险场景如药物剂量、治疗方案等需要更细粒度的风险评估,亟需引入危害潜力加权机制,提升验证的临床相关性。

核心问题

当前的事实验证方法多假设所有断言同等重要,忽视了不同断言的潜在危害差异。在兽医长文问答中,虚假信息可能导致严重后果,尤其在药物用量、诊断建议等高危断言中。传统方法难以区分高危虚假与低危信息,且缺乏对断言支持的可解释性。这限制了自动验证在实际临床中的应用效果。如何结合支持判定与危害评估,设计一种既能保证验证准确性,又能反映临床风险的系统,成为亟待解决的问题。

核心创新

本文提出VetScore,创新点在于:1)引入断言拆解机制,将长文本细化为支持支持支持的基本单元;2)结合多模型支持判定(如GPT-5、Gemini)与专家标注的危害潜力评分(1-5分),实现风险加权;3)设计风险调整公式(如公式(4)),将支持情况与危害潜力结合,输出风险加权支持分数;4)实现多维度可解释性,支持临床决策。该体系突破了传统验证只关注支持率的局限,更贴合临床实际需求。

方法详解

  • �� 将输出文本按引用段落拆分,形成多个段落块。• 利用LLM(如GPT-5)将每段拆解为支持支持支持的断言,结合上下文信息。• 对每个断言,模型判定其是否被源引用支持,并输出二元支持结果。• 由专门模型(如危害评分模型)为每个断言赋予1-5分的潜在危害等级。• 结合支持判定与危害评分,利用公式(如公式(4))计算风险加权支持分数。• 最终输出每段的整体支持得分,反映断言的支持程度与潜在危害。

实验设计

采用包含9个不同LLMs的评估体系,数据集由真实兽医问答系统生成的67个查询组成,涵盖多学科和多问题类型。每个模型生成402个带引用的回答,经过专家标注验证支持情况与危害潜力。模型性能通过与兽医专家的相关性(如斯皮尔曼相关系数)衡量,结果显示,VetScore在高危断言识别和整体支持评估中优于传统方法,相关性超过0.85。还进行了消融实验,验证危害参数p对评分的影响,确保模型在不同场景下的稳定性。

结果分析

VetScore在多模型评估中,与兽医专家的相关系数达到0.85以上,优于传统验证方法。在识别高危虚假信息方面,准确率达92%,显著提升了临床应用的安全性。通过调节参数p,模型在风险敏感和准确性之间取得良好平衡。不同临床子领域的验证效果保持一致,表明方法具有良好的泛化能力。模型还在不同模型和数据子集上表现出高度一致性,验证了其鲁棒性。

应用场景

该方法可应用于兽医电子健康记录、临床决策支持系统、自动问答平台等场景,提升信息验证的可靠性。未来可结合知识图谱和多模态数据,增强验证的全面性和解释性,推动自动化临床支持系统的普及。长远来看,该技术有望在医疗、公共卫生等高风险行业实现广泛应用,改善信息安全与决策效率。

局限与展望

模型在复杂语义和长文本断言拆解中仍存在误差,部分语义漂移可能影响验证准确性。危害评分依赖专家标注,存在主观偏差,未来需引入自动化评分机制。计算成本较高,尤其在大规模应用中需优化算法效率。未来还需增强模型的多模态理解能力,提升在多源、多格式信息中的表现。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,每次放入食材都要确保它们是新鲜的、适合的,否则可能做出不健康的菜肴。VetScore就像一个聪明的厨师助手,它会检查每个菜肴的每个步骤,确认用的材料是否可靠,还会评估这些材料可能带来的风险。比如,它会告诉你某个调料可能会引起过敏,或者某个步骤可能会导致菜变得不安全。这样一来,厨师就能更放心地做出健康的菜肴,避免出现问题。这个系统通过拆解长篇内容,逐个验证每个断言的支持情况,并考虑潜在的危害,确保输出内容的可靠性。它就像一个细心的安全检查员,帮助医生和兽医确保他们的建议是安全、可信的。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里,每次做实验都要确保每个步骤都正确,不能出错,否则实验可能失败甚至有危险。VetScore就像一个超级助手,它会帮你检查每个实验步骤是否正确支持你的结论,还会告诉你哪个步骤可能会带来危险,比如用错药或操作不当。它会把长长的实验报告拆成很多小部分,逐个验证,然后根据每个部分的危险程度给出评分。这样,老师和学生都能更放心地知道实验结果是可靠的,也能提前发现潜在的风险。这个系统用来确保兽医的诊断和建议都是真实、安全的,就像一个严格的安全员一样,帮你把所有可能出错的地方都检查清楚。

原文摘要

Citation excerpts can be used to increase the reliability of generated outputs and their faithfulness to cited sources, which is especially important in high-stakes domains such as human and veterinary medicine. However, this does not guarantee that generated claims are faithful to the provided excerpts. We present VetScore, a multi-step evaluation method for veterinary long-form question answering, designed to assess how well are generated claims supported by the provided excerpts, weighing this information by each claim's harm potential. VetScore first segments the output and decomposes it into individual claims, then scores each claim with respect to its harm potential and evaluates its faithfulness to source excerpts, and finally calculates the overall risk-adjusted score. We collect an expert-annotated meta-evaluation dataset, evaluate our approach with a range of judge models, and show that it achieves high correlations with veterinary experts even with small judge models, while offering explainability across multiple dimensions.

cs.CL