排序: 最新 热门 引用
cs.CL 2503.17489

Judge Anything: MLLM as a Judge Across Any Modality

本论文提出“JudgeAnything”基准,利用多模态大模型(MLLM)作为跨模态评估工具,涵盖15类任务,评估模型理解与生成能力,显示其在MMU表现优异,但在MMG方面仍存偏差。

Shu Pu, Yaochen Wang, Dongping Chen 等

2025-03-22 33 引用 58
cs.AI 2503.16416

Survey on Evaluation of LLM-based Agents

本综述系统分析了大规模语言模型(LLM)驱动代理的评估方法,涵盖核心能力、应用场景、基准维度及开发工具。

Asaf Yehudai, Lilach Eden, Alan Li 等

2025-03-21 214 引用 46