Judge Anything: MLLM as a Judge Across Any Modality
本论文提出“JudgeAnything”基准,利用多模态大模型(MLLM)作为跨模态评估工具,涵盖15类任务,评估模型理解与生成能力,显示其在MMU表现优异,但在MMG方面仍存偏差。
Shu Pu, Yaochen Wang, Dongping Chen 等
本论文提出“JudgeAnything”基准,利用多模态大模型(MLLM)作为跨模态评估工具,涵盖15类任务,评估模型理解与生成能力,显示其在MMU表现优异,但在MMG方面仍存偏差。
Shu Pu, Yaochen Wang, Dongping Chen 等
OmniLearn以动态批处理缓解异构集群拖尾,使训练提速14–85%,异步精度最高提升6.9%。
Sahil Tyagi, Prateek Sharma
PrediCIR利用世界模型预测缺失目标内容,提升零样本图像检索性能,提升幅度达4.45%。
Yuanmin Tang, Jing Yu, Keke Gai 等
VLU-Net通过视觉语言模型实现多退化图像的统一恢复,在SOTS去雾数据集上提升3.74 dB。
Haijin Zeng, Xiangming Wang, Yongyong Chen 等
提出DCEdit,通过双层控制和精准语义定位实现高精度图像编辑,显著优于现有方法。
Yihan Hu, Jianing Peng, Yiheng Lin 等
MagicMotion通过密稠到稀疏轨迹引导,实现高质量、多目标、多格式的可控视频生成,构建了MagicData与MagicBench,显著优于SOTA。
Quanhao Li, Zhen Xing, Rui Wang 等
提出多策略优化大语言模型推理效率,包括模型剪枝、输出控制和输入提示,显著减少冗余步骤。
Yang Sui, Yu-Neng Chuang, Guanchu Wang 等
本综述系统分析了大规模语言模型(LLM)驱动代理的评估方法,涵盖核心能力、应用场景、基准维度及开发工具。
Asaf Yehudai, Lilach Eden, Alan Li 等
ScalingNoise通过引导噪声选择提高视频生成质量和一致性。
Haolin Yang, Feilong Tang, Ming Hu 等
CaKE方法通过电路感知编辑提高LLMs在MQuAKE数据集上多跳推理准确率20%。
Yunzhi Yao, Jizhan Fang, Jia-Chen Gu 等
HICom通过混合级指令注入实现视频令牌压缩,性能提升2.43%,节省78.8%令牌。
Zhihang Liu, Chen-Wei Xie, Pandeng Li 等
SpiLiFormer通过侧抑制机制提升SNNs的注意力分配,在ImageNet-1K上超越SOTA模型0.46%。
Zeqi Zheng, Yanchen Huang, Yingchao Yu 等
提出基于3D高斯点云的3D人-物交互重建方法,构建了包含133类物体和120类交互的开放词汇野外数据集Open3DHOI。
Boran Wen, Dingbang Huang, Zichen Zhang 等
提出APEX-MR框架,通过异步规划与执行实现多机器人协作装配,提升效率与安全。
Philip Huang, Ruixuan Liu, Shobhit Aggarwal 等
提出ContextualJudgeBench基准,评估大模型在上下文场景中的判定能力,模型准确率仅达55%。
Austin Xu, Srijan Bansal, Yifei Ming 等
提出AlignX框架,基于1.3百万偏好样本实现个性化LLM对齐,提升17.06%准确率。
Jia-Nan Li, Jian Guan, Songhao Wu 等
MotionStreamer结合连续潜在空间与自回归扩散模型,实现在线流式人类动作生成。
Lixing Xiao, Shunlin Lu, Huaijin Pi 等
EfficientLLaVA采用结构风险最小化实现大视觉-语言模型自动剪枝,使用64样本达83.05%准确率,提升1.8倍速度。
Yinan Liang, Ziwei Wang, Xiuwei Xu 等
提出TRACE方法,通过语义感知变换检测目标检测模型中的后门样本,提升30% AUROC。
Hangtao Zhang, Yichen Wang, Shihui Yan 等
POSTA利用扩散模型和多模态大语言模型实现个性化艺术海报生成,涵盖背景、布局、文本风格。
Haoyu Chen, Xiaojie Xu, Wenbo Li 等