COMIX: Compositional Explanations using Prototypes
COMIX方法通过原型分解图像,解释机器学习模型决策,C-insertion得分提高48.82%。
Sarath Sivaprasad, Dmitry Kangin, Plamen Angelov 等
COMIX方法通过原型分解图像,解释机器学习模型决策,C-insertion得分提高48.82%。
Sarath Sivaprasad, Dmitry Kangin, Plamen Angelov 等
VideoRAG结合LVLM实现视频内容动态检索与多模态生成,显著优于基线。
Soyeong Jeong, Kangsan Kim, Jinheon Baek 等
OVO-Bench评估视频LLM的时间感知能力,揭示其与人类理解的差距。
Yifei Li, Junbo Niu, Ziyang Miao 等
LongProc基准测试长上下文语言模型在长程序生成上的表现,揭示了当前模型的局限性。
Xi Ye, Fangcong Yin, Yinghui He 等
提出基于RT的Simulink模型搜索测试方法,成功发现70%以上故障场景。
Federico Formica, Chris George, Shayda Rahmatyan 等
Search-o1结合代理检索增强机制与文档推理模块,显著提升LRMs复杂推理表现。
Xiaoxi Li, Guanting Dong, Jiajie Jin 等
提出深度特征工具变量(DFIV)实现最小极大速率,适应复杂函数结构。
Juno Kim, Dimitri Meunier, Arthur Gretton 等
提出URSA框架,通过构建MMathCoT-1M和DualMath-1.1M数据集,结合PS-GRPO算法,显著提升多模态数学推理能力,模型在6项基准测试中优于GPT-4o。
Ruilin Luo, Zhuofan Zheng, Yifan Wang 等
提出基于音程的符号音乐标记法,提升模型性能和可解释性。
Dinh-Viet-Toan Le, Louis Bigo, Mikaela Keller
提出一种基于划分覆盖的Tokenization方法,算法GREEDTOK在真实语料中优于BPE和Unigram,压缩率提升约3%。
Jia Peng Lim, Shawn Tan, Davin Choo 等
基于生成式AI的用户模拟,涵盖用户建模、合成数据与系统评估,推动个性化与安全性。
Krisztian Balog, ChengXiang Zhai
提出基于Token级别洗牌与混合的无偏深度伪造检测方法,显著提升跨数据集泛化能力。
Xinghe Fu, Zhiyuan Yan, Taiping Yao 等
提出RoRA,通过调整LoRA缩放因子为α/√r,提升大模型微调性能,适用于压缩与未压缩模型。
Jun Liu, Zhenglun Kong, Peiyan Dong 等
引入Agent Laboratory,基于LLM的自主研究框架,显著降低成本并提升质量。
Samuel Schmidgall, Yusheng Su, Ze Wang 等
Sa2VA结合SAM-2与MLLM,实现图像视频的密集、多模态基础理解。
Haobo Yuan, Xiangtai Li, Tao Zhang 等
本研究比较噪声注入、多任务学习和层交换在挪威方言槽与意图识别中的效果,最高达97.6%准确率。
Verena Blaschke, Felicia Körner, Barbara Plank
基于Vaidya平面切割方法,提出分布式差分隐私凸优化的最优准确性-通信-隐私折衷算法。
Sudeep Salgia, Nikola Pavlovic, Yuejie Chi 等
STAR方法通过文本到视频模型提升视频超分辨率,改善时空一致性。
Rui Xie, Yinhong Liu, Penghao Zhou 等
提出SceneVTG++,结合TLCG和CLTD实现多语言场景文本生成,达成高真实性和可控性。
Jiawei Liu, Yuanzhi Zhu, Feiyu Gao 等
该综述以Tent、CoT、PRM和MCTS为主线,解释测试时计算如何推动模型从直觉预测走向审慎推理。
Yixin Ji, Juntao Li, Yang Xiang 等