Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals
提出多模态扩散变换器(MDT),在少量语言标注下实现多模态目标行为学习,性能超越SOTA。
Moritz Reuss, Ömer Erdinç Yağmurlu, Fabian Wenzel 等
提出多模态扩散变换器(MDT),在少量语言标注下实现多模态目标行为学习,性能超越SOTA。
Moritz Reuss, Ömer Erdinç Yağmurlu, Fabian Wenzel 等
通过持续多语预训练和词汇扩展,LLaMAX实现对100+语言的翻译支持,性能超越开源模型。
Yinquan Lu, Wenhao Zhu, Lei Li 等
提出TSGi模型,结合场景图与多模态信息实现交通事故分类,提升近5个百分点。
Aaron Lohner, Francesco Compagno, Jonathan Francis 等
GenArtist利用多模态大语言模型作为智能代理,实现图像生成与编辑的统一系统,超越DALL-E 3等模型。
Zhenyu Wang, Aoxue Li, Zhenguo Li 等
提出Permutation Equivariant的神经优化器LOOP-PE,提升多传感器系统的决策效率与适应性。
Meiyi Li, Javad Mohammadi
本研究发现预训练语言模型(LM)通过线性映射可优于传统协同过滤模型,揭示空间同构潜力。
Leheng Sheng, An Zhang, Yi Zhang 等
利用线性时序逻辑(LTL)构建2000个TR挑战,评估12个大模型性能,发现其在复杂问题中的三大主要问题。
Weizhi Tang, Kwabena Nuamah, Vaishak Belle
Emilia是一个涵盖六种语言、超过10万小时多样化、真实场景语音的大规模数据集,配合开源预处理管线Emilia-Pipe。
Haorui He, Zengqiang Shang, Chaoren Wang 等
提出测试时对比概念方法,提升开放域语义分割的准确性。
Monika Wysoczańska, Antonin Vobecky, Amaia Cardiel 等
提出MMSci数据集,涵盖72学科复杂科学图像,用于训练和评估多模态科学理解模型。
Zekun Li, Xianjun Yang, Kyuri Choi 等
本文提出以辩论(debate)作为可扩展监督协议,通过弱LLMs评判强LLMs,实验证明辩论在信息不对称任务中优于咨询,提升判别准确率。
Zachary Kenton, Noah Y. Siegel, János Kramár 等
OneRestore框架通过交叉注意力机制实现复杂图像退化的恢复,提升了PSNR和SSIM。
Yu Guo, Yuan Gao, Yuxu Lu 等
AriGraph通过集成语义和情节记忆显著提升LLM代理的任务处理能力。
Petr Anokhin, Nikita Semenov, Artyom Sorokin 等
系统性评估大规模语言模型的挑战、限制与建议,强调可复现性与鲁棒性。
Md Tahmid Rahman Laskar, Sawsan Alqahtani, M Saiful Bari 等
提出ComplexBench基准,涵盖4类Constraint、19维度和4种组合类型,采用规则增强的LLM评估,揭示现有模型在多Constraint复合指令下的不足。
Bosi Wen, Pei Ke, Xiaotao Gu 等
提出基于分类的自动HDL代码生成方法,显著提升Verilog代码的功能正确率。
Wenhao Sun, Bing Li, Grace Li Zhang 等
NEBULA利用VQ-VAE和神经经验贝叶斯快速生成大规模分子库,提升效率和泛化能力。
Ewa M. Nowara, Pedro O. Pinheiro, Sai Pooja Mahajan 等
AMEX数据集提升移动GUI代理性能,包含104K截图和多层次标注。
Yuxiang Chai, Siyuan Huang, Yazhe Niu 等
DisCo-Diff结合离散连续潜变量,提升扩散模型性能,显著降低ODE曲率。
Yilun Xu, Gabriele Corso, Tommi Jaakkola 等
本研究重新审视经典的邻近方法NCA,结合深度学习技术,在300个数据集上实现了与CatBoost相当的性能。
Han-Jia Ye, Huai-Hong Yin, De-Chuan Zhan 等