From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
提出BALSa框架,通过合成数据提升音频-语言对齐,显著减少幻听现象并增强推理能力。
Chun-Yi Kuan, Hung-yi Lee
提出BALSa框架,通过合成数据提升音频-语言对齐,显著减少幻听现象并增强推理能力。
Chun-Yi Kuan, Hung-yi Lee
HunyuanVideo-Avatar通过多模态扩散变压器生成高保真音频驱动的多角色动画。
Yi Chen, Sen Liang, Zixiang Zhou 等
提出GenICL,通过LLM反馈直接优化示范选择,显著提升ICL性能。
Zheng Zhang, Shaocheng Lan, Lei Song 等
提出两种核方法的双重鲁棒估计器,免密度比,适用于连续和高维处理变量。
Bariscan Bozkurt, Houssam Zenati, Dimitri Meunier 等
提出动态调度的多智能体协作框架“puppeteer”,通过强化学习优化代理序列,提升性能与效率。
Yufan Dang, Chen Qian, Xueheng Luo 等
提出DiffVLA,结合视觉-语言模型和稀疏-密集扩散策略,提升自动驾驶决策效率,达成45.0 PDMS。
Anqing Jiang, Yu Gao, Zhigang Sun 等
DriveX通过Omni Scene Modeling在自监督下学习场景动态,提升3D点云预测和多任务性能。
Chen Shi, Shaoshuai Shi, Kehua Sheng 等
CreatiDesign结合多条件扩散变换器,实现多源异构元素的高精度图形设计控制。
Hui Zhang, Dexiang Hong, Maoke Yang 等
提出LatentR3,通过强化学习实现无显式链式推理的高效推荐,显著提升性能。
Yang Zhang, Wenxin Xu, Xiaoyan Zhao 等
提出自蒸馏的流映射学习框架,优化一致性模型训练效率。
Nicholas M. Boffi, Michael S. Albergo, Eric Vanden-Eijnden
本综述首次系统分析了基于推理的图像与视频分割方法,涵盖26个最新模型,提出多阶段推理机制与知识融合。
Yiqing Shen, Chenjia Li, Fei Xiong 等
GainRAG通过“增益”指标对检索器与大模型偏好进行对齐,显著提升多数据集性能。
Yi Jiang, Sendong Zhao, Jianbo Li 等
提出CoT-RVS,零样本链式推理视频分割,显著优于现有方法。
Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang
强化微调提升多模态大语言模型推理能力,显著提高OpenAI-o1和DeepSeek-R1性能。
Haoyuan Sun, Jiaqi Wu, Bo Xia 等
提出TriSense多模态大模型,结合视觉、音频、语音实现视频时序理解,利用自适应查询连接器提升鲁棒性。
Zinuo Li, Xian Zhang, Yongxin Guo 等
CapBencher通过随机化答案降低Bayes精度,检测LLM测试集过拟合。
Takashi Ishida, Thanawat Lodkaew, Ikko Yamane
AlignXplore模型通过行为信号推断个性化偏好,提升15.49%的性能。
Jia-Nan Li, Jian Guan, Wei Wu 等
提出半单纯形神经网络(SSNs)用于方向性高阶关系建模,显著提升脑活动解码性能。
Manuel Lecha, Andrea Cavallo, Francesca Dominici 等
Trinity-RFT为大规模语言模型提供统一高效的强化微调框架,支持多模式、多场景应用。
Xuchen Pan, Yanxi Chen, Yushuo Chen 等
TextFlux为基于DiT的多语种场景文本合成模型,无需OCR,训练数据仅为竞争方法的1%。
Yu Xie, Jielei Zhang, Pengyu Chen 等