DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete Latents
DisCo-Diff结合离散连续潜变量,提升扩散模型性能,显著降低ODE曲率。
Yilun Xu, Gabriele Corso, Tommi Jaakkola 等
DisCo-Diff结合离散连续潜变量,提升扩散模型性能,显著降低ODE曲率。
Yilun Xu, Gabriele Corso, Tommi Jaakkola 等
本研究重新审视经典的邻近方法NCA,结合深度学习技术,在300个数据集上实现了与CatBoost相当的性能。
Han-Jia Ye, Huai-Hong Yin, De-Chuan Zhan 等
基于六边形波导网格的可编程光子极限学习机(PELM),实现多任务分类,结合演化算法优化性能。
Jose Roberto Rausell-Campo, Antonio Hurtado, Daniel Pérez-López 等
提出基于内容感知的数据过拟合方法(Dy-DCA),实现单模型高效视频超分,提升PSNR和实时性能。
Gen Li, Zhihao Shu, Jie Ji 等
GlyphDraw2结合扩散模型与大语言模型,实现复杂海报自动生成,支持中英文文本与字体控制。
Jian Ma, Yonglin Deng, Chen Chen 等
提出基于熵正则化最优运输的特征映射,用于高维数据的非线性对齐与联合嵌入,具有理论保证。
Boris Landa, Yuval Kluger, Rong Ma
提出MMLongBench-Doc,基于135份长篇PDF文档的多模态长文本理解基准,评估14个LVLM模型,最佳F1仅42.7%。
Yubo Ma, Yuhang Zang, Liangyu Chen 等
提出Open-TeleVision系统,通过沉浸式立体视觉实现远程操控,提升数据采集和学习效率。
Xuxin Cheng, Jialong Li, Shiqi Yang 等
FoleyCrafter利用预训练文本到音频模型,通过语义适配器和时间控制器实现高质量、同步的视频配音。
Yiming Zhang, Yicheng Gu, Yanhong Zeng 等
提出主动继承,通过非微分目标引导合成数据,调控模型偏好(如词汇多样性、低毒性)
Luísa Shimabucoro, Sebastian Ruder, Julia Kreutzer 等
uDistil-Whisper在低数据环境中实现无标签知识蒸馏,性能提升5-7 WER。
Abdul Waheed, Karima Kadaoui, Bhiksha Raj 等
FineSurE利用LLM进行细粒度摘要评估,提升完整性和简洁性。
Hwanjun Song, Hang Su, Igor Shalyminov 等
VIS框架通过校准OMSV实现高效产量估计,速度提升29.03倍。
Yanfang Liu, Lei He, Wei W. Xing
本研究评估低资源孟加拉语大模型的必要性,发现现有模型在脚本生成和偏见方面存在挑战。
Tamzeed Mahfuz, Satak Kumar Dey, Ruwad Naswan 等
提出长文本任务的难度分类框架,基于信息发现难度与信息范围,强调高散布和大范围信息的研究不足。
Omer Goldman, Alon Jacovi, Aviv Slobodkin 等
Perception Stitching方法实现机器人视觉运动策略的零样本迁移,成功率显著提高。
Pingcheng Jian, Easop Lee, Zachary Bell 等
ShortcutsBench提供大规模基准测试,评估API代理在复杂任务中的能力。
Haiyang Shen, Yue Li, Desong Meng 等
通过删除和交换LLMs层,发现其在四个推理阶段表现出高度鲁棒性,揭示深度依赖的计算机制。
Vedang Lad, Jin Hwa Lee, Wes Gurnee 等
CORE4D是基于混合捕获与合成的4D人-物-人交互数据集,支持协作物体重排,含1K真实与10K合成序列。
Yun Liu, Chengwen Zhang, Ruofan Xing 等
ColPali通过视觉语言模型实现高效文档检索,采用多向量嵌入显著优于传统方法。
Manuel Faysse, Hugues Sibille, Tony Wu 等