Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
提出预测正则化(PRe)缓解多模态大模型中的视觉表征退化,提升视觉理解能力。
Enguang Wang, Qiang Wang, Yuanchen Wu 等
提出预测正则化(PRe)缓解多模态大模型中的视觉表征退化,提升视觉理解能力。
Enguang Wang, Qiang Wang, Yuanchen Wu 等
提出偏差鲁棒的uplift模型TARNet,结合半合成数据验证其在结构偏差下的稳定性。
Yuxuan Yang, Dugang Liu, Yiyan Huang
LumosX通过关系自注意力和跨注意力实现个性化视频生成,提升面部属性对齐。
Jiazheng Xing, Fei Du, Hangjie Yuan 等
VideoSeek通过视频逻辑流主动寻找关键证据,减少93%帧使用,提升LVBench准确率10.2个百分点。
Jingyang Lin, Jialian Wu, Jiang Liu 等
通过多模态对比学习,SALM框架提升了网络安全任务的泛化能力,尤其在处理文本和负载数据时。
Jianan Huang, Rodolfo V. Valentim, Luca Vassio 等
语义标记聚类(STC)方法实现大语言模型中高效的不确定性量化,显著降低计算开销。
Qi Cao, Andrew Gambardella, Takeshi Kojima 等
研究SFT-DPO在小型语言模型中的交互,发现全参数微调优于LoRA。
Yuming Feng, Christy Yang
提出基于李代数的同态更新的结构化潜在动力学模型,用于无线CSI预测与空间表示。
Salmane Naoumi, Mehdi Bennis, Marwa Chafii
IsoCLIP通过分解CLIP投影器实现高效的模态内对齐,提升了检索性能。
Simone Magistri, Dipam Goswami, Marco Mistretta 等
本研究通过 Lipschitz 理论分析 ICL,揭示示范选择、CoT 和模板影响性能的机制。
Xuhan Tong, Yuchen Zeng, Jiawei Zhang
LoD-Loc v3通过实例轮廓对齐,解决密集城市场景中的定位难题,构建了10万图像的合成数据集。
Shuaibang Peng, Juelin Zhu, Xia Li 等
提出Recoding-Decoding(RD)算法,增强大模型的持续创造性与多样性,超越模态解码限制。
Queenie Luo, Gary King, Michael Puett 等
VEGA-3D利用视频生成模型的隐式3D先验,提升场景理解能力。
Xianjin Wu, Dingkang Liang, Tianrui Feng 等
Matryoshka Gaussian Splatting (MGS) 提供连续细节层次控制,保持全容量渲染质量。
Zhilin Guo, Boqiao Zhang, Hakan Aktas 等
视觉-语言-动作模型的视觉路径主导行为生成,语言敏感性依赖任务结构。
Bryce Grant, Xijia Zhao, Peng Wang
MonoArt通过渐进结构推理实现单目3D重建,提升了PartNet-Mobility数据集上的重建精度和推理速度。
Haitian Li, Haozhe Xie, Junxiang Xu 等
NavTrust通过系统性地引入RGB、深度和指令的腐蚀,评估了具身导航的可靠性,揭示了现有模型的鲁棒性差距。
Huaide Jiang, Yash Chaudhary, Yuping Wang 等
MoTok方法在HumanML3D上将轨迹误差从0.72 cm降至0.08 cm,FID从0.083降至0.029。
Chenyang Gu, Mingyuan Zhang, Haozhe Xie 等
SAMA通过语义锚定和运动对齐实现指令引导的视频编辑,显著提升编辑精度和运动一致性。
Xinyao Zhang, Wenkai Dong, Yuxin Song 等
EffectErase通过逆向学习实现高质量视频对象移除与插入,基于VOR数据集。
Yang Fu, Yike Zheng, Ziyun Dai 等