What's in the Image? A Deep-Dive into the Vision of Vision Language Models
本研究深入分析VLM中的注意力机制,揭示模型如何利用查询Token存储全局信息。
Omri Kaduri, Shai Bagon, Tali Dekel
本研究深入分析VLM中的注意力机制,揭示模型如何利用查询Token存储全局信息。
Omri Kaduri, Shai Bagon, Tali Dekel
提出ConsisID,无需微调,通过频域控制实现人脸身份一致的文本到视频生成。
Shenghai Yuan, Jinfa Huang, Xianyi He 等
CLOVER通过跨层正交向量剪枝与微调,利用奇异值分解显著提升模型压缩效率。
Fanxu Meng, Pingzhi Tang, Fan jiang 等
提出2D Matryoshka训练方法,结合多层次、多维度嵌入,显著提升STS和检索任务性能。
Shuai Wang, Shengyao Zhuang, Bevan Koopman 等
PersonalVideo通过奖励机制实现高ID保真视频生成,避免动态和语义退化。
Hengjia Li, Haonan Qiu, Shiwei Zhang 等
CBF安全滤波器揭示并解析阻塞模式,以意图感知自适应优先级快速解阻。
Shuhao Qi, Zengjie Zhang, Zhiyong Sun 等
PreF3R是一种无需姿态估计的实时3D高斯点云重建与新视角合成方法,达20FPS。
Zequn Chen, Jiezhi Yang, Heng Yang
本文提出视频扩散Transformer的精准缩放定律,结合最优超参数预测模型性能,显著提升训练效率,减少40.1%的推理成本。
Yuanyang Yin, Yaqi Zhao, Mingwu Zheng 等
LLM-as-a-judge利用大语言模型进行评分和选择,提升评估准确性。
Dawei Li, Bohan Jiang, Liangjie Huang 等
提出CATP-LLM框架,结合TPL和CAORL实现成本感知的工具规划,提升计划质量1.5%-93.9%。
Duo Wu, Jinghe Wang, Yuan Meng 等
提出EPS:基于DCT特征的高效视频超分Patch采样,显著降低训练成本。
Yiying Wei, Hadi Amirpour, Jong Hwan Ko 等
Zoom Eye通过树搜索算法提升多模态LLM的视觉推理能力,InternVL2.5-8B在HR-Bench上提升15.71%。
Haozhan Shen, Kangjia Zhao, Tiancheng Zhao 等
FoAR结合高频力/扭矩感知与视觉,动态调整多模态融合,显著提升接触丰富任务的操控精度。
Zihao He, Hongjie Fang, Jingjing Chen 等
提出正交子空间分解方法,通过SVD冻结主成分提升AIGI检测的泛化能力,显著优于现有方法。
Zhiyuan Yan, Jiangming Wang, Peng Jin 等
提出LLM评判系统的定义与标准,强调一致性、偏差控制与多场景适应。
Jiawei Gu, Xuhui Jiang, Zhichao Shi 等
利用k-SAE解析扩散模型中的单一语义特征,揭示不同层次的视觉信息表达。
Dahye Kim, Xavier Thomas, Deepti Ghadiyaram
提出截断扩散策略,结合多模锚点,显著提升自主驾驶的多样性与效率。
Bencheng Liao, Shaoyu Chen, Haoran Yin 等
XGrammar用自适应缓存+持久栈实现CFG结构生成,推理延迟最高降100x。
Yixin Dong, Charlie F. Ruan, Yaxing Cai 等
OminiControl通过重用DiT的VAE编码器和Transformer块,仅增加0.1%参数,实现对多任务的通用控制,超越专用方法。
Zhenxiong Tan, Songhua Liu, Xingyi Yang 等
提出基于自由能投影模拟(FEPS)的方法,结合主动推理与可解释性,无需深度神经网络。
Joséphine Pazem, Marius Krumm, Alexander Q. Vining 等