Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion
提出Steady-Forcing框架,结合V-Sink与EMA-Sink,改善长时长自然视频生成中的背景稳定性与流动性。
Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong 等
提出Steady-Forcing框架,结合V-Sink与EMA-Sink,改善长时长自然视频生成中的背景稳定性与流动性。
Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong 等
MemoGen通过经验记忆提升图像生成,超越Nano Banana Pro和GPT-Image-1。
Wenshuo Chen, Kuimou Yu, Bowen Tian 等
提出基于信息增益的LLM代理澄清策略,有效提升成功率3.7%,平均交互步数减少0.3。
Mengyi Deng, Zhiwei Li, Xin Li 等
BAHSD通过多尺度一致性探测和自适应蒸馏,提升黑盒推荐系统长尾用户性能,尾用户Recall@10提升80%。
Xi Zhou, Famin Wu, Mingming Li 等
SEA-Embedding采用对比学习和相似度匹配,基于公开数据实现东南亚语言鲁棒文本嵌入,达成SOTA。
Peerat Limkonchotiwat, Raymond Ng, Sarana Nutanong 等
提出AsymCache,结合多段注意力与延迟感知策略优化KV缓存管理,显著提升LLM推理效率。
Chunan Shi, Yilei Chen, Yilin Chen 等
提出Any2Poster方法,支持跨模态多源内容生成海报,平均准确率达87.25%。
Amogh Vinaykumar, Aiden Li, Suozhi Huang 等
提出Qift,无零点二比特权重重建级别设计,显著提升LLaMA模型W2A4推理性能。
Chi-Wei Huang, Chia-Chi Tsai
提出SEIG框架,利用预训练视觉-语言模型(VLM)实现单图反向图形,逐步细化几何、材质、布局和光照,生成可编辑的Blender程序。
Guangzhao He, Rundong Luo, Wei-Chiu Ma 等
AdaCodec采用预测性视觉编码,仅在预测成本高时使用完整视觉标记,显著提升长视频理解效率,平均节省84.7%的视觉Token。
Haowen Hou, Zhen Huang, Zheming Liang 等
本文提出VLM作为视频推理的教师,通过测试时在线优化,提升模型性能16.7分,超越传统方案。
Junhao Cheng, Liang Hou, Tianxiong Zhong 等
提出SubFit方法,在LLM中以非连续子模块级别替换,显著提升压缩效果,25%稀疏下保持84.6%准确率。
Elia Cunegatti, Marcus Vukojevic, Erik Nielsen 等
提出脚本归一化的WER(SN-WER),在五种印地语系语言中通过转写减少多达12%的脚本偏差影响,提升多脚本ASR评估的准确性。
Priyaranjan Pattnayak
SimSD采用插拔式掩码策略,为扩散式大语言模型引入令时间有效的逐词验证,实现最高7.46倍的解码吞吐提升。
Junxia Cui, Haotian Ye, Runchu Tian 等
SafeSteer通过局部化的策略蒸馏,仅在安全标记上调整,有效平衡安全性与模型能力,显著减少对通用数据的依赖。
Hao Li, Jingkun An, Zijun Song 等
Iteris为计算数学中的开放问题设计的智能研究系统,通过生成数值证据和证明草稿,辅以专家验证,推动理论验证。
Leheng Chen, Zihao Liu, Wanyi He 等
Li等提出DivIn,通过Langevin动力学优化初始化噪声,有效提升生成多样性,超越传统方法。
Xiang Li, Dianbo Liu, Kenji Kawaguchi
PaSBench-Video是一个740视频的基准,用于测试视频多模态大模型的主动安全警告能力,严格指标下无模型超过20.0%。
Yusong Zhao, Yuejin Xie, Youliang Yuan 等
提出MSLoc模型,结合边界敏感提议和多模态推理,检测长视频中操控片段。
Yue Feng, Jingjing Li, Qijia Lu 等
提出局部扰动理论揭示多领域RL中的交叉干扰与修复机制,实验证明短期刷新显著改善性能。
Lei Yang, Siyu Ding, Deyi Xiong