Context-Aware Autoregressive Models for Multi-Conditional Image Generation
ContextAR模型通过多条件嵌入实现高效图像生成,超越扩散模型。
Yixiao Chen, Zhiyuan Ma, Guoli Jia 等
ContextAR模型通过多条件嵌入实现高效图像生成,超越扩散模型。
Yixiao Chen, Zhiyuan Ma, Guoli Jia 等
Agent4SR利用LLM进行低知识水准的高影响力攻击,提升推荐系统操控效果。
Shengkang Gu, Jiahao Liu, Dongsheng Li 等
提出LSTAN-GERPE模型,结合时空注意力、旋转位置编码和图特征嵌入,显著提升交通预测精度。
Xiao Wang, Shun-Ren Yang
提出dLLM-Cache,无需训练,通过长间隔提示缓存与响应部分更新,最高实现9.1倍FLOPs节省,有效降低diffusion大模型推理延迟。
Zhiyuan Liu, Yicun Yang, Yaojie Zhang 等
SpatialCrafter通过视频扩散模型从稀疏视图重建3D场景,提升重建精度。
Songchun Zhang, Huiyao Xu, Sitong Guo 等
提出CrafText基准,涵盖复杂多模态环境中的指令跟随,包含3924条指令和多任务评估。
Zoya Volovikova, Gregory Gorbov, Petr Kuderov 等
提出LifelongAgentBench,系统评估LLM智能体的终身学习能力,结合经验回放与自我一致性机制,显著提升性能。
Junhao Zheng, Xidi Cai, Qiuke Li 等
CoLM以链式表示实现渐进扩展与弹性推理,CoLM-Air在1M上下文预填充中最高加速3倍。
Kaitao Song, Xiaohua Wang, Xu Tan 等
学生共建211题HARDMath2,专测应用数学推理
James V. Roggeveen, Erik Y. Wang, Will Flintoft 等
提出MedCaseReasoning数据集,结合临床报告评估LLMs诊断推理,显著提升模型性能。
Kevin Wu, Eric Wu, Rahul Thapa 等
EgoDex利用Apple Vision Pro采集829小时多任务手部动作视频,推动机器人学习复杂操控。
Ryan Hoque, Peide Huang, David J. Yoon 等
DPSeg结合双重提示和代价体积学习,显著提升开集语义分割性能。
Ziyu Zhao, Xiaoguang Li, Linjia Shi 等
提出Critique-Guided Distillation(CGD),通过利用教师批评实现模型推理能力提升,平均提升7%。
Berkcan Kapusuzoglu, Supriyo Chakraborty, Zain Sarwar 等
提出ASRC-SNN,通过学习跳跃跨度改善长时序建模,显著优于传统RSNN。
Shang Xu, Jiayu Zhang, Ziming Wang 等
Time-R1通过三阶段RL微调,赋予3B参数模型理解、预测和创造性时间推理能力,超越200倍参数模型。
Zijia Liu, Peixuan Han, Haofei Yu 等
HAPO通过历史状态优化训练LLMs,显著提升回答简洁性,响应长度降低33-59%,准确率仅降2-5%。
Chengyu Huang, Zhengxin Zhang, Claire Cardie
提出SpecBranch,通过混合推测和分支并行实现LLM推理加速,速度提升1.8-4.5倍,减少50%回滚令牌。
Yuhao Shen, Junyi Shen, Quan Kong 等
Ready2Unlearn通过训练阶段优化提高未来模型的去学习能力。
Hanyu Duan, Yi Yang, Ahmed Abbasi 等
TartanGround是一个包含多模态传感器数据的大规模模拟数据集,支持地面机器人在多样环境中的感知与导航,涵盖1.44百万样本,提供RGB、深度、LiDAR等信息。
Manthan Patel, Fan Yang, Yuheng Qiu 等
提出Prior Depth Anything框架,结合稀疏测量和深度预测,生成高精度密集的度量深度图。
Zehan Wang, Siyu Chen, Lihe Yang 等