Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
SFD让语义先于纹理异步去噪,在ImageNet 256²达FID 1.04并显著加速收敛。
Yueming Pan, Ruoyu Feng, Qi Dai 等
SFD让语义先于纹理异步去噪,在ImageNet 256²达FID 1.04并显著加速收敛。
Yueming Pan, Ruoyu Feng, Qi Dai 等
LineAR通过压缩KV缓存,实现高效自回归图像生成,ImageNet FID从2.77降至2.68。
Ziran Qin, Youru Lv, Mingbao Lin 等
COOPER模型结合深度与分割,提升空间推理性能6.91%,实现内在感知与推理能力。
Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang 等
提出基于软Q策略梯度的扩散微调(SQDF),结合KL正则化提升文本到图像生成的多样性与目标一致性。
Hyeongyu Kang, Jaewoo Lee, Woocheol Shin 等
dVLM-AD通过可控推理提升自动驾驶的扩散视觉语言模型,在WOD-E2E长尾场景中行为轨迹一致性提高9%。
Yingzi Ma, Yulong Cao, Wenhao Ding 等
MD-SNN通过膜电位蒸馏提高量化脉冲神经网络的精度,能效提升14.85倍。
Donghyun Lee, Abhishek Moitra, Youngeun Kim 等
ResponsibleRobotBench利用多模态大语言模型评估机器人在风险环境中的责任行为。
Lei Zhang, Ju Dong, Kaixin Bai 等
提出KiMoI模型,通过操控面部运动基实现深度伪造视频的运动不一致检测,提升泛化能力。
Alejandro Cobo, Roberto Valle, José Miguel Buenaposada 等
PosterCopilot通过三阶段训练实现布局推理与可控编辑,提升专业平面设计的几何准确性和美学。
Jiazhe Wei, Ken Li, Tianyu Lao 等
RELIC结合长时记忆与实时流,利用压缩历史潜在表示实现高效交互视频世界建模。
Yicong Hong, Yiqun Mei, Chongjian Ge 等
提出高效测试时尺度调整方法,结合文本嵌入扰动提升生成多样性与质量。
Hang Xu, Linjiang Huang, Feng Zhao
提出一种基于激活空间白化的无训练策略,用于检测大规模语言模型中的政策违规,达到86.0%的F1分数。
Oren Rachmil, Avishag Shapira, Roy Betser 等
MemVerse结合层次知识图谱与参数记忆,提升多模态长时记忆能力。
Junming Liu, Yifei Sun, Weihua Cheng 等
LAMP利用大型语言模型生成可控视频,显著提升运动控制和用户意图对齐。
Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra 等
CrowdLLM结合预训练LLM与生成模型,构建多样性高、逼真度强的数字人群。
Ryan Feng Lin, Keyu Tian, Hanming Zheng 等
本研究分析了主动推理中偏好分布的定义方式(硬、软目标与目标塑造)对智能体表现的影响。
Filippo Torresan, Ryota Kanai, Manuel Baltieri
Thucy系统利用多智能体架构实现跨数据库事实验证,准确率达94.3%。
Michael Theologitis, Dan Suciu
ASCIIBench利用ASCII图像评估大模型空间推理能力,发现表示瓶颈明显。
Kerry Luo, Michael Fu, Joshua Peguero 等
OneThinker模型融合图像与视频理解,涵盖10大任务,训练数据600k,显著提升多模态推理能力。
Kaituo Feng, Manyuan Zhang, Hongyu Li 等
PPTArena基准评估PowerPoint编辑,结合PPTPilot结构化代理实现超越VLM的编辑性能。
Michael Ofengenden, Yunze Man, Ziqi Pang 等