Fast-ARDiff: An Entropy-informed Acceleration Framework for Continuous Space Autoregressive Generation
Fast-ARDiff通过熵信息加速AR+扩散生成,ImageNet上实现4.3倍加速。
Zhen Zou, Xiaoxiao Ma, Jie Huang 等
Fast-ARDiff通过熵信息加速AR+扩散生成,ImageNet上实现4.3倍加速。
Zhen Zou, Xiaoxiao Ma, Jie Huang 等
首次全面综述面部与身体动作生成,涵盖数据集、评估指标及生成技术,强调GAN、DDPM等模型的多模态应用。
Lownish Rai Sookha, Nikhil Pakhale, Mudasir Ganaie 等
PAVAS通过物理驱动音频适配器实现物理感知的视频到音频合成,显著提高物理一致性。
Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka 等
OneStory以自适应记忆生成多镜头视频,T2MSV一致性达0.5813。
Zhaochong An, Menglin Jia, Haonan Qiu 等
提出NPC方法,通过负提示优化文本-图像对齐,在GenEval++上表现提升54%。
Sangha Park, Eunji Kim, Yeongtak Oh 等
VulnLLM-R通过推理而非模式匹配检测漏洞,参数效率优于SOTA模型。
Yuzhou Nie, Hongwei Li, Chengquan Guo 等
SJD++通过多token预测和高置信度重用,实现AR文本到图像生成的2-3倍加速。
Yao Teng, Zhihuan Jiang, Han Shi 等
SAGE基准通过9维度和4530个测试项评估大语言模型的跨文化理解能力,揭示其系统性不足。
Shiwei Guo, Sihang Jiang, Qianxi He 等
AlignGemini通过任务-模型对齐实现通用AI生成图像检测,提升9.5%准确率。
Ruoxin Chen, Jiahui Gao, Kaiqing Lin 等
提出基于数据的功能状态估计算法,无需模型参数,适用于复杂网络。
Yuan Zhang, Ziyuan Luo, Wenxuan Xu 等
提出无需训练的向量量化方法Gaussian Quant,在ImageNet上优于VQGAN等。
Tongda Xu, Wendi Zheng, Jiajun He 等
提出随机贪婪压缩算法,证明宽多层感知机的剪枝/量化子网络存在性。
Houssam El Cheairi, David Gamarnik, Rahul Mazumder
提出基于RFET的节能随机计算神经网络加速器,显著降低面积、延迟和能耗。
Sheng Lu, Qianhou Qu, Sungyong Jung 等
RefBench-PRO通过Ref-R1提升多模态大模型在指代表达理解中的定位精度。
Tianyi Gao, Hao Li, Han Fang 等
提出GraphDeT,通过边噪声去除提升GNN在时间和区域域适应中的性能,性能提升达21.83%。
Haiyang Yu, Meng-Chieh Lee, Xiang song 等
WAM-Flow通过离散流匹配实现自动驾驶中的并行粗细运动规划,1步推理达89.1 PDMS。
Yifang Xu, Jiahao Cui, Feipeng Cai 等
PRiSM通过Python代码评估科学推理,包含24,750个物理和数学问题。
Shima Imani, Seungwhan Moon, Adel Ahmadyan 等
CARD方法通过噪声白化和扩散模型更新,解决了相关高斯噪声问题,在CIN-D数据集上表现优异。
Niki Nezakati, Arnab Ghosh, Amit Roy-Chowdhury 等
DraCo结合低分辨率草图预览与文本推理,提升稀有属性生成,实验中在GenEval+8%、Imagine-Bench+0.91等指标显著优于传统方法。
Dongzhi Jiang, Renrui Zhang, Haodong Li 等
BulletTime框架通过4D位置编码和自适应归一化实现时间与摄像机姿态的解耦控制,提升视频生成的空间和时间操控能力。
Yiming Wang, Qihang Zhang, Shengqu Cai 等