UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
UniGRPO通过GRPO优化文本和图像生成策略,提升推理驱动的视觉生成质量。
Jie Liu, Zilyu Ye, Linxiao Yuan 等
UniGRPO通过GRPO优化文本和图像生成策略,提升推理驱动的视觉生成质量。
Jie Liu, Zilyu Ye, Linxiao Yuan 等
DA-Flow结合扩散模型与卷积特征,显著提升退化视频的光流估计精度。
Jaewon Min, Jaeeun Lee, Yeji Choi 等
WildWorld数据集提供了450多种动作和显式状态注释,支持生成式ARPG的动态世界建模。
Zhen Li, Zian Meng, Shuwei Shi 等
VISOR方法通过稀疏选择视觉语言交互,提升大规模视觉语言模型效率,减少推理成本。
Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas 等
AgentRVOS通过SAM3和MLLM结合,实现零样本视频对象分割,性能领先。
Woojeong Jin, Jaeho Lee, Heeseong Shin 等
3DCity-LLM通过粗到细特征编码策略提升3D城市级感知与理解,数据集达1.2M样本。
Yiping Chen, Jinpeng Li, Wenyu Ke 等
ABot-PhysWorld:基于扩散变换器的物理对齐机器人操控世界模型,利用三百万操控片段实现物理合理的视频生成。
Yuzhi Chen, Ronghan Chen, Dongjie Huo 等
提出TrajLoom框架,结合Grid-Anchor Offset编码、VAE与Flow匹配,预测81帧未来轨迹,提升稳定性与逼真度。
Zewei Zhang, Jia Jun Cheng Xian, Kaiwen Liu 等
VideoDetective通过结合外部查询和内部相关性,实现长视频理解,提升了VideoMME-long准确率7.5%。
Ruoliu Yang, Chu Wu, Caifeng Shan 等
UNITE通过统一的自编码器实现令牌化和潜在扩散,ImageNet上FID达到2.12。
Shivam Duggal, Xingjian Bai, Zongze Wu 等
DualCoT-VLA通过并行推理实现视觉-语言-动作模型的视觉语言思维链,提升复杂任务的执行效率。
Zhide Zhong, Junfeng Li, Junjie He 等
3D-Layout-R1通过场景图推理实现语言指导的空间布局编辑,IoU提升15%,中心距离误差减少25%。
Haoyu Zhen, Xiaolong Li, Yilin Zhao 等
P-Flow利用测试时优化文本提示,实现无需训练的动态视觉特效定制。
Rui Zhao, Mike Zheng Shou
GeoFusion-CAD通过几何状态空间扩展长序列CAD生成,提升240步命令的准确性。
Xiaolei Zhou, Chuangjie Fang, Jie Wu 等
提出适应性视频蒸馏框架,有效缓解过饱和和时间塌陷问题,提升少步生成质量。
Yuyang You, Yongzhi Li, Jiahui Li 等
提出基于图像条件的强化学习方法,实时调节视觉里程计前端参数,提升轨迹长度和效率。
Simone Nascivera, Leonard Bauersfeld, Jeff Delaune 等
提出预测正则化(PRe)缓解多模态大模型中的视觉表征退化,提升视觉理解能力。
Enguang Wang, Qiang Wang, Yuanchen Wu 等
LumosX通过关系自注意力和跨注意力实现个性化视频生成,提升面部属性对齐。
Jiazheng Xing, Fei Du, Hangjie Yuan 等
VideoSeek通过视频逻辑流主动寻找关键证据,减少93%帧使用,提升LVBench准确率10.2个百分点。
Jingyang Lin, Jialian Wu, Jiang Liu 等
LoD-Loc v3通过实例轮廓对齐,解决密集城市场景中的定位难题,构建了10万图像的合成数据集。
Shuaibang Peng, Juelin Zhu, Xia Li 等