PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
PhyGDPO通过物理引导的偏好优化提升文本到视频生成的物理一致性,显著优于现有方法。
Yuanhao Cai, Kunpeng Li, Menglin Jia 等
PhyGDPO通过物理引导的偏好优化提升文本到视频生成的物理一致性,显著优于现有方法。
Yuanhao Cai, Kunpeng Li, Menglin Jia 等
提出基于评分准则的强化学习训练AI科研助理模型,提升研究计划生成质量。
Shashwat Goel, Rishi Hazra, Dulhan Jayalath 等
提出CREATIVEDC框架,通过两阶段思维提升Python任务多样性,效果显著。
Manh Hung Nguyen, Sebastian Tschiatschek, Adish Singla
基于DiT的流匹配模型HY-Motion 1.0,规模突破至十亿参数,实现高精度文本驱动3D人类动作生成。
Yuxin Wen, Qing Shuai, Di Kang 等
RealX3D通过多视角视觉恢复和重建基准测试,展示在物理退化下的显著性能下降。
Shuhong Liu, Chenyu Bao, Ziteng Cui 等
提出CME-CAD框架,结合多专家强化学习实现高精度可编辑CAD代码生成,基于17300+实例数据。
Ke Niu, Haiyang Yu, Zhuofan Chen 等
MFT方法在视觉语言模型中无需更新权重即可超越LoRA,提升性能。
Mingyuan Zhang, Yue Bai, Yifan Wang 等
AutoForge通过自动合成高难度任务环境和ERPO算法提升代理学习效率。
Shihao Cai, Runnan Fang, Jialong Wu 等
提出DA360,基于ViT学习尺度偏移,实现360°全景深度的尺度不变估计,生成高质量点云。
Hualie Jiang, Ziyang Song, Zhiqiang Lou 等
提出了一种基于视觉自回归(VAR)的单目深度估计方法,仅需74K样本微调,取得了室内数据集的最新性能。
Amir El-Ghoussani, André Kaup, Nassir Navab 等
Dream-VL和Dream-VLA利用扩散语言模型实现视觉-语言和视觉-语言-动作任务的突破。
Jiacheng Ye, Shansan Gong, Jiahui Gao 等
提出EnFlow,结合流式生成与能量模型,支持低能量分子构象的联合生成与识别。
Guikun Xu, Xiaohan Yi, Ziqiao Meng 等
CoAgent采用计划-合成-验证-编辑流程,利用实体记忆和闭环反馈显著提升长视频的连贯性与视觉一致性。
Qinglin Zeng, Kaitong Cai, Ruiqi Chen 等
提出多样预训练促进人机迁移,利用视觉-语言-动作模型实现人到机器人技能转移。
Simar Kareer, Karl Pertsch, James Darpinian 等
OxygenREC采用Fast-Slow思维架构结合世界知识,提升多场景推荐的推理能力与资源效率。
Xuegang Hao, Ming Zhang, Alex Li 等
VULCAN利用工具增强多智能体实现3D物体多步布局,显著优于基线。
Zhengfei Kuang, Rui Lin, Long Zhao 等
Yume-1.5采用联合时空-通道建模(TSCM)实现长视频生成,提升推理速度和稳定性,达成实时交互效果。
Xiaofeng Mao, Zhen Li, Chuanhao Li 等
提出CAT,通过结构化上下文管理提升长时序软件工程代理的推理能力,达57.6%解决率。
Shukai Liu, Jian Yang, Bo Jiang 等
提出时间积分最优传输(TiOT)框架,提升时间序列比较的准确性和稳定性。
Thai P. D. Nguyen, Hong T. M. Chu, Kim-Chuan Toh
提出多种分词惩罚函数,量化词拆分对LLM性能影响,实验证明显著。
Sachin Pawar, Manoj Apte, Kshitij Jadhav 等