Post-Generation Curation of Synthetic Images via Homogeneous-Heterogeneous Splitting
HO-HE后生成筛选以保真度兼顾多样性,CIFAR-10用30万样本达95%准确率。
Disheng Liu, Tuo Liang, Chaoda Song 等
HO-HE后生成筛选以保真度兼顾多样性,CIFAR-10用30万样本达95%准确率。
Disheng Liu, Tuo Liang, Chaoda Song 等
提出混合动态数据收集方法,大幅提升VLA模型空间泛化能力,成功率提升40%。
Jincheng Tang, Yilong Zhu, Zhengyuan Xie 等
提出基于分布奖励的强化微调方法,有效提升图像生成质量,FID从8.30降至5.77。
Ruihang Li, Mengde Xu, Shuyang Gu 等
Bridge-WA通过预测场景变化提升机器人操作成功率,在VLABench上提高了9.7%。
Yongjie Bai, Hanting Wang, Mingtong Dai 等
LongEgoRefer基准测试长时自我中心视频指代表达理解,挑战现有模型。
Shunya Kato, Taiki Miyanishi, Shuhei Kurita 等
MAVEN框架通过动态证据状态奖励提升长上下文推理性能,在LongBench v2上提高3.5%。
Ya Gao, Pekka Marttinen
PWM-ArtGen通过学习视觉动态与运动参数的联合分布,实现单图多关节物体生成,显著优于基线。
Wentao Zheng, Ancong Wu
ScopeEdit采用双分支机制实现多模态知识在线编辑中的范围控制,提升跨模态传递与局部保持的平衡。
Siyuan Li, Youyuan Zhang, Ruitong Liu 等
PhysMani结合物理原则的3D高斯世界模型与未来感知的动作策略模型,提升动态物体操控成功率。
Peng Yun, Shouwang Huang, Hao Li 等
Zeus为无调优的时间序列基础模型,采用多尺度Transformer和多目标掩码策略,提升多任务性能。
Yisong Fu, Zezhi Shao, Chengqing Yu 等
SkillCoach通过自进化评分标准提升代理技能使用,显著提高评估质量。
Jiayin Zhu, Kelong Mao, Yudong Guo 等
Koopman算子理论通过EDMD等方法实现复杂动力系统的全局线性化。
Igor Mezić, Jorge Cortés, Karl Worthmann 等
研究发现,SDPO在特定条件下加速领域内学习,但在跨域场景中表现不佳。
Meng Wang, Haohan Zhao, Wenzhuo Liu 等
ReQuest通过不确定性驱动的关键帧选择提高长视频问答准确率。
Minkuk Kim, Suyong Yun, Young Tae Kim 等
LASER通过视觉注意力保持与抑制Sink,有效缓解LVLMs的视觉遗忘问题。
Bowen Yuan, Zijian Wang, Yadan Luo 等
ICDepth通过In-Context Conditioning和SAND-Attention实现视频深度估计,数据效率提升6-13倍。
Xuanhua He, Jiaxin Xie, Mingzhe Zheng 等
提出PanoGaussian,将单目4D场景合成扩展至未见区域,保持几何一致性。
Yuankun Yang, Yi Wei, Wenyang Zhou 等
提出信息不对称的多智能体预测框架InfoDelphi,通过公共私有证据分割提升预测准确率12-18%。
Yuante Li, Yicheng Tao, Kate Zhang 等
DriveTeach-VLA通过DVD和2D-TGP优化视觉语言行动模型,Navsim上PDMS达90.4。
Yuguang Yang, Canyu Chen, Zhewen Tan 等
提出AgenticDataBench,基于多领域真实数据和技能层级的端到端数据智能评测平台。
Zhaoyan Sun, Shan Zhong, Daizhou Wen 等