GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
GenEvolve通过工具协调的视觉经验蒸馏实现自我进化图像生成,提升生成质量。
Sixiang Chen, Zhaohu Xing, Tian Ye 等
GenEvolve通过工具协调的视觉经验蒸馏实现自我进化图像生成,提升生成质量。
Sixiang Chen, Zhaohu Xing, Tian Ye 等
Insights Generator通过多代理系统提高LLM诊断效率,提升30.4pp性能。
Akshay Manglik, Apaar Shanker, Kaustubh Deshpande 等
提出了一种结构潜在点学习方法,在RLBench上提高了56%的任务成功率。
Yicheng Jiang, Jiaxu Wang, Junhao He 等
FTerViT实现全三值化,包括所有权重和归一化参数,准确率82.43%,模型压缩达15倍。
Szymon Ruciński, Pietro Bonazzi, Engin Türetken 等
ROAR-3D利用视图路由器升级预训练单视图模型,实现多视角高保真3D生成。
Hanxiao Sun, Mingxin Yang, Shuhui Yang 等
提出音乐注意力机制,提升音乐生成质量,减少重复,增强多样性。
Shinnosuke Takasuka, Hideo Mukai
通过逆运动学重建驾驶视觉-语言模型(VLA),引入未来视觉状态预测与逆运动学网络,显著提升轨迹规划性能。
Junsung Park, Hyunjung Shim
CHOIR以接触约束重建单目视频中的4D手物交互,但论文摘要未报告具体数值指标。
Hao Xu, Yilin Liu, Yinqiao Wang 等
PEACH框架通过点云编码实现对材料条件的图网络模拟器的零样本传输。
Philipp Dahlinger, Balázs Gyenes, Niklas Freymuth 等
提出PlexRL,通过集群层面调度多任务大模型,有效提升RLVR效率,GPU成本降低37.58%。
Yiqi Zhang, Fangzheng Jiao, Tian Tang 等
提出DUET框架,通过双空间线性解码实现预训练TTS模型的情感控制,提升情感表达自然度。
Xu Zhang, Longbing Cao, Zhangkai Wu
GAMR通过主动合成虚拟异常样本,利用几何正则化增强噪声标签学习的鲁棒性。
Ningkang Peng, Jingyang Mao, Xiaoqian Peng 等
NeuroNL2LTL结合神经符号方法,实现自然语言到线性时序逻辑的高效翻译,达28%语义等价率。
Paapa Kwesi Quansah, Ernest Bonnah
Auto-Dreamer通过离线整合机制提升语言代理记忆效率,成功在ScienceWorld任务中提升7点成功率,内存缩减12倍。
Chongrui Ye, Yuxiang Liu, Yu Wang 等
HeadKV通过不对称分配注意力头缓存,实现高效自回归图像生成,显著提高内存效率。
Guotao Liang, Baoquan Zhang, Zhiyuan Wen 等
$Δ$YNAMICS使用语言表示推断视频中的刚体动力学,分割IoU提升7倍。
Chia-Hsiang Kao, Cong Phuoc Huynh, Chien-Yi Wang 等
提出谱带算法(SpectralUCB和SpectralTS)解决图上平滑函数的带宽问题,利用有效维度实现低调控。
Tomáš Kocák, Michal Valko, Rémi Munos 等
SUGAR框架利用人类视频数据,无需任务奖励或参考动作,实现 humanoid 机器人通用运动技能。
Tianshu Wu, Xiangqi Kong, Yue Chen 等
提出多类对称损失的唯一凸解——多类未钩损失,增强标签噪声鲁棒性。
Alexandre Lemire Paquin, Brahim Chaib-Draa, Philippe Giguère
MetaEarth-MM模型实现了五种模态的遥感图像生成与翻译,基于场景中心的联合建模。
Zhiping Yu, Chenyang Liu, Jinqi Cao 等