Point Bridge: 3D Representations for Cross Domain Policy Learning
Point Bridge利用统一点云表示实现零样本模拟到现实迁移,提升44%。
Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto 等
Point Bridge利用统一点云表示实现零样本模拟到现实迁移,提升44%。
Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto 等
使用表示自编码器扩展文本到图像扩散变压器,RAE在所有模型规模上优于VAE。
Shengbang Tong, Boyang Zheng, Ziteng Wang 等
ActionMesh结合时间维Diffusion与自动编码,快速生成符合拓扑的动画3D网格。
Remy Sabathier, David Novotny, Niloy J. Mitra 等
SAMTok将任何区域掩码转化为两个特殊符号,实现像素级理解,无需架构改动。
Yikang Zhou, Tao Zhang, Dengxian Gong 等
提出HumanoidPF编码人形避障关系,显著提升复杂室内场景中的碰撞自由导航能力。
Han Xue, Sikai Liang, Zhikai Zhang 等
EvoCUA通过自我进化循环结合可验证合成与大规模交互,显著提升GUI任务中的自主智能能力。
Taofeng Xue, Chong Peng, Mianqiu Huang 等
UXCascade通过模拟用户代理进行可扩展的可用性测试,提供结构化的用户反馈。
Steffen Holter, Eunyee Koh, Mustafa Doga Dogan 等
PhysProver结合RLVR和PhysLeanData,提升物理定理证明2.4%。
Hanning Zhang, Ruida Wang, Rui Pan 等
提出迭代式自我修正策略,结合视觉语言模型提升复杂指令的图像生成准确率,达成16.9%的提升。
Shantanu Jaiswal, Mihir Prabhudesai, Nikash Bhardwaj 等
RayRoPE利用投影射线编码,确保多视角变换中的SE(3)不变性与几何适应性,提升新视点合成性能。
Yu Wu, Minsik Jeon, Jen-Hao Rick Chang 等
MonoRace采用单目相机与IMU,实现无人机在无外部追踪条件下的冠军级高速飞行,最高速度达100 km/h。
Stavrow A. Bahnam, Robin Ferede, Till M. Blaha 等
本研究提出Transformer实现α-Hölder光滑非参数回归的最小极大收敛速率,参数仅需Θ(log n)。
Michelle Ching, Ioana Popescu, Nico Smith 等
CorpusQA基准测试挑战LLM在1000万标记上的全局推理能力。
Zhiyuan Lu, Chenliang Li, Yingcheng Shi 等
TIDAL通过双频率架构,将语义推理与高频控制解耦,实现动态环境下9Hz控制更新,性能提升2倍。
Yuteng Sun, Haoran Wang, Ruofei Bai 等
该论文综述自动驾驶汽车的应急规划,提出逻辑条件混合控制框架,强调反应性和主动性安全方法。
Lei Zheng, Luyao Zhang, Peiqi Yu 等
提出执行引导的自动化AI研究框架,通过演化搜索和强化学习优化LLM生成的科研想法。
Chenglei Si, Zitong Yang, Yejin Choi 等
提出Soft Tail-dropping自适应视觉编码器(STAT),根据图像复杂度动态调整输出Token数,提升生成质量。
Zeyuan Chen, Kai Zhang, Zhuowen Tu 等
Jet-RL框架通过统一FP8精度流提高RL训练效率,提升33% rollout速度。
Haocheng Xi, Charlie Ruan, Peiyuan Liao 等
Habibi提出基于多步数据整理和课程学习的开源阿拉伯语多方言TTS框架,覆盖12+方言,性能优于单一方言模型。
Yushen Chen, Junzhe Liu, Yujie Tu 等
提出对比因果度量,揭示概率度量不能有效捕捉推理因果关系。
Hojin Kim, Jaehyung Kim