A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning
采用深度强化学习(SAC、DroQ)在20分钟内实现四足机器人自主行走,关键在于正则化和系统设计。
Laura Smith, Ilya Kostrikov, Sergey Levine
采用深度强化学习(SAC、DroQ)在20分钟内实现四足机器人自主行走,关键在于正则化和系统设计。
Laura Smith, Ilya Kostrikov, Sergey Levine
Adan为自适应Nesterov动量优化器,提升深度模型训练速度,复杂度为O(ε^{-3.5})。
Xingyu Xie, Pan Zhou, Huan Li 等
RelPose方法通过能量模型预测单物体相对旋转,提升稀疏图像下的3D重建效果。
Jason Y. Zhang, Deva Ramanan, Shubham Tulsiani
提出GCP-CROWN,结合混合整数规划生成高质量切平面,显著提升神经网络验证效率。
Huan Zhang, Shiqi Wang, Kaidi Xu 等
提出SNIPE方法,利用低阶交互估计网络干扰下的总处理效应。
Mayleen Cortez-Rodriguez, Matthew Eichhorn, Christina Lee Yu
MonoViT结合Transformer与卷积,基于自监督学习实现高精度单目深度估计,KITTI性能优越。
Chaoqiang Zhao, Youmin Zhang, Matteo Poggi 等
LATTE利用预训练语言模型和Transformer实现3D轨迹调整,无需任务先验。
Arthur Bucker, Luis Figueredo, Sami Haddadin 等
提出“符合风险控制”算法,扩展分割符合预测,能控制任意单调损失的期望值,适用于计算机视觉和自然语言处理,实验显示在误检率、图距离和F1-score上有效。
Anastasios N. Angelopoulos, Stephen Bates, Adam Fisch 等
使用线性倒立摆模型和神经适应控制实现3D欠驱动双足机器人稳定行走。
Victor Paredes, Ayonga Hereid
提出适用于偏误设定的条件均值嵌入的最优收敛速率,基于新颖的向量值插值空间。
Zhu Li, Dimitri Meunier, Mattes Mollenhauer 等
提出基于交叉注意力控制的Prompt-to-Prompt图像编辑方法,实现无需掩码的文本引导局部和全局编辑。
Amir Hertz, Ron Mokady, Jay Tenenbaum 等
提出文本反演方法,利用少量图片在冻结的文本-图像模型中学习新词嵌入,支持个性化生成。
Rinon Gal, Yuval Alaluf, Yuval Atzmon 等
ViP3D采用3D代理查询实现端到端视觉轨迹预测,显著优于传统方法。
Junru Gu, Chenxu Hu, Tianyuan Zhang 等
引入两工业连续过程数据集,结合Causal Discovery算法进行性能基准测试。
Giovanni Menegozzo, Diego Dall'Alba, Paolo Fiorini
提出DA²数据集,包含900万双臂抓取对,结合多维性能指标,训练端到端评估模型。
Guangyao Zhai, Yu Zheng, Ziwei Xu 等
通过视频打乱解决时间偏差问题的新框架,提升了模型泛化能力。
Jiachang Hao, Haifeng Sun, Pengfei Ren 等
提出InterFuser,融合多模态多视角传感器,提升自主驾驶安全性,达CARLA排行榜第一。
Hao Shao, Letian Wang, RuoBing Chen 等
利用CLIP模型进行图像感知评估,取得高相关性。
Jianyi Wang, Kelvin C. K. Chan, Chen Change Loy
提出MHST模型结合多模态信息实现复杂文档理解,基于TAT-DQA数据集,显著优于基线。
Fengbin Zhu, Wenqiang Lei, Fuli Feng 等
PanGu-Coder以两阶段函数级训练,在HumanEval上317M模型pass@1达17.07%。
Fenia Christopoulou, Gerasimos Lampouras, Milan Gritta 等