SENSEI: Semantic Exploration Guided by Foundation Models to Learn Versatile World Models
SENSEI利用视觉语言模型引导语义探索,提升强化学习的行为多样性。
Cansu Sancaktar, Christian Gumbsch, Andrii Zadaianchuk 等
SENSEI利用视觉语言模型引导语义探索,提升强化学习的行为多样性。
Cansu Sancaktar, Christian Gumbsch, Andrii Zadaianchuk 等
SePer通过语义困惑度变化衡量检索在RAG中的信息增益,实验显示其与人类偏好高度一致。
Lu Dai, Yijie Xu, Jinhui Ye 等
提出Evidential Proximal Policy Optimization (EPPO),通过证据不确定性保持策略适应性,提升非平稳环境连续控制性能。
Abdullah Akgül, Gulcin Baykal, Manuel Haußmann 等
提出无trimap的目标感知视频抠图框架OAVM,结合跨帧引导提升细节与对象识别,达成SOTA性能。
Huayu Zhang, Dongyue Wu, Yuanjie Shao 等
Phantom方法通过人类视频训练机器人,实现92%的成功率,无需机器人数据。
Marion Lepert, Jiaying Fang, Jeannette Bohg
本研究提出“安全税”现象,安全对齐提升安全性但降低推理能力,采用简化两阶段管道验证。
Tiansheng Huang, Sihao Hu, Fatih Ilhan 等
Falcon利用部分去噪策略,结合历史信息实现2-7倍加速,保持性能。
Haojun Chen, Minghao Liu, Chengdong Ma 等
开发GAS(P)方法评估未提示性文本中的性别偏差,发现偏差在模型中持续存在。
Jennifer Mickel, Maria De-Arteaga, Leqi Liu 等
利用统计形状建模揭示性别对心脏形态的影响,性别解释了至少25%的形态变异。
Beatrice Moscoloni, Cameron Beeche, Julio A. Chirinos 等
SEE-Net通过事件数据实现图像亮度自适应调整,提升宽光照范围下的图像质量。
Yunfan Lu, Xiaogang Xu, Hao Lu 等
提出ACID,用变换器神经网络实现条件独立性检测,性能优越。
Bao Duong, Nu Hoang, Thin Nguyen
DexGraspVLA框架在复杂场景中实现90%以上的灵巧抓取成功率。
Yifan Zhong, Xuchuan Huang, Ruochong Li 等
通过脑编码、探测和基准分析揭示大型语言模型的三阶段相变。
Yuko Nakagi, Keigo Tada, Sota Yoshino 等
EndoPBR通过物理渲染模型估算手术场景中的材料与光照,实现逼真新视图合成。
John J. Han, Jie Ying Wu
利用合成数据和虚拟仿真识别生成角落案例,提高自动驾驶安全性。
Gabriel Kenji Godoy Shimanuki, Alexandre Moreira Nascimento, Lucio Flavio Vismari 等
提出Q♯,基于分布式RL的KL正则化算法,优化大模型后训练表现。
Jin Peng Zhou, Kaiwen Wang, Jonathan Chang 等
Point Policy通过关键点实现观察与动作的统一,从人类视频中学习机器人策略,显著提升泛化能力。
Siddhant Haldar, Lerrel Pinto
InterMimic利用教师-学生策略,从不完美MoCap数据中学习全身人-物交互动作,增强物理真实性。
Sirui Xu, Hung Yu Ling, Yu-Xiong Wang 等
通过符号机制支持大型语言模型的抽象推理,实验显示Llama-3.1在规则归纳任务中达到95%准确率。
Yukang Yang, Declan Campbell, Kaixuan Huang 等
本研究利用翻译链实验揭示大语言模型(LLMs)在迭代生成中信息逐渐扭曲,强调策略提示减缓效果。
Amr Mohamed, Mingmeng Geng, Michalis Vazirgiannis 等