排序: 最新 热门 引用
cs.CV 2311.12871

An Embodied Generalist Agent in 3D World

提出LEO,基于3D视觉-语言对齐与指令微调的多模态通用智能体,显著提升3D场景理解与操作能力。

Jiangyong Huang, Silong Yong, Xiaojian Ma 等

2023-11-18 42
cs.CL 2311.09144

Grounding Gaps in Language Model Generations

提出衡量对话中的“基础行为”指标,发现大模型生成的“理解行为”明显少于人类,训练偏好数据降低了“理解行为”的频率。

Omar Shaikh, Kristina Gligorić, Ashna Khetan 等

2023-11-16 39