PointLLM: Empowering Large Language Models to Understand Point Clouds
PointLLM通过点云编码器与大模型融合,实现对彩色点云的理解与描述。
Runsen Xu, Xiaolong Wang, Tai Wang 等
PointLLM通过点云编码器与大模型融合,实现对彩色点云的理解与描述。
Runsen Xu, Xiaolong Wang, Tai Wang 等
提出InterDiff,基于扩散模型结合物理先验实现长时段3D人-物交互预测。
Sirui Xu, Zhengyuan Li, Yu-Xiong Wang 等
EMDB利用EM传感器和深度图,构建全球范围内高精度3D人体姿态与形状数据集。
Manuel Kaufmann, Jie Song, Chen Guo 等
TouchStone通过使用强大的LLM如GPT-4评估LVLM的对话质量,覆盖五大能力和27个子任务。
Shuai Bai, Shusheng Yang, Jinze Bai 等
InteRecAgent结合大语言模型和推荐模型,实现互动推荐,提升对话系统表现。
Xu Huang, Jianxun Lian, Yuxuan Lei 等
提出Epsilon Scaling方法,显著降低扩散模型的曝光偏差,在CIFAR-10上取得2.17 FID。
Mang Ning, Mingxiao Li, Jianlin Su 等
使用DCMM模型推导节点混合概率的有限样本展开,进行不确定性量化和排名推断。
Sohom Bhattacharya, Jianqing Fan, Jikai Hou
LongBench是首个双语多任务长文本理解基准,涵盖21个数据集,平均长度6,711词,推动长上下文模型性能提升。
Yushi Bai, Xin Lv, Jiajie Zhang 等
Confucius框架通过易到难的课程和内省反馈提高LLM工具使用能力,超越现有基线。
Shen Gao, Zhengliang Shi, Minghang Zhu 等
提出残差去噪扩散模型(RDDM),实现图像生成与修复的双重扩散机制。
Jiawei Liu, Qiang Wang, Huijie Fan 等
提出RL辅助的演化算法(RL-EA),通过策略学习提升优化效率,实验证明在多个基准测试中优于传统方法。
Yanjie Song, Yutong Wu, Yangyang Guo 等
Nougat使用视觉Transformer模型将PDF学术文档转换为轻量级标记语言,显著提升数学表达式的语义保留率。
Lukas Blecher, Guillem Cucurull, Thomas Scialom 等
OmniQuant通过可学习的裁剪和变换技术,实现LLMs的低比特高性能量化,适用于多场景。
Wenqi Shao, Mengzhao Chen, Zhaoyang Zhang 等
Project Aria设备通过多模态传感器促进个性化AI研究。
Jakob Engel, Kiran Somasundaram, Michael Goesele 等
本文评估多变量时间序列异常检测算法,批判点调整协议,提出基于主成分分析(PCA)的强大基线模型。
Mohamed El Amine Sehili, Zonghua Zhang
提出SWIE和OVERMISS提升大模型翻译忠实度,显著改善BLEU和信任指标。
Yijie Chen, Yijin Liu, Fandong Meng 等
提出基于自我引导数据选择的Instruction-Following Difficulty (IFD)指标,显著提升LLM指令调优效率。
Ming Li, Yong Zhang, Zhitao Li 等
本研究分析大语言模型在多项选择题中对选项顺序敏感,发现性能差异达75%,提出校准策略改善鲁棒性。
Pouya Pezeshkpour, Estevam Hruschka
提出统一框架构建LLM自主代理,涵盖感知、记忆、规划与执行,提升任务完成能力。
Lei Wang, Chen Ma, Xueyang Feng 等
SWIM方法利用人类视频数据训练机器人模型,30分钟内学习操控技能。
Russell Mendonca, Shikhar Bahl, Deepak Pathak