Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance
提出基于场景赋能的两阶段模型,结合扩散机制实现语言引导的人体动作生成,显著优于基线。
Zan Wang, Yixin Chen, Baoxiong Jia 等
提出基于场景赋能的两阶段模型,结合扩散机制实现语言引导的人体动作生成,显著优于基线。
Zan Wang, Yixin Chen, Baoxiong Jia 等
AgentStudio通过多模态环境和工具,评估虚拟代理的基础能力,涵盖GUI、API和视频理解。
Longtao Zheng, Zhiyuan Huang, Zhenghai Xue 等
提出HOV-SG,基于层次结构的开集词汇3D场景图映射,显著提升多层建筑中的语言引导机器人导航性能。
Abdelrhman Werby, Chenguang Huang, Martin Büchner 等
系统化分析了448个越狱提示,提出两大有效策略,构建自动化生成系统。
Zhiyuan Yu, Xiaogeng Liu, Shunning Liang 等
提出QKFormer,基于线性复杂度Q-K注意机制的分层脉冲变换器,ImageNet准确率达85.65%。
Chenlin Zhou, Han Zhang, Zhaokun Zhou 等
提出GoodSAM框架,结合DAR与MKA实现无标注全景语义分割,提升3.75% mIoU。
Weiming Zhang, Yexin Liu, Xu Zheng 等
CoverUp结合覆盖分析与LLM,显著提升Python测试覆盖率。
Juan Altmayer Pizzorno, Emery D. Berger
提出PruMerge,通过自适应筛选和合并视觉Token,平均压缩14倍,保持性能。
Yuzhang Shang, Mu Cai, Bingxin Xu 等
提出基于手势的多无人机队形成控制,集成检测、追踪与人机交互模块,支持实时动态调节。
Vít Krátký, Giuseppe Silano, Matouš Vrba 等
提出CRPlace,利用BEV表示融合相机与雷达背景信息,实现地点识别,准确率达91.2%。
Shaowei Fu, Yifan Duan, Yao Li 等
采用多模态数学问题数据集MATHVERSE,结合文本内容削减与视觉推理评估,揭示MLLM在理解数学图像中的不足。
Renrui Zhang, Dongzhi Jiang, Yichi Zhang 等
PEFT通过调整少量参数实现大模型微调,显著降低计算成本。
Zeyu Han, Chao Gao, Jinyang Liu 等
采用随机对照试验,利用GPT-4在个性化条件下比人类更具说服力,提升81.7%的说服概率。
Francesco Salvi, Manoel Horta Ribeiro, Riccardo Gallotti 等
提出无监督跨视角地理定位框架,利用投影和重排序实现40%以上的伪标签正确率。
Guopeng Li, Ming Qian, Gui-Song Xia
通过“紫色问题”测试模型执法的鲁棒性,发现即使定义简单也难以防范 jailbreak。
Taeyoun Kim, Suhas Kotha, Aditi Raghunathan
提出多目标集成方法,从多准则中选择最优反事实解释,提升解释质量。
Ignacy Stępka, Mateusz Lango, Jerzy Stefanowski
提出基于随机插值器和Föllmer过程的概率预测框架,利用SDE实现条件分布采样。
Yifan Chen, Mark Goldstein, Mengjian Hua 等
LlamaFactory整合多种高效微调技术,支持100+模型,无编码需求。
Yaowei Zheng, Richong Zhang, Junhao Zhang 等
提出基于语义匹配的mathlib4搜索引擎,提升查找效率。
Guoxiong Gao, Haocheng Ju, Jiedong Jiang 等
提出“有效截止”概念,通过跨版本探测估算LLM的资源级时间对齐,揭示实际知识截止与报告截止的差异。
Jeffrey Cheng, Marc Marone, Orion Weller 等