SMASH: Mastering Scalable Whole-Body Skills for Humanoid Ping-Pong with Egocentric Vision
SMASH结合端上视觉感知与全身技能学习,实现 humanoid 乒乓球连续击球,突破外部感知限制。
Junli Ren, Yinghui Li, Kai Zhang 等
SMASH结合端上视觉感知与全身技能学习,实现 humanoid 乒乓球连续击球,突破外部感知限制。
Junli Ren, Yinghui Li, Kai Zhang 等
多LLM修订管道通过重新求解、支架和内容效应分解二次增益,提升MCQ和代码生成任务表现。
Jingjie Ning, Xueqi Li, Chengyu Yu
CGCMA通过条件门控跨模态注意力实现事件条件异步融合,在CryptoMI数据集上提升Sharpe比率至+0.449。
Yunxiang Guo
提出Bench2Drive-VL,结合DriveCommenter实现闭环自主驾驶评估,支持多模态推理与动态问答。
Xiaosong Jia, Yuqian Shao, Zhenjie Yang 等
UniMixer提出统一推荐模型缩放架构,通过参数化TokenMixer提升效率,结合注意力、TokenMixer和FM优势。
Mingming Ha, Guanchen Wang, Linxun Chen 等
HabitatAgent通过多代理系统实现95%准确率的房屋咨询。
Hongyang Yang, Yanxin Zhang, Yang She 等
提出TPC-CMA方法,减少模态间隙82.3%,仅损失4.84%准确率。
Hongyuan Liu, Qinli Yang, Wen Li 等
DreamControl-v2通过在机器人空间训练引导扩散模型,实现自主 humanoid 技能,融合多源数据,提升规模与自动化。
Sudarshan Harithas, Sangkyung Kwak, Pushkal Katara 等
通过扰动分析,证明Grothendieck常数K_G大于Davie-Reeds界限,提升最小界约1.6769至1.6769+10^−12。
Chris Jones, Giulio Malavolta
C-TRAIL结合LLM与信任机制,通过闭环Recall-Plan-Update实现自主驾驶轨迹规划。
Zhihong Cui, Haoran Tang, Tianyi Li 等
提出基于粒状球计算的方形超像素生成方法,支持端到端深度学习优化。
Shuyin Xia, Meng Yang, Dawei Dai 等
PRISM利用多视角视频和三维知识本体,提升零售环境中 embodied VLM的空间、物理和行动理解。
Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy 等
多层记忆框架提高LLM的长期上下文保留,成功率46.85%,六周期保留率56.90%。
Sunil Tiwari, Payal Fofadiya
GenSplat通过3D高斯散射实现视图泛化,提升机器人策略学习的鲁棒性。
Sen Wang, Huaiyi Dong, Jingyi Tian 等
LatentPilot通过未来观察训练学习动作条件下的视觉动态,实现场景感知导航,达成SOTA。
Haihong Hao, Lei Chen, Mingfei Han 等
SparseDriveV2通过密集静态词表和分解轨迹实现端到端自主驾驶,达92.0 PDMS。
Wenchao Sun, Xuewu Lin, Keyu Chen 等
GISTBench用IG与IS评估LLM能否从行为证据可靠提取用户兴趣;与调查相关ρ=0.67。
Iordanis Fostiropoulos, Muhammad Rafay Azhar, Abdalaziz Sawwan 等
MEDiC融合CLIP蒸馏与像素重建,ImageNet-1K达73.9% kNN、85.1%微调。
Konstantinos Georgiou, Maofeng Tang, Hairong Qi
StreamingVLA通过动作流匹配和自适应早期观察实现2.4倍加速,减少6.5倍停顿。
Yiran Shi, Dongqi Guo, Tianchen Zhao 等
提出AgentTrace框架,通过可视化行为轨迹提升用户对个性化智能代理的风险认知与追溯能力。
Zifan Peng, Mingchen Li