PPLNs: Parametric Piecewise Linear Networks for Event-Based Temporal Modeling and Beyond
PPLNs通过参数化分段线性函数提升事件相机的时序视觉推理性能,实验显示在转向预测等任务上表现优异。
Chen Song, Zhenxiao Liang, Bo Sun 等
PPLNs通过参数化分段线性函数提升事件相机的时序视觉推理性能,实验显示在转向预测等任务上表现优异。
Chen Song, Zhenxiao Liang, Bo Sun 等
提出空间-时间注意力机制STAtten,提升Spike Transformer性能,实验在CIFAR、ImageNet等数据集均优于空间注意力。
Donghyun Lee, Yuhang Li, Youngeun Kim 等
RNG利用神经高斯点云实现快速可重光的3D重建,支持复杂材质和软边界,训练仅需1.3小时。
Jiahui Fan, Fujun Luan, Jian Yang 等
基于SAM2和Llama 2的RoboNurse-VLA实现高精度手术器械交接。
Shunlei Li, Jin Wang, Rui Dai 等
提出一种通过强化学习学习桥接策略的方法,提升机器人在新环境中的适应能力。
Alicia Li, Nishanth Kumar, Tomás Lozano-Pérez 等
TwinCL模型通过双编码器优化对比学习,提升推荐准确性5.6%。
Chengkai Liu, Jianling Wang, James Caverlee
Emu3通过单一Transformer模型,仅用下一词预测,跨模态性能超越SDXL和LLaVA-1.6。
Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo 等
提出基于黑箱预测器和保形决策策略的去中心化多智能体安全控制方法,结合控制屏障函数实现安全性保证。
Sacha Huriot, Hussein Sibai
MinerU利用PDF-Extract-Kit实现多样文档高精度内容提取,结合规则优化。
Bin Wang, Chao Xu, Xiaomeng Zhao 等
通过将Flang与标准MLIR完全集成,实现高达三倍的性能提升。
Nick Brown
提出一种稀疏贝叶斯网络类生成世界模型,支持开放式学习,具备可解释性与扩展性。
Lancelot Da Costa
Search3D通过层级结构实现开放词汇的3D场景细粒度分割,提升多层次搜索能力。
Ayca Takmaz, Alexandros Delitzas, Robert W. Sumner 等
Embodied-RAG通过层次化语义森林构建非参数记忆,提升机器人导航与问答能力。
Quanting Xie, So Yeon Min, Pengliang Ji 等
提出GRAPHEDX,基于神经集散度的通用成本图编辑距离估算模型。
Eeshaan Jain, Indradyumna Roy, Saswat Meher 等
提出MoGenTS,基于空间-时间联合建模的离散运动生成方法,FID在HumanML3D降低26.6%。
Weihao Yuan, Weichao Shen, Yisheng He 等
提出Vulnerability-aware Adversarial Training(VAT),根据用户拟合度调节扰动大小,增强推荐系统抗毒性。
Kaike Zhang, Qi Cao, Yunfan Wu 等
提出AV-ALOHA系统,结合主动视觉(AV)实现机器人双手操控中的动态视角调整,显著提升复杂任务表现。
Ian Chuang, Andrew Lee, Dechen Gao 等
基于薛定谔桥的深度条件生成模型,通过离散化SDE实现高质量条件采样。
Hanwen Huang
Molmo是开源的视觉-语言模型,利用PixMo数据集实现72B参数性能超越闭源模型。
Matt Deitke, Christopher Clark, Sangho Lee 等
EventHDR方法通过事件序列重建高帧率HDR视频,提供首个真实配对数据集。
Yunhao Zou, Ying Fu, Tsuyoshi Takatani 等