Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents
FCGRAFT以函数级KV缓存实现代码策略合成,成功率提升18.31%,速度加快2.3倍。
Saehun Chun, Wonje Choi, Sera Choi 等
FCGRAFT以函数级KV缓存实现代码策略合成,成功率提升18.31%,速度加快2.3倍。
Saehun Chun, Wonje Choi, Sera Choi 等
Nous通过结构化八维行为模型从交易行为提取人类认知多样性,并尝试通过提示注入,但效果有限。
Haowei Qian
提出LocFac-RL,使用离散扩散模型提升视觉-文本推理效率,减少26.9%计算量。
Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai 等
DeepJEB++通过2D潜空间增强,扩展小样本喷气发动机支架3D数据集,自动标注性能指标。
Soyoung Yoo, Leekyo Jeong, Jinsu Ra 等
本研究比较Diff-in-Means(DiM)与INLP在模型拒绝行为中的线性方向提取效果,发现INLP的反事实翻转表现优异。
Elisabetta Rocchetti, Alfio Ferrara
本研究评估多模态基础模型在电力配电缺陷检测中的感知、推理和工具使用能力,实验数据详实。
Quan Quan
RSMeM通过知识增强记忆演化提高遥感代理的工具使用准确率,提升6%。
Bingxian Wu, Yu Zhang, Zonghao Guo 等
Sparse2Act通过动作对齐的稀疏3D表示实现跨域机器人操作,LIBERO-10基准上成功率86.9%。
Yu Guo, Chang Yu, Siyu Ma 等
VLADriveBench结合观察指标与干预协议,评估VLA模型中CoT与动作的因果关系。
Thach Nguyen, Danhua Guo, Tom Lampo 等
CAPED通过任务驱动的选择性曝光,有效降低移动GUI代理中的偶发隐私泄露。
Siyu Shen, Fenghao Xu, Wenrui Diao 等
本文提出DIRECT,通过多模态场景上下文动态分配测试时计算资源,有效提升机器人规划性能,降低65%的延迟。
Jadelynn Dao, Milan Ganai, Yasmina Abukhadra 等
VLGA引入密集3D几何专家,通过LiDAR监督实现 dense pointmap 重建,显著提升自动驾驶安全性和精度。
Jin Yao, Dhruva Dixith Kurra, Tom Lampo 等
提出基于Transformer的DAR-Net模型,结合像素级场景监督,识别水下多人与机器人合作中的六类潜水员活动,利用首个水下潜水员活动数据集UDA,显著优于现有模型。
Sadman Sakib Enan, Junaed Sattar
提出Turbo-Inference策略,通过迭代利用检测与分割的互补信息,显著提升COCO、Cityscapes等数据集的检测和分割性能。
Zhen Zhao, Gang Zhang, Xiaolin Hu 等
提出Bebop,通过TV损失和拒绝采样显著提升RL训练中MTP接受率,达95%并实现1.8倍加速。
Yucheng Li, Huiqiang Jiang, Yang Xu 等
本研究比较xLSTM、Mamba-2和Gated DeltaNet三种子二次架构,验证xLSTM在复杂任务中的优越性,核心在于其稳健的状态追踪与记忆累积。
Anamaria-Roberta Hartl, Levente Zólyomi, David Stap 等
提出Latent World Recovery(LWR)框架,有效应对多模态数据中的缺失问题,通过模态特定嵌入在共享潜在空间中对齐,实现缺失模态的鲁棒预测。
Hui Wang, Tianyu Ren, Joseph Butler 等
基于MARUS的虚拟海试框架,通过命令-执行追溯实现IMO/ITTC标准的USV转向性能数据采集与系统识别。
Paria Rezayan
Fourier特征将点云映射至多频空间,使模仿策略更精确;真实任务归一化得分由14.8%升至40.2%。
Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling 等
ExtremeWhenBench基准测试表明,长视频的自然语言时间定位是一个搜索问题,检索-定位混合方法性能提升6.7倍。
Sukmin Seo, Geewook Kim