Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection
Goal2Skill框架通过高低层次分离实现长时序操控,显著提升成功率至32.4%。
Zhen Liu, Xinyu Ning, Zhe Hu 等
Goal2Skill框架通过高低层次分离实现长时序操控,显著提升成功率至32.4%。
Zhen Liu, Xinyu Ning, Zhe Hu 等
ASTER通过潜在空间伪异常生成,结合Transformer和预训练大模型实现无监督时间序列异常检测,显著优于现有方法。
Romain Hermary, Samet Hicsonmez, Dan Pineau 等
Doc-V*通过逐步证据聚合提升多页文档VQA性能,超越RAG基线47.9%。
Yuanlei Zheng, Pei Fu, Hang Li 等
提出BVE框架,通过3D遮罩和自构数据实现高质量3D编辑,显著提升编辑效果。
Yizhao Xu, Hongyuan Zhu, Caiyun Liu 等
本文证明线性最小二乘(OLS)是单层线性Transformer的特殊案例,利用谱分解实现一阶解。
Xiaojun Tan, Yuchen Zhao
提出代理压缩假说(PCH)揭示奖励黑客机制,强调目标压缩、优化放大与评估器-策略共适应。
Xiaohua Wang, Muzhao Tian, Yuqi Zeng 等
RiskWebWorld提供了1,513个任务,展示了GUI代理在电商风险管理中的挑战,顶级模型成功率49.1%。
Renqi Chen, Zeyin Tao, Jianming Guo 等
LAMO框架通过多角色编排提升轻量级GUI代理的任务扩展性,在ScreenSpot-pro上达到52.6%的准确率。
Ziwei Wang, Junjie Zheng, Leyang Yang 等
提出一种轻量级框架,通过KL散度分析混合精度SSM-Transformer模型的量化敏感性。
Jason Kong, Nilesh Prasad Pandey, Flavio Ponzina 等
提出双重视角分析AI代理的创造力,强调功能性与本体性差异。
Giorgio Franceschelli, Mirco Musolesi
提出InfiniteScienceGym,基于种子生成可验证的科学问答基准,评估模型推理能力。
Oliver Bentham, Vivek Srikumar
本研究系统分析大规模语言模型的在策略蒸馏(OPD)机制,发现成功依赖思维模式一致性与新能力提供。
Yaxuan Li, Yuxin Zuo, Bingxiang He 等
提出Touch Dreaming增强的HTD模型,实现 humanoid 复杂接触操控,成功提升成功率至90.9%。
Yaru Niu, Zhenlong Fang, Binghong Chen 等
提出Parcae,基于动力系统稳定性约束的循环变换模型,提升验证困惑度6.3%,实现参数效率显著提升。
Hayden Prairie, Zachary Novack, Taylor Berg-Kirkpatrick 等
提出树学习框架,通过层级参数继承实现多技能持续学习,有效防止灾难性遗忘。
Yifei Yan, Linqi Ye
提出CAMFusion多视角变换器,有效融合多视点vision-language描述,提升3D语义分类性能。
Tomas Berriel Martins, Martin R. Oswald, Javier Civera
提出Fun-TSG,一种基于函数驱动的多变量时间序列生成器,支持细粒度异常标注。
Pierre Lotte, André Péninou, Olivier Teste
提出SD-Zero,通过自我修正将二元奖励转化为密集的逐词监督,提升数学和编码推理性能。
Yinghui He, Simran Kaur, Adithya Bhaskar 等
V-Nutri融合成品帧与烹饪关键帧,探索视频线索提升营养估计。
Chengkun Yue, Chuanzhi Xu, Jiangpeng He
Meerkat以聚类驱动智能体搜索跨轨迹违规,在CyBench发现约4倍更多奖励投机。
Adam Stein, Davis Brown, Hamed Hassani 等