Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning
提出Q-Planning,通过离策略Q函数实现机器人策略的自我提升,提升成功率至99%。
Varun Giridhar, Anant Khandelwal, Jeremy A. Collins 等
提出Q-Planning,通过离策略Q函数实现机器人策略的自我提升,提升成功率至99%。
Varun Giridhar, Anant Khandelwal, Jeremy A. Collins 等
提出SRL-MPC,利用高阶控制屏障函数结合强化学习实现多形状异构机器人群的安全高效导航。
Ruihua Han, Rui Gao, Zhe Liu 等
提出图工程构建系统智能,利用任务结构、协调机制和状态管理实现多智能体协作。
Yuyuan Feng, Zhishang Xiang, Chaobin Yang 等
COTA方法通过比较替代方案提高LLM代理的运行时干预效果,提升了WebShop等环境中的表现。
Yanze Jiang, Mingxuan Li, Yuhao Wang 等
引入自由概率核实现零滚动超参数选择,有效避免大量仿真,提升Reservoir Computing性能。
Sara Malacarne, Andrea Ceni, Claudio Gallicchio
通过统计分析揭示空间无关线性模型在多变量时序预测中的竞争优势,质疑现有基准数据集的判别能力。
Kenneth Martin, Simon Heilig, Asja Fischer 等
UpgradeBench提供决策驱动的基准,评估LLM专家升级,平均质量遗憾为0.37pp。
Ye Chen, Weining Zhang
提出入库时语义编译(ISC),通过索引结构提升RAG系统效率,实验证明优于查询时解释。
Kyle Wild, Yusuke Takahashi, Asako Uraki
KoViDoRe利用多阶段数据生成,构建韩文多页结构化文档检索基准,揭示模型在复杂场景下的性能不足。
Yongbin Choi, Yongwoo Song, Mujeen Sung
SAC-Copula通过高斯Copula构建平滑相关的Gumbel场,实现扩散语言模型的高质量水印。
Baixin Li, Haiyun He
测试时扩展用于科学方程发现,搜索宽度是关键参数,提升了效率和性能。
Haowei Lin, Hubert Lim, Xiangyu Wang 等
提出CAIRO框架,结构化大规模元数据实现用户上下文感知的个性化商品画像,提升LLM重排序效果。
Dojun Hwang, Seunghan Lee, Cheonyoung Park 等
AESR框架通过全局提示增强与局部语义修复,有效实现身份保持的视频生成。
Jiayi Gao, Changcheng Hua, Jiaqi Tang 等
本文系统分析多模态推测解码的现状,评估Diffusion方法在多模态模型中的应用准备情况。
Yantao Li, Huanlin Gao, Fang Zhao 等
提出高斯桥一致性(GBC)框架,通过构建类条件高斯特征桥,改善长尾半监督学习中的特征对齐与泛化。
Hongyang He, Xinyuan Song, Yan Zhong 等
ArtiMo利用大模型实现零样本文字引导的关节网格动画,结合URDF约束与因果推理。
Chunyu Zou, Peng Dai, Yi-Hua Huang 等
提出TopoSurfel,通过可微等值面提取和网格引导,融合高精度高效的高斯Surfels与连续网格,改善表面重建。
Chuanjin Fan, Wenjie Chang, Bohao Liao 等
利用SPIQ初始化的QAOA优化门控量子Join排序,提升稳定性和效率。
Divya Shekar, Ruokun Wu, Dhanvi Bharadwaj 等
提出条件独立正则化的分布式自编码器,有效恢复混合型数据的条件分布。
Siyuan Tang, Gongjun Xu, Ji Zhu
LiLiCorr通过轻量化的似然相关性提高草稿接受长度9-19%。
Matan Rusanovsky, Yoav Miron, Roy Uziel 等