Representation Curriculum: Stagewise Training for Robust Ranking and Allocation
提出Representation Curriculum,通过阶段性训练提升排序系统的鲁棒性,实验表明在冷启动场景中表现显著提升。
Ehsan Ebrahimzadeh, Sina Baharlouei, Abraham Bagherjeiran
提出Representation Curriculum,通过阶段性训练提升排序系统的鲁棒性,实验表明在冷启动场景中表现显著提升。
Ehsan Ebrahimzadeh, Sina Baharlouei, Abraham Bagherjeiran
提出PERSUASIONTRACE框架,使用贝叶斯网络模拟多轮人类信念更新,得分接近人类(81 vs 80)。
Jared Moore, Noah Goodman, Nick Haber 等
提出Agentic Monte Carlo(AMC)用于黑箱LLM代理的贝叶斯采样,显著优于提示和GRPO。
Dae Yon Hwang, Raunaq Suri, Valentin Villecroze 等
提出基于分布式DAgger的丰富反馈强化学习方法DistIL,保证单调改进并提升Pass@N指标。
Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad
HORIZON通过恢复能力控制课程扩展物理域,提升四足机器人零样本迁移能力。
Chenhao Bai, Liqin Lu, Kaijun Wang 等
ZipSplat通过解耦高斯分布与像素网格,使用场景令牌实现高质量低成本的3D重建,减少6倍高斯数。
Alexander Veicht, Sunghwan Hong, Dániel Baráth 等
Depth-Attention通过跨层值混合提升语言模型性能,提升准确率达2.3个百分点。
Boyi Zeng, Yiqin Hao, Zitong Wang 等
Flash-WAM通过模态感知的逐步蒸馏,实现单步推理,速度提升23倍,保持高任务成功率。
Arman Akbari, Ci Zhang, Arash Akbari 等
提出M³Eval,基于认知心理学设计的视频多模态记忆评估框架,涵盖四个关键维度。
Jie Huang, Ruixun Liu, Sirui Sun 等
提出Dual-Stream MLP,通过知识蒸馏实现显式与隐式特征交互,达成SOTA性能。
Kesha Ou, Zhen Tian, Wayne Xin Zhao 等
提出基于生成轨迹的安全对齐方法,显著提升模型在推理中抗中断攻击的鲁棒性。
Kyungmin Park, Taesup Kim
提出基于曲率感知的动态精度控制方法,结合L-BFGS曲率信息,有效平衡PINN训练中的精度与效率。
Yingjie Shao, Ioannis N. Athanasiadis, George van Voorn 等
LifeSide通过多会话Memory-Emotion-Environment循环,评估数字伴侣的长期记忆与情感支持能力。
Yuqian Wu, Zhijie Deng, Wei Chen 等
BiNSGPS以双向神经符号反馈,在Geometry3K和PGPS9K达90.5%与90.1%。
Qi Wang, Peijie Wang, Fei Yin 等
RAMPART通过优先级感知的运行时转换优化LLM代理的内存模型,提升任务成功率。
Nikodem Tomczak
利用德国社会经济面板数据构建个体级数字孪生,评估信息深度与模型选择影响,最高准确率达78.8%。
Leonard Kinzinger, Jochen Hartmann
VCIFBench评估视频理解中复杂指令遵循,涵盖306个任务,强调多约束满足难题。
Huangchen Xu, Yuan Wu, Yi Chang
HMARS通过分层多智能体记忆系统提升长上下文推理能力,显著提高证据覆盖率。
Zeju Li, Ziyang Zheng, Yizhou Zhou 等
提出一种难度感知的SFT-then-RL框架,提升小型语言模型推理能力。
Chongyang He, Rui Zhang, Zixuan Wang 等
LoopMoE结合稀疏路由与迭代计算,在9个基准测试中提升性能。
Wenkai Chen, Tianshu Li, Wenyong Huang 等