Inverse RL Helps Align AI by Imitating Humans
提出PARED,通过特征空间逆强化学习实现AI行为对人类示范的隐式奖励提取。
Michał Wiliński, Liu Leqi, Chirag Nagpal
提出PARED,通过特征空间逆强化学习实现AI行为对人类示范的隐式奖励提取。
Michał Wiliński, Liu Leqi, Chirag Nagpal
FlowCTS以连续轨迹监督替代KL-OPD,GenEval达0.93、OCR达0.92、PickScore达23.06。
Kaiyang Ye, Yuan Ge, Junxiang Zhang 等
提出AAMSF框架,通过多源异常融合实现极端市场波动预警,测试AUC达0.680。
Jin Qian, Zhangzhi Xiong, Mingrui Li 等
提出多阶段约束优化框架MCOF,解决VAE在数据驱动问题中的采样和约束难题。
Ye Shi
提出NOPD(无噪声学生自我蒸馏),无需外部模型或真值,利用预测差异实现自我提升。
Shuai Wang, Daoan Zhang, Zhe Tang 等
提出MetaEvolve,利用强化学习培养LLMs的自我演化核心技能,提升代码任务表现。
Shujin Wu, Cheng Qian, Xiusi Chen 等
提出DomainPilot,基于域级损失的两阶段数据混合优化,提升LLM微调效果。
He Zhang
提出零流两样本检验(ZF2ST),在合成和图像数据集上表现出色。
Yakun Wang, Leyang Wang, Song Liu 等
用排除池精确审计证明漏检质量,零漏检下标签复杂度为Ω(N₀/m)。
Martin Anthony, Kaveh Salehzadeh Nobari
提出基于局部上下文的加权离散流匹配,显著降低生成困惑度达63%。
Daniil Cherniavskii, Daniel Severo, Karen Ullrich
M2S方法通过线性映射预测干净标记后验均值,提升生成PPL至143.3。
Jingyuan Li, Xiaoyi Jiang, Yixuan Jiang 等
提出Best-of-Evidence(BoE)框架,在部分验证条件下优化候选选择,提升模型表现。
Cenwei Zhang, Teng Fang, Yuxia Wang 等
将主动推理(Active Inference)转化为凸马尔可夫决策过程(MDP),实现EFE最小化的理论框架。
Nikola Milosevic, Nicolás Hinrichs, Nico Scherf
使用XGB-C2ST方法揭示TabbyFlow和TabDiff模型的依赖性缺陷。
Jie Zhang
提出一种在时间干预下评估个人LLM代理的新方法,未找到满足四个条件的现有协议。
Pin Qian, Su Wang, Yihang Chen 等
MotifRole-Diff按结构风险分配掩码,使QM9有效率0.905升至0.944,FCD降至1.609。
Tasfia Nuzhat Ornee, Elias Hossain, Ivan Garibay 等
提出RRPO,利用分层条件滚动构建对比优势,提升无验证任务的策略优化效果。
Yuxin Xiong, Xunyi Jiang, Rohan Surana 等
提出分布偏移下类别条件覆盖的标签复杂度界限,验证伪标签无法突破限制。
Weijia Han, Lisha Qu
提出基于Harness的LLM辅助GPU核生成系统,提升五类操作符平均速度1.62-29.68倍。
Yue Shui, Chenyu Ma, Hangfei Xu 等
引入Cramér几何下的分布式软贝尔曼算子,证明其收缩性与唯一不动点。
Keru Wang, Yixin Deng, Yao Lyu 等