Adversarial Training for Process Reward Models
APRM通过生成器和奖励模型对抗训练,提高数学推理准确性3.4个百分点。
Gurusha Juneja, Deepak Nathani, William Yang Wang
APRM通过生成器和奖励模型对抗训练,提高数学推理准确性3.4个百分点。
Gurusha Juneja, Deepak Nathani, William Yang Wang
提出TokCom-UEP,结合非均匀语义重要性的不等错误保护,提升图像传输鲁棒性。
Kaizheng Zhang, Zuolin Jin, Zhihang Cheng 等
DeepSeekMath-V2通过训练自验证器实现自我证明,显著提升数学推理的准确性。
Zhihong Shao, Yuxiang Luo, Chengda Lu 等
CoT4AD通过引入思维链推理提升自动驾驶中的视觉语言模型性能,达到最新水平。
Zhaohui Wang, Tengbo Yu, Hao Tang
提出SPLADE及扩展模型,结合剪枝策略在十亿级网页标题中实现高效检索。
Taeryun Won, Tae Kwan Lee, Hiun Kim 等
S2KAN通过可微稀疏化和符号基元训练,实现高效符号化学习,模型更小但精度更高。
James Bagrow, Josh Bongard
提出Matrix去中心化多智能体合成数据框架,通过消息传递实现高效扩展,提升2-15倍吞吐量。
Dong Wang, Yang Li, Ansong Ni 等
EvilGenie用留出测试、LLM评审和文件检测评估编程智能体奖励劫持;GPT-5评审在明确案例中几乎无漏报。
Jonathan Gabor, Jayson Lynch, Jonathan Rosenfeld
研究发现,任务算术是唯一能在“野外”环境中提升大型语言模型性能的方法。
Oğuz Kağan Hitit, Leander Girrbach, Zeynep Akata
提出STVG-o1框架,通过强化微调实现无需架构改动的多模态大模型精确时空定位,提升HCSTVG-v1性能7.3%。
Xin Gu, Haoji Zhang, Qihang Fan 等
提出TALES分类法评估LLM生成故事中的文化偏差,分析88%的故事存在误述。
Kirti Bhagat, Shaily Bhatt, Athul Velagapudi 等
基于准高斯性,构建2D随机Navier-Stokes的动力学引导高斯过程先验。
Boumediene Hamzi, Houman Owhadi
提出结合检索和自我知识的上下文感知PMP方法,提升 sarcasm 检测中的宏F1达9.87%。
Michael Iskandardinata, William Christian, Derwin Suhartono
Evo-Memory通过自我演化机制评估LLM在连续任务中的记忆更新,达成平均性能提升0.65。
Tianxin Wei, Noveen Sachdeva, Benjamin Coleman 等
采用归一化预测与 conformal 监控实现飞行测试中的短期安全风险预警。
Aaron O. Feldman, D. Isaiah Harp, Joseph Duncan 等
∞-RoPE通过块相对旋转和KV刷新实现无限视频生成与细粒度动作控制。
Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan 等
iMontage利用预训练视频模型,通过引入图像内容多样性,实现多对多高动态场景生成。
Zhoujie Fu, Xianfang Zeng, Jinghong Lan 等
ReaDe采用“推理-描述”范式,通过两阶段优化显著提升视频指令理解与生成控制精度。
Shengqiong Wu, Weicai Ye, Yuanxing Zhang 等
提出层次异构特征Transformer(HHFT),在工业CTR预测中实现+0.4% AUC提升,模型部署于淘宝平台,GMV提升0.6%。
Liren Yu, Wenming Zhang, Silu Zhou 等
DinoLizer基于DINOv2,结合LoRA微调,能有效检测生成式修复中的VAE与扩散伪迹,提升20% IoU。
Minh Thong Doi, Vincent Itier, Jan Butora 等