Latent On-Policy Self-Distillation
提出LOPD,将教师的特权上下文由固定转为可端到端学习,显著提升多任务性能。
Guibin Zhang, Jiayang Lyu, Ran Sun 等
提出LOPD,将教师的特权上下文由固定转为可端到端学习,显著提升多任务性能。
Guibin Zhang, Jiayang Lyu, Ran Sun 等
引入动作条件预测一致性(ACPC)诊断JEPA世界模型的鲁棒性,验证其对视觉扰动的敏感性。
Guo An, Zijing Wu, Honghua Dong 等
提出解耦对比解码(DCD),利用专家对齐的轻量级提议器提升速度,验证仅在验证阶段使用 amateurs,显著加速生成。
Zhixuan Liu, Zhichen Dong, Yuanfu Wang 等
ReFind是一种无需结构化索引的对话搜索方法,达成58.2%平均准确率。
Ruizhe Li, Licheng Zhang, Benfeng Xu 等
SkillMisevo-Gym揭示LLM代理中的技能误进化,SafeEvolve减少不安全检索26.7个百分点。
Xutao Mao, Liangjie Zhao, Xiang Zheng 等
提出RippleNet,基于局部微分信号实现AI生成图像检测,提升跨生成模型的泛化能力。
Jiazhen Yang, Ruijin Jin, Junjun Zheng 等
提出HybridSB-MoE,结合频域专家多样性与时域Schrödinger桥,实现语音增强,优于现有方法。
Zhengyi Lu, Aswini Sivakumar, Jie Hu 等
提出WMRL,通过世界模型替代环境执行,提升自动研究代理训练速度3-4倍,超越标准RL。
Xiyuan Yang, Sheikh Sarwar, Jingru Cheng 等
StateFlow利用结构化3D世界状态模型,通过三阶段构建、演化和访问,实现高质量预可视化,增强可控性与迭代能力。
Yuyang Yin, Zixiang Li, Longxuan Deng 等
本研究提出基于检索增强生成和大模型的自动构建动态主逻辑模型(DML)知识图谱(KG-DML),实现复杂系统诊断。
Saman Marandi, Yu-Shu Hu, Mohammad Modarres
提出一种基于目标、特征到人类对齐奖励函数的设计框架,结合因果关系和偏好查询,确保无冲突的线性奖励参数空间。
Di Yang Shi, W. Bradley Knox
提出“Agentic Self-Improvement”框架,通过双阶段优化显著提升图像到视频生成的语义一致性和控制性,优于无指导方法,偏好率达69%。
Aman Tyagi, Hemanth Boinpally, Jonathan Chen 等
本文分析了AI基础设施中的四大结构性障碍(网页存在差距、训练标记不足、分词惩罚、连接排除),以推动低资源语言的公平发展。
Avijit Roy, Proma Roy
论文以CRC、容量κ与可行动性证书消除“全拒答”伪安全;90.3%配置达标,正确自动化率83.4%。
Zhenpeng Li
本研究揭示多智能体强化学习中模拟器崩溃问题,提出Verbalized Sampling和Co-Training两种解决方案,显著提升泛化能力。
Simon Yu, Nicholas Tomlin, Marwa Abdulhai 等
提出HAMP-LIC,基于Hessian的混合精度后训练量化,提升图像压缩模型压缩比至4.85倍,BD率仅0.59%。
Yuefeng Zhang
提出一种高效近似最优的对抗性m-集合多臂赌博算法,保证在d维空间中以O(√dT log(K/δ))的高概率遗憾界,避免指数空间复杂度。
Francesco Bacchiocchi, Tommaso Cesari, Roberto Colomboni
ScreenShot采用层次Transformer模型,基于40个药物筛选数据集,支持少样本预测和主动学习,显著提升组合药物筛选效率。
Antoine de Mathelin, Christopher Tosh, Wesley Tansey
提出GAS框架,通过解耦预测增强视觉理解,无推理开销,提升感知与空间理解。
Zhongbin Guo, Jiahao Xie, Dongling Xiao 等
本研究提出预算依赖的LLM评估框架,分析7个预算水平(64-4096 tokens)对4个模型在3个推理基准上的影响,发现模型排名随预算变化而逆转,强调预算条件下的评估必要性。
Rodrigo Guedes de Souza, Alison R. Panisson