OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration
OmniVerifier-M1采用符号化输出与解耦强化学习,提升视觉验证的准确性和效率,达成0.68在ViVerBench指标。
Xinchen Zhang, Bowei Liu, Jiale Liu 等
OmniVerifier-M1采用符号化输出与解耦强化学习,提升视觉验证的准确性和效率,达成0.68在ViVerBench指标。
Xinchen Zhang, Bowei Liu, Jiale Liu 等
提出CAPO方法,通过跨标注偏好优化,模型学习到个体标注者的稳定解释行为,显著优于提示和SFT。
Beiduo Chen, Pingjun Hong, Ziyun Zhang 等
提出LearnWeak框架,通过强参考代理自动识别小型CUA的弱点,提升8个软件域的性能,平均提升11.6个百分点。
Suji Kim, Kangsan Kim, Sung Ju Hwang
FluxMem通过三阶段演化机制,将记忆建模为动态异构图,显著提升LLM在复杂环境中的适应性和泛化能力。
Jizhan Fang, Buqiang Xu, Zhixian Wang 等
提出H-一致性框架优化多标签指标,设计线性分数代理损失,实现O(l)计算复杂度。
Mehryar Mohri, Yutao Zhong
CubePart: 开放词汇、可控部件的3D生成器,支持语义结构生成。
Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier 等
CORE算法通过对比反思在推理任务中实现快速改进,使用更少的样本和模型运行。
Linas Nasvytis, Simon Jerome Han, Ben Prystawski 等
BIRDNet通过挖掘布尔蕴涵关系构建稀疏可解释的深度神经网络,验证六个生物医学数据集,参数显著少于传统MLP。
Tirtharaj Dash
本研究通过黑箱监控揭示三种VLA架构在运动指令层的不同失败签名,强调架构匹配监控的重要性。
Krishnam Gupta
LiveBrowseComp以335道近90天事实题揭示:搜索代理常在验证记忆,而非发现证据。
HuiMing Fan, Xiao Wang, Zheng Chu 等
GraphSteal利用遍历重建技术,能在黑箱环境下恢复超过90%的知识图谱结构,揭示隐私风险。
Jinze Gu, Qinghua Mao, Xi Lin 等
SHIFT方法通过推理时隐藏状态动态选择数据,提升RLVR性能。
Jianghao Wu, Jianfei Cai, Weiqiang Wang 等
Mobile-Aptus通过信心驱动的框架提升移动代理的交互能力,任务成功率提高26%。
Zheng Wu, Pengzhou Cheng, Zongru Wu 等
Woodpecker Distillation利用弱模型诊断强模型推理中的局部错误,提升数学推理性能。
Dayu Wang, Jiaye Yang, Weikang Li 等
DeGO框架通过解耦刚性和非刚性运动,实现13.5%的人体实例提升。
Yang Gao, Wuyang Li, Po-Chien Luan 等
GUI-CIDER通过因果内化和密度感知示例重选中期训练GUI代理,提升任务成功率9.70%。
Zheng Wu, Chengcheng Han, Zhengxi Lu 等
本研究通过难度分层分析RLVR,发现中等难度样本最能促进LLMs推理能力提升。
Yue Cheng, Jiajun Zhang, Xiaohui Gao 等
提出混合神经世界模型,利用多视角预测与误差映射实现对物理动态的高效模拟。
Pranav Lakshmanan, Paras Chopra
提出多面体保证的3D SLAM不确定性量化算法,确保真值在certified集合内。
Guangyang Zeng, Yulong Gao, Yuan Shen 等
FT-Pilot利用GNN识别RTL关键资产,结合LLM实现软错误自动硬化,显著降低误码率。
Weixing Liu, Zizhen Liu, Jing Ye 等