Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing
ScopeEdit采用双分支机制实现多模态知识在线编辑中的范围控制,提升跨模态传递与局部保持的平衡。
Siyuan Li, Youyuan Zhang, Ruitong Liu 等
ScopeEdit采用双分支机制实现多模态知识在线编辑中的范围控制,提升跨模态传递与局部保持的平衡。
Siyuan Li, Youyuan Zhang, Ruitong Liu 等
SkillCoach通过自进化评分标准提升代理技能使用,显著提高评估质量。
Jiayin Zhu, Kelong Mao, Yudong Guo 等
提出信息不对称的多智能体预测框架InfoDelphi,通过公共私有证据分割提升预测准确率12-18%。
Yuante Li, Yicheng Tao, Kate Zhang 等
C3RL校准置信度,CAS按置信度扩展推理,最多节省12.33倍预算。
Xuqing Yang, Yi Yuan, Shanzhe Lei 等
提出PMD方法,通过跨集记忆提升语言模型性能,实验结果提升3.8-13.6%。
Ye Liu, Srijan Bansal, Bo Pang 等
CreativityNeuro通过对比权重调整提升发散性思维,DAT表现提升14个百分点。
Samuel Schapiro, Core Francisco Park, Felix Sosa 等
Style-conditioned UVFA结合Cat-RAC,让智能体可实时切换风格;HFW评估覆盖57,000场战斗。
Roberto Capobianco, Harm van Seijen, Nolan D. Bard 等
提出SAGE框架,通过多假设失败归因提升自主研究的可靠性,从42%提升至92%。
Jie Ma, Binfei Chu, Jie Gao 等
Xiaomi-GUI-0在真实设备上实现72.0%成功率,显著提高稳定性。
Wanxia Cao, Chengzhen Duan, Pei Fu 等
Embodied CAD结合LLM和几何求解器,采用分层技能库实现参数化装配建模。
Fumin Liu, Haoyu Zhou, Fei Hao 等
Delta-JEPA通过Latent Difference Decoder实现动作敏感的潜在世界模型,提升规划性能。
Zhenghao Zhang, Yuanxiang Wang, Zhenyu Guan 等
提出RosettaSim,基于结构化自回归模型实现长时域交通模拟,结合注意力机制和语义检索,提升准确性与稳定性。
Lingyu Xiao, Zexin Feng, Xintao Yan
提出基于Lean编译和语义判定的信实性评价框架,覆盖400题数学声明,揭示编译通过但语义不符的30%差距。
Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy 等
提出Clarus,基于项目-代理-资源模型,实现跨阶段可追溯的科研协作基础设施。
Zihan Guo, Zeyi Chen, Zhiyu Chen 等
FWS以6个VQA数据集构建FaithfulQA,60K监督使VLM的RL更准、更稳、更忠实。
Peng, Lee, Yin Zhang 等
SFBench是一个评估科学主张可行性的基准数据集,包含197个材料科学主张及其可行性评分。
Cash Costello, James Mayfield, Elsbeth Turcan 等
CogWM模型通过追踪用户BDI/E状态轨迹,提升对话智能体的认知评估,训练于15万样本,优于现有基线。
Minghui Ma, Bin Guo, Hao Wang 等
提出自监督定理发现算法,从公理和推理规则中自主生成数千个有意义的定理,提升形式系统证明能力。
Kazuki Ota, Takayuki Osa, Tatsuya Harada
COMPASS以共享令牌τc连接构图识别与生成,基于389031图像和约120万VQA实现可控构图迁移。
Ziqi Zhou, Weize Quan, Mining Tan 等
IMCBench通过图像支持的多轮对话评估多模态LLM,Claude Opus 4.6得分最高3.61。
Maria Xenochristou, Ashutosh Joshi, Korosh Vatanparvar 等