DeepSWIP: Quotient-WMC Counterfactuals for Neural Probabilistic Logic Programs
DeepSWIP利用神经材料化与WMC实现深度概率逻辑程序的单世界反事实推理,提升推理速度2.14倍。
Saimun Habib, Vaishak Belle, Fengxiang He
DeepSWIP利用神经材料化与WMC实现深度概率逻辑程序的单世界反事实推理,提升推理速度2.14倍。
Saimun Habib, Vaishak Belle, Fengxiang He
MACR框架通过多代理推理解决LLM知识冲突,显著提升准确性。
Huang Peng, Jiuyang Tang, Weixin Zeng 等
提出多智能体交易记忆(MATM)框架,通过共享轨迹提升异构智能体群体的任务表现,实验显示成功率提升8%,步骤减少0.59。
To Eun Kim, Xuhong He, Dishank Jain 等
Euclid-Omni以Euclidea统一演绎与代数推理,Geometry3K达595/601并解决16道IMO-AG-30题。
Zhaoyu Li, Hangrui Bi, Youyuan Zhang 等
提出DRFLOW基准,结合7项指标评估个性化深度研究工作流预测,涵盖100任务和1246步骤。
Md Tawkat Islam Khondaker, Raymond Li, Muhammad Abdul-Mageed 等
提出基于质量感知的自蒸馏方法,结合软正确性门控和教师概率缩放,提升GUI定位精度。
Jingyuan Huang, Zuming Huang, Yucheng Shi 等
引入FllumaOne,基于可执行Python程序的多模态CAD数据集,验证几何和特征历史。
Jizong Zhan
SEAGym构建动态自我演化评估环境,结合Terminal-Bench 2.0和HLE,验证ACE、TF-GRPO、AHE的多维性能。
Congjie Zheng, Chuanyi Xue, Bin Liang 等
OpenClaw-Skill通过集体技能树搜索提升大模型在工具使用和多步推理中的表现。
Tianyi Lin, Chuanyu Sun, Jingyi Zhang 等
Skill-to-LoRA通过LoRA适配器将技能文本转化为行为模块,提高通过率5.2个百分点。
Tianyi Zhang, Zhonghao Qi
AIChilles以差分搜索发现30个AI演化程序中的49项隐藏弱点。
Yajie Zhou, Ao Li, Ashwin Silla 等
提出WorkflowView框架,利用大语言模型(LLMs)将低级行为序列抽象为高层次活动,在浏览器、MOOC和Word文档中实现高准确性(最高F1=0.90),实现跨域通用性。
Gaurav Verma, Scott Counts
VISTA方法通过多视图比较提升GUI定位准确性,显著提高Qwen3-VL模型性能。
Xinyu Qiu, Yunzhu Zhang, Heng Jia 等
StreamMemBench评估个人助理记忆在流式观察和交互中的未来导向能力,关键指标包括证据保持与复用。
Guanming Liu, Yuqi Ren, Hansu Gu 等
利用大语言模型(如Claude 4.7)自动评估社会行为科学研究的可复现性,通过效果量匹配和结论一致性验证,提升审查效率。
Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten 等
Nous通过结构化八维行为模型从交易行为提取人类认知多样性,并尝试通过提示注入,但效果有限。
Haowei Qian
本研究比较Diff-in-Means(DiM)与INLP在模型拒绝行为中的线性方向提取效果,发现INLP的反事实翻转表现优异。
Elisabetta Rocchetti, Alfio Ferrara
本研究评估多模态基础模型在电力配电缺陷检测中的感知、推理和工具使用能力,实验数据详实。
Quan Quan
RSMeM通过知识增强记忆演化提高遥感代理的工具使用准确率,提升6%。
Bingxian Wu, Yu Zhang, Zonghao Guo 等
使用因果影响图(CID)证明无法通过反馈训练AI诚实报告潜在知识。
Korbinian Friedl, Francis Rhys Ward, Paul Yushin Rapoport 等