STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
STAMP框架通过可控虚拟环境训练移动GUI代理的显式记忆,提升Memory-World基准性能。
Junyang Wang, Haiyang Xu, Xi Zhang 等
STAMP框架通过可控虚拟环境训练移动GUI代理的显式记忆,提升Memory-World基准性能。
Junyang Wang, Haiyang Xu, Xi Zhang 等
提出双向进化搜索(BES)框架,结合正向候选演化与逆向目标分解,有效突破模型探索与验证的局限。
Guowei Xu, Zhenting Qi, Huangyuan Su 等
OmniVerifier-M1采用符号化输出与解耦强化学习,提升视觉验证的准确性和效率,达成0.68在ViVerBench指标。
Xinchen Zhang, Bowei Liu, Jiale Liu 等
提出CAPO方法,通过跨标注偏好优化,模型学习到个体标注者的稳定解释行为,显著优于提示和SFT。
Beiduo Chen, Pingjun Hong, Ziyun Zhang 等
FluxMem通过三阶段演化机制,将记忆建模为动态异构图,显著提升LLM在复杂环境中的适应性和泛化能力。
Jizhan Fang, Buqiang Xu, Zhixian Wang 等
GUI-CIDER通过因果内化和密度感知示例重选中期训练GUI代理,提升任务成功率9.70%。
Zheng Wu, Chengcheng Han, Zhengxi Lu 等
AI研究代理生成的科学创意更集中,未能显著拓宽科学探索。
Yixuan Tang, Yi Yang
MATCHA利用对比学习实现语义匹配,提升18%以上的准确率。
Siran Li, Ece Sena Etoglu, Carsten Eickhoff 等
FinHarness通过内联生命周期安全护具,FinVault基准ASR降至15%,高级判官调用减少4.7倍
Haoxuan Jia, Yang Liu, Bin Chong 等
引入ENPMR-Bench,评估基于马斯洛需求的主动记忆检索在情感支持中的效果,表现不足,提出未来改进方向。
Xing Fu, Yulin Hu, Mengtong Ji 等
BhashaSetu通过语料库去重提升低资源翻译质量,减少1.17 BLEU和2.21 chrF++。
Param Thakkar, Anushka Yadav, Michael Tiemann 等
SurfaceLoRA方法减少LLM导出向量中的敏感信息推断风险,同时保持摘要性能。
Weixin Liu, Bowen Qu, Juming Xiong 等
研究揭示LLM在自闭症交流生成中的算法脆弱性和角色偏见,使用多代理定性分析框架。
Naba Rizvi, Mohammed Rizvi, Harper Strickland 等
StakeBench框架通过市场承诺评估语言理解,包含560,876条评论和四个诊断任务。
Yunhua Pei, Jingyu Hu, Yiwei Shi 等
引入Hamiltonian启发的局部算子结构MixT,有效压缩大规模语言模型参数。
Ying Lu, Peng-Fei Zhou, Qi-Xuan Fang 等
Mimir为多语言概念建模,采用1.6B参数,训练语料达388亿句,突破Token向概念的粒度转变。
Elio Musacchio, Lucia Siciliani, Pierpaolo Basile
提出OpenSkillEval框架,利用动态生成任务实例和30个开源技能,系统评估LLM技能使用效果,发现技能可用性不等同于有效性。
Jiahao Ying, Boxian Ai, Wei Tang 等
ConvexTok通过凸松弛优化Tokeniser,提升压缩率,词汇量128k时接近最优,BpB提升显著。
Jan Tempus, Philip Whittington, Craig W. Schmidt 等
基于BBC新闻,评测六款AI聊天机器人对新兴事实的多语言检索与回答准确率,最高达95.6%。
Mirac Suzgun, Emily Shen, Federico Bianchi 等
基于KairosQA数据集,6B参数模型顺序预训练提升时间敏感知识准确率,较随机打乱提升F1达15%。
Pilchen Hippolyte, Fabre Romain, Signe Talla Franck 等