GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis
提出GSAR奖励框架,通过自我演化数据合成和目标状态锚定提升GUI代理训练效率。
Long Zhang, Yuhan Chen, Chaoran Zhang 等
提出GSAR奖励框架,通过自我演化数据合成和目标状态锚定提升GUI代理训练效率。
Long Zhang, Yuhan Chen, Chaoran Zhang 等
VIALS基准评估生命科学视觉Artifact理解能力,模型准确率仅26.5%。
Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor 等
AUSO通过逐步行动感知优化技能内化与利用,提升长时任务表现。
Huizu Lin, Chengkai Huang, Tianqi Gao 等
CLEAR通过连续调控安全低秩适配器激活,显著降低HarmBench ASR至0.5%,同时保持GSM8K等任务性能。
Chengxiao Wang, Enyi Jiang, Xiaojing Liao 等
提出GPU细粒度实现GPX交叉的分区阶段,处理百万级城市规模,速度提升48-625倍。
Swetha Varadarajan, Darrell Whitley
提出PSL框架,结合半结构化政治数据中的立场信号与高阶结构信号,显著提升预测性政治问答性能。
Yinan Liu, Zihan Zhou, Zichun Jin 等
COTA方法通过比较替代方案提高LLM代理的运行时干预效果,提升了WebShop等环境中的表现。
Yanze Jiang, Mingxuan Li, Yuhao Wang 等
UpgradeBench提供决策驱动的基准,评估LLM专家升级,平均质量遗憾为0.37pp。
Ye Chen, Weining Zhang
提出入库时语义编译(ISC),通过索引结构提升RAG系统效率,实验证明优于查询时解释。
Kyle Wild, Yusuke Takahashi, Asako Uraki
本文系统分析多模态推测解码的现状,评估Diffusion方法在多模态模型中的应用准备情况。
Yantao Li, Huanlin Gao, Fang Zhao 等
提出基于多智能体的主动数据采集与天气敏感的出行行为预测框架,结合对话式问卷与大模型评估。
Narges Ahmadi, Yubo Jiao, Jônatas Augusto Manzolli 等
AI4AI-Bench通过10个训练算法仓库,评估LLM代理在算法设计中的递归自我改进能力,平均得分0.166,最高0.250。
Yizhe Chi, Wenyi Li, Deyao Hong 等
本研究通过引入测量空白,采用逐问题精确检验,揭示自我提升的测量偏差,验证了外部蒸馏的实际效果。
Cheng Xu, Nan Yan, Liming Chen 等
本研究比较任务级与子任务级技能诱导,发现子任务级和文本格式技能转移更可靠,提出技能效用评分。
Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian 等
利用XGBoost模型结合前5分钟交易数据,提前预测Solana memecoin的劫持风险。
Jianghai Li, Pavel Kuznetsov, Yury Yanovich 等
提出ADAPT,基于物理感知扩散模型的HVAC控制,提升能效与鲁棒性。
Xu Yang, Kailai Sun, Dianyu Zhong 等
提出基于遥测的边缘RAG自适应压缩方法,显著降低能耗(GPU最高53.2%,SoC最高48.2%),保证质量。
Zlatan Feric, Amir Taherin, Yanzhi Wang 等
本文通过对大规模语言模型(LLM)后训练轨迹的实证分析,发现其策略锁定在初始阶段,缺乏在执行中自主策略重评机制,影响AI自我改进能力。
Joy Jia Yin Lim, Xin Huang, Hao Peng 等
可验证弃权机制使AI在城市供水网络漏诊中更负责任,550事件中214准确。
Tianwei Mu, Yue Wang, Mingzhe Yuan 等
本研究系统评估基于记忆的自我提升智能体的脆弱性,发现其在任务变异和顺序变化中表现出显著不稳定性,提出通过信息丰富化缓解部分性能下降。
Qinyuan Ye, Yu Li, Yada Pruksachatkun 等