An Empirical Study of Harness Design for Coding Agents
研究通过轻量级编码框架提高自动编码代理的长远性能,实验显示上下文管理最有效。
Run-Ze Fan, Zihao Zhang, Simin Ma 等
研究通过轻量级编码框架提高自动编码代理的长远性能,实验显示上下文管理最有效。
Run-Ze Fan, Zihao Zhang, Simin Ma 等
FINSKILLOPS通过自进化多代理系统提高SEC文件问答的正确性,从3.70提升到4.55。
Yanzhang Ma, Zhenghan Tai, Hanwei Wu 等
提出Mahalanobis-Ensemble Decoding,通过集合修剪优化LLM解码,提升语义多样性和生成质量。
Dunyao Xue, Chengshuo Du, Zhengbo Wang 等
AALT通过最大化起始-目标连通性选择演示,提升任务成功率。
Maxwell J. Jacobson, Ahmed H Qureshi, Yexiang Xue
研究提出META-AGENT方法,在未知环境中进行任务无关的预处理,提升五个基准测试中的Avg@3奖励。
Vinay Samuel, Varun Ursekar, Vijay S. Kalmath 等
JarvisGUI通过动态任务组合评估跨设备GUI代理,揭示现有代理在真实工作流中的能力差距。
Zixiang Chen, Yuheng Lu, Zihao Cheng 等
ConvMem通过层次卷积实现长上下文推理,在RULER-HotpotQA上超越训练无关基线。
Hongming Zhang, Zhaozhen Gu, Fengshuo Bai 等
Fortunate Recall通过10+1行为本体和生命周期策略,提升LLM记忆管理精度,LifecycleBench得分76.9%。
Ansuman Mullick, Eray Tüzün
LLM数字孪生通过统计可替代性减少人类测量,但行为忠实度并不充分。
Steven Wang, Kyle Hunt, Shaojie Tang 等
提出IIns-GAN生成标注无线信号,提升模型训练效果。
Yuxiao Li, Keke Hu, Santiago Mazuelas 等
EDGE框架通过动态图合成数据,提升工具调用性能。
Dain Kim, Eungi Cho, Kyumin Kim 等
通过行为证据评估LLM解释的必要性和充分性,发现解释与模型行为的相关性有限。
Urja Pawar, Rajitha Ramanayake, Nabeel Kemal 等
研究发现大型语言模型在分子回归基准中存在广泛的逐字检索现象,影响预测准确性。
Matthias Busch, Marius Tacke, Sviatlana V. Lamaka 等
CUA-Universe通过App-Forge、Task-Weave和Path-Steer实现GUI+CLI混合环境,提升效率和成功率。
Haoting Shi, Wenhao Wang, Weicheng Fang 等
研究探讨了模型升级对记忆迁移的影响,发现固定模式的知识图谱在迁移中表现稳定。
Ankit Goyal, Jaideep Ray
使用桥接形式工具包测量Transformer模型中的上下文个体化。
José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez 等
大语言模型在建筑能源系统的HVAC操作中应用,未有研究达到工业应用准备。
Alexander Neubauer, Tianzhen Hong, Han Li 等
通过积累矩阵和混合矩阵重构,实现进化迁移优化的高效评估,速度提升达256.72倍。
Yanchen Li, Xiaoming Xue, Kay Chen Tan
APT-RAG框架在证据密集型QA中表现优异,提升了40.69%的F1分数。
Songeun Lee, Kyungjin Min, Injae Na 等
提出了一种成本感知的单代生成架构,在DevRev基准上达到91.7%的正确率。
Yoga Sri Varshan Varadharajan, Ajay Yadav, Ritesh Goru 等