Agents in Software Engineering: Survey, Landscape, and Vision
综述115篇研究,提出由感知、记忆、行动构成的LLM软件工程智能体框架。
Yanlin Wang, Wanjun Zhong, Yanxian Huang 等
综述115篇研究,提出由感知、记忆、行动构成的LLM软件工程智能体框架。
Yanlin Wang, Wanjun Zhong, Yanxian Huang 等
提出VLTP,通过视觉-语言引导的Token剪枝技术,提升ViT在任务导向分割中的效率,减少约25%的计算成本。
Hanning Chen, Yang Ni, Wenjun Huang 等
Windows Agent Arena评估多模态OS代理,Navi在Windows领域成功率19.5%。
Rogerio Bonatti, Dan Zhao, Francesco Bonacci 等
BLens通过对比学习生成二进制函数名称,F1分数提升至0.79。
Tristan Benoit, Yunru Wang, Moritz Dannehl 等
本文综述了深度多模态学习中处理缺失模态的方法,提升模型鲁棒性。
Renjie Wu, Hu Wang, Hsiang-Ting Chen 等
提出Agent Workflow Memory(AWM),通过诱导和存储可重用的任务流程,显著提升网页导航任务成功率,Mind2Web和WebArena上分别提升24.6%和51.1%。
Zora Zhiruo Wang, Jiayuan Mao, Daniel Fried 等
提出多类别负采样策略,提升推荐模型对硬负样本的识别能力。
Haokai Ma, Ruobing Xie, Lei Meng 等
提出RFedAGS,基于梯度流平均的黎曼流形联邦学习算法,解决部分参与与数据异质性问题。
Zhenwei Huang, Wen Huang, Pratik Jawanpuria 等
PingPong基准测试通过用户模拟和多模型评估评估角色扮演语言模型,验证了40余种模型。
Ilya Gusev
E2LLM通过分块压缩长文本,结合预训练编码器与解码器,有效突破“难以兼顾性能、效率与兼容性”的三角困境。
Zihan Liao, Jun Wang, Hang Yu 等
提出语义规范行为分析方法,通过本体论实现自动驾驶行为规范的可追溯性。
Nayel Fabian Salem, Marcus Nolte, Veronica Haber 等
DOLCE框架通过λ和k参数化问题,识别长上下文任务的检索和整体理解能力。
Zi Yang
提出OmniLens,通过EAOD生成丰富LensLib,结合无监督域适应实现未知镜头的全局畸变校正。
Qi Jiang, Yao Gao, Shaohua Gao 等
EndoOmni利用自我学习和鲁棒损失实现零样本跨数据集内窥镜深度估计,提升33%的绝对相对误差。
Qingyao Tian, Zhen Chen, Huai Liao 等
本研究提出GenCAD,结合Transformer、对比学习和扩散模型,将图像转化为可编辑的CAD指令序列,显著优于现有方法。
Md Ferdous Alam, Faez Ahmed
采用振动驱动实现薄型卡片机器人,具备全向滑动和触觉反馈,融合感知与无线控制。
Aditya Retnanto, Emilie Faracci, Anup Sathya 等
扩散模型提升推荐系统的生成能力与稳定性,显著改善用户偏好预测。
Jianghao Lin, Jiaqi Liu, Jiachen Zhu 等
POINTS通过低困惑度数据筛选和模型权重融合提升视觉语言模型性能,达到SOTA水平。
Yuan Liu, Zhongyin Zhao, Ziyuan Zhuang 等
提出URE方案,纠正随机曝光数据中的推荐召回偏差,提升评估可靠性。
Chengbing Wang, Wentao Shi, Jizhi Zhang 等
VILA-U采用单一自回归框架,融合视频、图像、语言理解与生成,性能接近最先进模型。
Yecheng Wu, Zhuoyang Zhang, Junyu Chen 等