GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks
GUI Knowledge Bench揭示VLMs在GUI任务中的知识缺口,评估292个应用。
Chenrui Shi, Zedong Yu, Zhi Gao 等
GUI Knowledge Bench揭示VLMs在GUI任务中的知识缺口,评估292个应用。
Chenrui Shi, Zedong Yu, Zhi Gao 等
SplitFlow通过流分解与聚合实现无逆向的文本引导图像编辑,提升语义保真度和属性解缠结。
Sung-Hoon Yoon, Minghan Li, Gaspard Beaudouin 等
本研究提出FreeArt3D,无需训练即可利用预训练静态3D扩散模型(如Trellis)实现高质量关节物体生成,结合Score Distillation Sampling扩展至3D-4D空间。
Chuhao Chen, Isabella Liu, Xinyue Wei 等
提出基于合成数据的相关多实例学习(MIL)方法,发现现有模型在依赖邻近实例关系时表现不足。
Ethan Harvey, Dennis Johan Loevlie, Michael C. Hughes
本研究分析Transformer中非线性MLP对ICL性能的影响,证明其与多项式模型等价,揭示数据混合关键作用。
Samet Demir, Zafer Dogan
Tool Decathlon基准测试32应用,涵盖真实环境和长时任务,模型成功率仅38.6%。
Junlong Li, Wenshuo Zhao, Jian Zhao 等
ScaleCall比较ETR、TRR与混合检索:嵌入更快,listwise更善于消歧。
Richard Osuagwu, Thomas Cook, Maraim Masoud 等
MDP-Agent通过多路径转化实现AI搜索,提升信息检索准确率至35%
Hongjin Qian, Zheng Liu
SeeingEye框架通过代理信息流实现文本模型的多模态推理,结合结构化中间表示提升效率。
Weijia Zhang, Zijia Liu, Haoru Li 等
研究链式思维如何影响Transformer学习,使用三参数逻辑曲线量化准确率。
Zihan Pengmei, Costas Mavromatis, Zhengyuan Shen 等
基于Gemma 3的MetricX-25和GemSpanEval,提升翻译质量评估与错误检测性能。
Juraj Juraska, Tobias Domhan, Mara Finkelstein 等
提出WebLeaper框架,通过树状推理模型和多源信息合成提升WebAgent的搜索效率和效果。
Zhengwei Tao, Haiyang Shen, Baixuan Li 等
提出R3框架,通过强化学习优化RAG检索性能,提升5.2%。
Jiawei Zhou, Lei Chen
提出APTBench,基于真实任务轨迹评估基础大模型的代理潜能,涵盖软件工程与深度研究场景。
Jiarui Qin, Yunjia Xi, Junjie Huang 等
MGA通过观察优先和记忆增强原则,优化GUI任务,提升效率。
Weihua Cheng, Junming Liu, Yifei Sun 等
Pie系统通过API和inferlets实现灵活高效的LLM服务,提升1.3x-3.4x吞吐量。
In Gim, Zhiyao Ma, Seung-seob Lee 等
提出时间感知偏差(Temporal Blindness)问题,通过TicToc数据集评估LLM工具调用与人类时间感知的偏差,发现模型表现不足65%。
Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan 等
结合SHAP和因果分析的工业故障检测框架,提升准确性与解释性。
Pedro Cortes dos Santos, Matheus Becali Rocha, Renato A Krohling
提出凸优化框架识别切换网络系统,包括节点动力学和图结构,基于采样数据实现无先验标签识别。
Kaito Iwasaki, Anthony Bloch, Maani Ghaffari
提出TIRE方法,通过追踪、修补、重投实现个性化3D/4D生成,显著提升身份保持。
Shuhong Zheng, Ashkan Mirzaei, Igor Gilitschenski