GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
GUI-Primitives基准测试揭示了视觉语言模型在GUI空间推理中的局限,最高准确率仅32%。
Md Abrar Jahin, Md Rizwan Parvez
GUI-Primitives基准测试揭示了视觉语言模型在GUI空间推理中的局限,最高准确率仅32%。
Md Abrar Jahin, Md Rizwan Parvez
使用LaBSE等编码器,研究维基百科多语言版本的宗教与科学概念的框架差异。
Hung-Hsuan Chen
SAC-Copula通过高斯Copula构建平滑相关的Gumbel场,实现扩散语言模型的高质量水印。
Baixin Li, Haiyun He
测试时扩展用于科学方程发现,搜索宽度是关键参数,提升了效率和性能。
Haowei Lin, Hubert Lim, Xiangyu Wang 等
LiLiCorr通过轻量化的似然相关性提高草稿接受长度9-19%。
Matan Rusanovsky, Yoav Miron, Roy Uziel 等
ConceptGuard基于双用概念,评估模型在概念层面实现安全性与完整性,揭示现有方法在上下文敏感性上的不足。
Sahil Kale, Ian Harris
G-CARL通过检索引导和检查表对齐的强化学习,提升医学报告解释的准确性和患者导向性。
Shiao Xie, Siyu Chen, Jianwei Lv 等
提出IAR三阶段框架,实现无检索文档知识内化,提升领域问答和通用能力。
Qian Kou, Xiaofeng Shi, Xiaosong Qiu 等
提出跨语言公平性评估框架,基于六种水印方案在11种语言上的实证分析,揭示结构性差异。
Alexander Nemecek, Osama Zafar, Debargha Ganguly 等
仅训练投影器即可在3D MLLM中实现强大的多模态性能,避免语言模型能力漂移。
Nyx Iskandar, Saathvik Selvan, Slater Victoroff
利用Large Language Models(Falcon-7B-Instruct)结合检索增强生成(FAISS)实现金融新闻自动摘要,ROUGE-1超Lead-3。
Pranav Chandaliya
SPADE采用自我对弈机制,利用LLM生成可执行环境并优化环境设计,提升多任务性能,平均提升5.3%。
Bo Liu, Simon Yu, Yiding Jiang 等
WhiteMatter以动态跨层KV混合连接所有深度;16层全缓存困惑度19.968,较基线降8.2%。
Wenbo Zhang, Xiang Ren
OmniAlign通过统一模型实现多语言词句对齐,显著提升长文本对齐性能。
Mengpeng Yang, Jingxu Yang, Chao Chen 等
微调诗歌数据提升阿拉伯语习语理解2.33%,文化微调无显著效果。
Mena Attia, Mona Diab, Thamar Solorio
D2-ScaleAgent采用双维度扩展策略,通过Verifier驱动的动态路由实现长文理解的证据链完整性,显著优于传统方法。
Hao Zhang, Longrong Yang, Lunhao Duan 等
KV-Cache在模型回滚时未同步,导致状态不一致,利用缓存残留实现信息泄露。
Guijia Zhang, Harry Yang
MicroVerse利用长时程多智能体模拟,基于“灵魂档案”追踪身份漂移,采用多层记忆架构和差异化检测方法。
Sky Ng, Brihi Joshi, Ishan Gupta 等
采用关联任务和陈述任务,验证模型对当前年份的编码,发现两者机制不同,更新困难。
Suze van Adrichem, Aditi Bhaskar, Diyi Yang 等
本文揭示大型语言模型中的歧义之祸,分析其在模型容量、嵌入维度和学习难度上的根源,强调其在实际训练中的表现限制。
Nicolas Zucchet, Hyun Dong Lee, Scott Linderman