Provable Failure of Language Models in Learning Majority Boolean Logic via Gradient Descent
本文证明Transformer在梯度下降训练中难以学习多数布尔逻辑,误差随维度指数增长。
Bo Chen, Zhenmei Shi, Zhao Song 等
本文证明Transformer在梯度下降训练中难以学习多数布尔逻辑,误差随维度指数增长。
Bo Chen, Zhenmei Shi, Zhao Song 等
提出基于Sinkhorn迭代的可扩展近似最优传输线性模型算法,支持多种正则化与数据拟合。
Tomasz Kacprzak, Francois Kamper, Michael W. Heiss 等
VideoAgent2通过不确定性感知的链式推理,提升长视频理解性能,平均超越前沿方法13.1%。
Zhuo Zhi, Qiangqiang Wu, Minghe shen 等
JarvisIR利用VLM控制多专家修复模型,提升恶劣天气下的自主感知性能,达成50%性能提升。
Yunlong Lin, Zixu Lin, Haoyu Chen 等
提出View2CAD,从单RGB-D图像重建高精度B-rep CAD模型,结合视角中心表示与深度优化。
James Noeckel, Benjamin Jones, Adriana Schulz 等
多变量批量贝叶斯优化用于材料研究,分析噪声敏感性和问题景观效应。
Imon Mia, Armi Tiihonen, Anna Ernst 等
本教程介绍大规模语言模型(LLM)适应技术,包括参数微调和外部知识增强,强调多阶段训练与评估。
Zixuan Ke, Yifei Ming, Shafiq Joty
APIGen-MT通过两阶段蓝图生成与模拟交互,提升多轮人机数据质量。
Akshara Prabhakar, Zuxin Liu, Ming Zhu 等
提出KnowSelf实现语言模型的情境自我认知,结合两阶段训练提升规划表现。
Shuofei Qiao, Zhisong Qiu, Baochang Ren 等
提出SCUD4ICL,通过分解程序和对齐话语提升语义解析精度。
Mayank Kothyari, Sunita Sarawagi, Soumen Chakrabarti 等
ScreenSpot-Pro基于高分辨率专业环境,提出ScreenSeekeR提升GUI定位准确率至48.1%。
Kaixin Li, Ziyang Meng, Hongzhan Lin 等
AD-GPT结合Llama3和BERT,提升阿尔茨海默病相关信息检索的准确性。
Ziyu Liu, Lintao Tang, Zeliang Sun 等
提出RISEBench基准,评估多模态模型在推理引导的视觉编辑中的表现,最高准确率仅28.8%。
Xiangyu Zhao, Peiyuan Zhang, Kexian Tang 等
HyperRAG利用KV缓存重用优化RAG中的reranker效率,实现2-3倍吞吐提升。
Yuwei An, Yihua Cheng, Seo Jin Park 等
MultiBLiMP 1.0利用自动化流程构建涵盖101语种的多语言最小对比语料库,评估大模型的形式语法能力。
Jaap Jumelet, Leonie Weissweiler, Joakim Nivre 等
Multi-SWE-bench涵盖7种语言,采用专家标注,评估LLMs在多语言软件问题解决中的性能。
Daoguang Zan, Zhirong Huang, Wei Liu 等
提出RASP框架,基于差异渲染优化多视角阴影引导的复杂3D物体布局。
Soumyaratna Debnath, Ashish Tiwari, Kaustubh Sadekar 等
本研究提出多层次记忆机制,结合文本、KV缓存、参数和隐藏状态,提升大模型长时记忆能力。
Lianlei Shan, Shixian Luo, Zezhou Zhu 等
SkyReels-A2利用视频扩散变换器实现多元素可控视频生成,保持元素一致性。
Zhengcong Fei, Debang Li, Di Qiu 等
提出WoTE框架,利用BEV世界模型实现端到端自主驾驶中的在线轨迹评估,显著提升性能。
Yingyan Li, Yuqi Wang, Yang Liu 等