A Comparative Analysis of Contextual Representation Flow in State-Space and Transformer Architectures
使用中心核对齐和方差度量分析SSM和TBM的表示传播,揭示其层间信息流动差异。
Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen 等
使用中心核对齐和方差度量分析SSM和TBM的表示传播,揭示其层间信息流动差异。
Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen 等
提出了一种控制增强的自回归扩散模型,用于数据同化,显著提高了稳定性和准确性。
Prakhar Srivastava, Farrin Marouf Sofian, Francesco Immorlano 等
提出UserLMs,模拟多轮对话中人类用户行为,GPT-4o性能从74.6%降至57.4%。
Tarek Naous, Philippe Laban, Wei Xu 等
提出LMCACHE,结合批量数据迁移和模块化接口,实现企业级大模型KV缓存高效管理。
Yuhan Liu, Yihua Cheng, Jiayi Yao 等
SIGMA-GEN实现单次多主体身份保留图像生成,性能超越SOTA,基于SIGMA-SET27K数据集。
Oindrila Saha, Vojtech Krs, Radomir Mech 等
本文提出AI驱动的系统研究(ADRS),通过OpenEvolve实现多领域算法优化,最高达5.0倍性能提升和50%成本降低。
Audrey Cheng, Shu Liu, Melissa Pan 等
提出SimulatorArena,基于用户画像的模拟器实现多轮评估,达ρ=0.7,替代人工评估。
Yao Dou, Michel Galley, Baolin Peng 等
基于大语言模型的多层场景图实现主动语义感知,提升室内环境理解速度与准确性。
Huayi Tang, Pratik Chaudhari
BlockRank方法通过结构化注意力提高ICR效率,实验表明其性能优于现有方法。
Nilesh Gupta, Chong You, Srinadh Bhojanapalli 等
即使完美检索,长上下文仍损害LLM性能,提出缩短上下文的策略提升性能。
Yufeng Du, Minyang Tian, Srikanth Ronanki 等
提出LUR和RLUR方法,提升驾驶员行为识别中的不确定性检测效率。
Koen Vellenga, H. Joe Steinhauer, Jonas Andersson 等
提出DeSA框架,通过两阶段训练分离搜索优化与答案生成,显著提升搜索召回率和问答准确率。
Yiding Wang, Zhepei Wei, Xinyu Zhu 等
提出 Wasserstein 空间中的 Busemann 函数,获得闭式表达并应用于数据切片与距离计算。
Clément Bonet, Elsa Cazelles, Lucas Drumetz 等
分析低秩回归任务中Transformer的内在机制,揭示预测分布和隐式正则化。
Kaito Takanami, Takashi Takahashi, Yoshiyuki Kabashima
TAG通过放大轨迹中的切向分量,有效减少幻觉,提高扩散模型生成的语义一致性。
Hyunmin Cho, Donghoon Ahn, Susung Hong 等
A.I.R.提出无训练的自适应迭代推理帧选择,显著提升VideoQA效率与准确性。
Yuanhao Zou, Shengji Jin, Andong Deng 等
JEF-Hinter通过离线轨迹提取紧凑、上下文感知的提示,显著提升网页代理的适应能力。
Hadi Nekoei, Aman Jaiswal, Patrice Bechard 等
基于鞅理论的审计框架,能有效检测大模型的逐步代币报告偏差,样本少于70次。
Ander Artola Velasco, Stratis Tsirtsis, Manuel Gomez-Rodriguez
ChronoEdit利用预训练视频生成模型,将图像编辑转化为时间序列推理,显著提升物理一致性。
Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen 等
PolyKAN框架通过多面体分析实现KAN压缩,提供模型缩减和误差控制的理论保证。
Di Zhang