LongNet: Scaling Transformers to 1,000,000,000 Tokens
提出LongNet,采用扩张注意力实现超10亿Token序列建模,复杂度线性。
Jiayu Ding, Shuming Ma, Li Dong 等
提出LongNet,采用扩张注意力实现超10亿Token序列建模,复杂度线性。
Jiayu Ding, Shuming Ma, Li Dong 等
提出<projektor>框架,利用最优传输距离进行部分样本数据性能预测,优化数据选择,显著提升性能推断与数据采样效率。
Feiyang Kang, Hoang Anh Just, Anit Kumar Sahu 等
Spike-driven Transformer结合SNN与Transformer,ImageNet-1K上达77.1%准确率。
Man Yao, Jiakui Hu, Zhaokun Zhou 等
提出engression神经网络分布回归方法,能有效进行外推,适用于高维结果。
Xinwei Shen, Nicolai Meinshausen
RH20T数据集通过一键学习实现多技能的机器人操控,包含11万条序列。
Hao-Shu Fang, Hongjie Fang, Zhenyu Tang 等
MedCPT采用对比学习,利用2.55亿PubMed搜索日志实现零样本生物医学信息检索,超越多种基线模型。
Qiao Jin, Won Kim, Qingyu Chen 等
提出GGS方法,通过图平滑优化蛋白质,提升2.5倍Fitness,应用图正则和MCMC。
Andrew Kirjner, Jason Yim, Raman Samusevich 等
本文评估两种测量大模型信念的方法,发现均无法有效泛化,提出信念存在的哲学与实证争议。
B. A. Levinstein, Daniel A. Herrmann
提出层次神经编码模型,利用三层代码树实现高效可控CAD生成,提升模型复杂度与交互能力。
Xiang Xu, Pradeep Kumar Jayaraman, Joseph G. Lambourne 等
提出Twisted Diffusion Sampler(TDS),实现条件采样的渐近精确性,优化蛋白质设计和图像生成。
Luhuan Wu, Brian L. Trippe, Christian A. Naesseth 等
提出基于可学习间距的扩张卷积学习神经网络中的延迟,显著提升时间模式识别性能。
Ilyass Hammouamri, Ismail Khalfaoui-Hassani, Timothée Masquelier
提出Michelangelo框架,通过Shape-Image-Text对齐的潜在空间实现基于图像或文本的3D形状生成,显著提升质量与多样性。
Zibo Zhao, Wen Liu, Xin Chen 等
Sparse Model Soups方法通过模型平均改进剪枝,提升泛化和OOD性能,同时保持稀疏性。
Max Zimmer, Christoph Spiegel, Sebastian Pokutta
本文提出一种量化评估语言模型对全球主观观点代表性的框架,基于GlobalOpinionQA数据集,分析模型偏向性和文化刻板印象。
Esin Durmus, Karina Nguyen, Thomas I. Liao 等
本文系统回顾了2012-2023年Optimal Transport(OT)在机器学习中的最新进展,涵盖理论基础、计算方法及应用扩展。
Eduardo Fernandes Montesuma, Fred Ngolè Mboula, Antoine Souloumiac
提出COMPASS,通过可微因果发现闭合仿真-实世界差距,提升轨迹匹配与任务成功率。
Peide Huang, Xilun Zhang, Ziang Cao 等
REFLECT利用多模态层级总结和大语言模型实现机器人故障解释与修正。
Zeyi Liu, Arpit Bahety, Shuran Song
LeanDojo通过引入检索增强的语言模型ReProver,利用Lean数学库中的98,734个定理实现高效自动定理证明,训练仅用一周GPU。
Kaiyu Yang, Aidan M. Swope, Alex Gu 等
提出位置插值(PI)方法,将RoPE编码的LLaMA模型上下文扩展至32768,仅需1000步微调,显著提升长文本处理能力。
Shouyuan Chen, Sherman Wong, Liangjian Chen 等
提出多领域评估基准MESS,利用CLIP等模型实现零样本语义分割,涵盖22个数据集。
Benedikt Blumenstiel, Johannes Jakubik, Hilde Kühne 等