Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models
提出Buffer of Thoughts(BoT),通过思维模板提升LLMs的推理准确率20%以上。
Ling Yang, Zhaochen Yu, Tianjun Zhang 等
提出Buffer of Thoughts(BoT),通过思维模板提升LLMs的推理准确率20%以上。
Ling Yang, Zhaochen Yu, Tianjun Zhang 等
MLVU基准使用长视频(平均15分钟)评估多任务长视频理解,涵盖9类任务,测试23个MLLM模型,揭示性能提升空间。
Junjie Zhou, Yan Shu, Bo Zhao 等
提出将大模型幻觉视为叙事资源,实验证明其具有更高的叙事性和连贯性。
Peiqi Sui, Eamon Duede, Sophie Wu 等
采用k-sparse自编码器控制稀疏性,训练出规模达1600万潜变量的模型,揭示其规模与特征质量的清晰增长规律。
Leo Gao, Tom Dupré la Tour, Henk Tillman 等
提出Latent Neural Operator(LNO)在潜在空间中求解PDE,显著降低计算成本并提升精度。
Tian Wang, Chuang Wang
Bench2Drive为闭环端到端自主驾驶能力多维评测基准,涵盖44场景,含2百万标注帧。
Xiaosong Jia, Zhenjie Yang, Qifeng Li 等
Lean Workbook通过生成和过滤合成数据,将自然语言数学问题转化为Lean 4语句,提升LLM性能,数据集含57K对问题。
Huaiyuan Ying, Zijian Wu, Yihan Geng 等
ReST-MCTS*通过树搜索引导的自我训练,利用过程奖励自动推断高质量推理轨迹,提升LLM性能。
Dan Zhang, Sining Zhoubian, Ziniu Hu 等
RADD模型通过重参数化吸收离散扩散,提升语言建模性能。
Jingyang Ou, Shen Nie, Kaiwen Xue 等
POAM结合非平稳注意核,实现在线高效机器人信息采集。
Weizhe Chen, Lantao Liu, Roni Khardon
提出OmegaPRM算法,利用自动化蒙特卡洛树搜索提升数学推理中的过程监督,显著改善大模型表现。
Liangchen Luo, Yinxiao Liu, Rosanne Liu 等
提出一种渐变优化算法实现多保真最优臂识别,匹配理论下界。
Riccardo Poiani, Rémy Degenne, Emilie Kaufmann 等
RoboCasa利用生成AI丰富场景,结合模拟与模仿学习,提升通用机器人在家庭环境中的表现。
Soroush Nasiriany, Abhiram Maddukuri, Lance Zhang 等
提出自我引导的扩散模型方法,利用性能较差的模型提升图像质量,ImageNet生成FID达1.01。
Tero Karras, Miika Aittala, Tuomas Kynkäänniemi 等
提出基于知识空白分类的AI代理安全框架,涵盖多步输入、内部复杂性、环境变化和外部交互。
Zehang Deng, Yongjian Guo, Changzhou Han 等
提出DEFT,通过学习广义h变换快速微调扩散模型,提升条件采样效率与性能。
Alexander Denker, Francisco Vargas, Shreyas Padhy 等
SpatialRGPT通过3D场景图和深度融合显著提升VLM的空间推理能力。
An-Chieh Cheng, Hongxu Yin, Yang Fu 等
利用带重用批次的两层神经网络与SGD,实现低维多项式学习,接近信息论极限。
Jason D. Lee, Kazusato Oko, Taiji Suzuki 等
提出离散空间引导方法,基于连续时间马尔可夫链实现样本条件控制。
Hunter Nisonoff, Junhao Xiong, Stephan Allenspach 等
提出MediQ,结合主动提问的LLM临床推理基准,显著提升信息获取与诊断准确率。
Shuyue Stella Li, Vidhisha Balachandran, Shangbin Feng 等