Towards Reasoning in Large Language Models: A Survey
综述大语言模型推理能力,提出链式思维等方法,GSM8K数据集上显著提升准确率。
Jie Huang, Kevin Chen-Chuan Chang
综述大语言模型推理能力,提出链式思维等方法,GSM8K数据集上显著提升准确率。
Jie Huang, Kevin Chen-Chuan Chang
提出Fine-tune-CoT,通过大模型生成推理样本,显著提升小模型推理能力。
Namgyu Ho, Laura Schmid, Se-Young Yun
提出HALIE框架评估人机交互,发现非交互性能不等于交互体验。
Mina Lee, Megha Srivastava, Amelia Hardy 等
INSTRUCTOR为单一模型,无需微调即可生成多任务文本嵌入,提升3.4%。
Hongjin Su, Weijia Shi, Jungo Kasai 等
本研究提出4-bit量化在大规模语言模型中的最优推理缩放规律,结合35,000余实验验证。
Tim Dettmers, Luke Zettlemoyer
提出基于最优传输的无监督神经机器翻译幻觉检测器,显著优于模型和外部方法。
Nuno M. Guerreiro, Pierre Colombo, Pablo Piantanida 等
提出基于强化学习的自动提示优化框架PROMPTIST,提升文本到图像生成的效果。
Yaru Hao, Zewen Chi, Li Dong 等
基于BERT的神经排序模型显著优于传统方法,用于医学系统综述筛选优先级排序。
Shuai Wang, Harrisen Scells, Bevan Koopman 等
提出基于源贡献百分比的检测方法,提升严重幻觉识别准确率至2倍,结合跨语嵌入句子相似度效果更佳。
David Dale, Elena Voita, Loïc Barrault 等
提出基于变换高斯过程的线性网络Cox过程模型,涵盖Log Gaussian、中断和永恒型,创新模拟算法与统计推断。
Jesper Møller, Jakob G. Rasmussen
基于深度强化学习的UAV主动目标感知路径规划,提升目标发现与分类效率。
Harsh Goel, Laura Jarin Lipschitz, Saurav Agarwal 等
采用Waymo的碰撞规避测试(CAT)方法,评估SAE Level 4自动驾驶系统在紧急避让场景中的安全性。
Kristofer D. Kusano, Kurt Beatty, Scott Schnelle 等
本研究评估零样本链式思维在敏感社会任务中的偏见与毒性,发现模型规模越大偏见越明显。
Omar Shaikh, Hongxin Zhang, William Held 等
Objaverse 1.0收集了超过80万高质量、多类别的3D模型,配有详细描述,用于推动3D生成、细粒度分类和AI导航等应用。
Matt Deitke, Dustin Schwenk, Jordi Salvador 等
提出基于编码器-解码器注意力的SimulST策略EDAtt,提升BLEU和降低延迟。
Sara Papi, Matteo Negri, Marco Turchi
Imagen Editor结合级联扩散模型和EditBench基准,提升文本引导图像修复。
Su Wang, Chitwan Saharia, Ceslee Montgomery 等
ISVOS融合实例理解与记忆匹配,DAVIS17验证集J&F达87.1%。
Junke Wang, Dongdong Chen, Zuxuan Wu 等
通过微调大规模预训练模型(如CodeGen-16B)生成Verilog代码,整体正确率达25.9%,功能正确性超越商业模型。
Shailja Thakur, Baleegh Ahmad, Zhenxing Fan 等
提出LMQL,将提示转化为脚本,支持约束,显著提升LLM调用效率。
Luca Beurer-Kellner, Marc Fischer, Martin Vechev
研究Sinkhorn算法收敛速率,证明相对熵误差为O(t^{-1}),适用于广泛成本函数和边缘分布。
Promit Ghosal, Marcel Nutz