Conformal Decision Theory: Safe Autonomous Decisions from Imperfect Predictions
引入Conformal Decision Theory,通过在线调节决策参数λ,实现在无假设环境下的低风险安全自主决策,实验涵盖机器人路径规划、制造和股票交易。
Jordan Lekeufack, Anastasios N. Angelopoulos, Andrea Bajcsy 等
引入Conformal Decision Theory,通过在线调节决策参数λ,实现在无假设环境下的低风险安全自主决策,实验涵盖机器人路径规划、制造和股票交易。
Jordan Lekeufack, Anastasios N. Angelopoulos, Andrea Bajcsy 等
提出MAGVIT-v2视频Tokenizer,通过新颖量化方法和共享词表,超越Diffusion模型,提升生成、压缩和识别性能。
Lijun Yu, José Lezama, Nitesh B. Gundavarapu 等
LLMLingua采用分层压缩策略,实现大规模语言模型提示的20倍压缩,保持任务性能。
Huiqiang Jiang, Qianhui Wu, Chin-Yew Lin 等
FREE框架通过同步并行解码显著降低推理延迟,提升性能。
Sangmin Bae, Jongwoo Ko, Hwanjun Song 等
提出Perturbed Maximization(PM)算法,优化随机性与匹配质量的平衡。
Yixuan Even Xu, Steven Jecmen, Zimeng Song 等
NOPE评估视觉语言模型中的对象幻觉,发现所有模型在NegP数据集上的准确率均低于10%。
Holy Lovenia, Wenliang Dai, Samuel Cahyawijaya 等
提出一种解决组合优化的生成模型,结合策略梯度实现近似最优解,解决景观平坦与梯度消失问题。
Constantine Caramanis, Dimitris Fotakis, Alkis Kalavasis 等
提出基于约束强化学习的多组件奖励模型过优化防控方法,有效保持奖励模型在代理有效区间。
Ted Moskovitz, Aaditya K. Singh, DJ Strouse 等
DecoderLens通过中间编码层交叉注意,实现对编码器-解码器Transformer的逐层解释。
Anna Langedijk, Hosein Mohebbi, Gabriele Sarti 等
MLAgentBench利用ReAct框架评估13项机器学习实验任务,Claude v3 Opus表现最佳,成功率37.5%。
Qian Huang, Jian Vora, Percy Liang 等
PPNL基准测试显示GPT-4在空间推理上有潜力,但在长时间推理上仍有不足。
Mohamed Aghzal, Erion Plaku, Ziyu Yao
影子对齐:只需100个恶意样本和1小时GPU时间即可破坏安全对齐的LLM。
Xianjun Yang, Xiao Wang, Qi Zhang 等
MagicDrive利用多视角3D几何控制实现高保真街景生成,提升3D感知任务性能。
Ruiyuan Gao, Kai Chen, Enze Xie 等
通过微调2D扩散模型实现视角感知,Aligning Geometric Priors(AGP)显著提升文本转3D的一致性,达85%以上。
Weiyu Li, Rui Chen, Xuelin Chen 等
自学优化器(STOP)通过递归自我改进生成代码,显著提高性能。
Eric Zelikman, Eliana Lorch, Lester Mackey 等
通过插入暂停标记训练语言模型,提升SQuAD任务18%准确率。
Sachin Goyal, Ziwei Ji, Ankit Singh Rawat 等
通过线性探针分析Llama-2模型,发现其学习了多尺度的空间和时间线性表示,存在“空间神经元”和“时间神经元”。
Wes Gurnee, Max Tegmark
OceanGPT基于LLaMA-2预训练,结合多智能体生成,显著提升海洋科学任务表现。
Zhen Bi, Ningyu Zhang, Yida Xue 等
提出Epidemic Learning(EL)算法,通过随机通信拓扑实现比传统方法更快的模型收敛。
Martijn de Vos, Sadegh Farhadkhani, Rachid Guerraoui 等
LLMs在无外部反馈的情况下无法有效自我纠正推理,甚至可能导致性能下降。
Jie Huang, Xinyun Chen, Swaroop Mishra 等