SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control
SSD-LM是一种基于扩散的语言模型,在文本生成和模块化控制上表现优异。
Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov
SSD-LM是一种基于扩散的语言模型,在文本生成和模块化控制上表现优异。
Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov
GPTQ是一种基于二阶信息的单次量化方法,可将1750亿参数模型压缩至4比特,保持高精度。
Elias Frantar, Saleh Ashkboos, Torsten Hoefler 等
CoRe方法通过合作推理提升数学题解决能力,提升9.6%。
Xinyu Zhu, Junjie Wang, Lin Zhang 等
提出自适应物理信息神经算子,最大相对误差4.5%,加速一倍。
Ivan Zanardi, Simone Venturi, Marco Panesi
本文系统综述了基于深度神经网络(DNN)求解偏微分方程(PDEs)的方法,涵盖PINNs、Neural Operators等,强调其算法机制与应用潜力。
Shudong Huang, Wentao Feng, Chenwei Tang 等
提出对比解码(Contrastive Decoding, CD),利用大模型与小模型的概率差异优化文本生成,显著提升文本质量。
Xiang Lisa Li, Ari Holtzman, Daniel Fried 等
引入6.5TB规模的DiffusionDB,分析文本提示与生成模型关系,揭示模型误差与潜在滥用。
Zijie J. Wang, Evan Montoya, David Munechika 等
提出ID-unaware深度伪造检测模型,缓解隐式身份泄露,提升跨数据集泛化能力。
Shichao Dong, Jin Wang, Renhe Ji 等
PlanT利用对象级表示和Transformer架构,在CARLA长距离基准中达到了专家水平,推理速度提升5.3倍。
Katrin Renz, Kashyap Chitta, Otniel-Bogdan Mercea 等
算法蒸馏(AD)通过因果序列模型将RL算法转化为神经网络,提升数据效率。
Michael Laskin, Luyu Wang, Junhyuk Oh 等
提出SciFact-Open,利用模型融合策略在50万摘要中验证科学声明,F1下降超15。
David Wadden, Kyle Lo, Bailey Kuehl 等
采用强化学习(如DQN、UCB)优化语音识别和自然语言任务,提升模型适应性和效率。
Baihan Lin
提出EMF指标和新数据集,评估单目动态视图合成在无多视信号下性能下降1-2dB。
Hang Gao, Ruilong Li, Shubham Tulsiani 等
提出高保真神经音频压缩模型EnCodec,结合端到端训练和多尺度判别,压缩比提升40%,支持实时处理。
Alexandre Défossez, Jade Copet, Gabriel Synnaeve 等
通过变体GPT模型在奥赛洛(Othello)中预测合法走子,发现内部非线性世界表征,并用干预技术验证其因果作用。
Kenneth Li, Aspen K. Hopkins, David Bau 等
基于L5PC双点神经元的深度神经网络(MCC架构)实现能效提升62%,在多模态音视频处理表现优异。
Ahsan Adeel, Adewale Adetomi, Khubaib Ahmed 等
提出Code4Struct,利用代码生成实现少样本事件结构预测,显著提升性能。
Xingyao Wang, Sha Li, Heng Ji
提出MALI,结合标签信息的流形对齐方法,显著优于现有技术。
Andres F. Duque, Myriam Lizotte, Guy Wolf 等
研究发现零样本和上下文学习在问答模型中更具分布鲁棒性,测试了350多种模型。
Anas Awadalla, Mitchell Wortsman, Gabriel Ilharco 等
利用大语言模型进行多项选择题回答,MCP方法在20个数据集上缩小与SOTA的差距。
Joshua Robinson, Christopher Michael Rytting, David Wingate