Sentiment Analysis in the Era of Large Language Models: A Reality Check
大语言模型在情感分析中表现良好,但在复杂任务中仍有不足。
Wenxuan Zhang, Yue Deng, Bing Liu 等
大语言模型在情感分析中表现良好,但在复杂任务中仍有不足。
Wenxuan Zhang, Yue Deng, Bing Liu 等
提出形式化与分类方法,分析3700个越狱提示在多模型上的效果。
Abhinav Rao, Sachin Vashistha, Atharva Naik 等
提出了MetricEval框架,利用测量理论评估NLG指标的可靠性和有效性。
Ziang Xiao, Susu Zhang, Vivian Lai 等
提出DAP方法在推理阶段校正GCN推荐中的流行偏差,显著改善尾部物品推荐效果。
Jiajia Chen, Jiancan Wu, Jiawei Chen 等
提出AutoCompressors,通过无监督训练将长文本压缩为摘要向量,提升长文本理解与推理能力。
Alexis Chevalier, Alexander Wettig, Anirudh Ajith 等
提出上下文感知解码(CAD),无需额外训练,显著提升多模型的事实一致性,尤其在知识冲突场景中效果突出。
Weijia Shi, Xiaochuang Han, Mike Lewis 等
BLIP-Diffusion结合预训练主体表示,实现零-shot和快速微调的可控文本到图像生成。
Dongxu Li, Junnan Li, Steven C. H. Hoi
提出ALCE基准,自动评估大语言模型生成带引用文本的能力,涵盖三维指标。
Tianyu Gao, Howard Yen, Jiatong Yu 等
VIPER利用预训练视频预测模型作为奖励信号,实现无需任务奖励的复杂行为学习。
Alejandro Escontrela, Ademi Adeniji, Wilson Yan 等
提出Diffusion Hyperfeatures,通过多尺度、多时间步特征融合实现语义对应,提升关键点匹配性能。
Grace Luo, Lisa Dunlap, Dong Huk Park 等
提出利用大语言模型动态选择CoT与PAL,显著提升推理性能,GSM8K达96.8%。
James Xu Zhao, Yuxi Xie, Kenji Kawaguchi 等
CREATOR通过工具创建实现抽象与具体推理分离,提升在数学和表格问题上的表现。
Cheng Qian, Chi Han, Yi R. Fung 等
QLoRA通过4-bit量化和LoRA,能在单GPU上微调65B模型,性能接近ChatGPT。
Tim Dettmers, Artidoro Pagnoni, Ari Holtzman 等
提出SciMON框架,通过检索启发源并优化新颖性,提升神经语言模型的科学创新能力。
Qingyun Wang, Doug Downey, Heng Ji 等
FActScore通过将长文本拆解为原子事实,计算支持比例,显著提升事实准确性评估的细粒度和自动化水平。
Sewon Min, Kalpesh Krishna, Xinxi Lyu 等
通过规模化高质量指令对话数据UltraChat,微调LLaMA-13B模型UltraLLaMA,显著优于Vicuna,提升多轮对话性能。
Ning Ding, Yulin Chen, Bokai Xu 等
PEQA方法通过更新量化尺度实现低于4位精度的LLM微调,显著减少内存需求。
Jeonghoon Kim, Jung Hyun Lee, Sungdong Kim 等
本文提出LLM-MCTS,将大规模任务规划中的世界模型与策略结合,显著优于单一方法。
Zirui Zhao, Wee Sun Lee, David Hsu
提出时间对比学习(TCL)和孪生网络STCL,提升SNN低延迟高性能,CIFAR-10/100等数据集达SOTA。
Haonan Qiu, Zeyin Song, Yanqi Chen 等
提出基于合成反馈的对齐方法,训练出超越开源模型的ALMoST(65.2%准确率),无需大量人类标注。
Sungdong Kim, Sanghwan Bae, Jamin Shin 等