High-Dimension Human Value Representation in Large Language Models
提出UniVaR方法,展示LLM中人类价值的高维表示,跨越25种语言文化。
Samuel Cahyawijaya, Delong Chen, Yejin Bang 等
提出UniVaR方法,展示LLM中人类价值的高维表示,跨越25种语言文化。
Samuel Cahyawijaya, Delong Chen, Yejin Bang 等
ResearchAgent利用大规模语言模型(LLMs)自动生成科学研究新思路,结合学术图谱和实体知识库,经过多轮评审优化。
Jinheon Baek, Sujay Kumar Jauhar, Silviu Cucerzan 等
RULER通过多任务评估长上下文模型,揭示模型在长度扩展中的性能瓶颈。
Cheng-Ping Hsieh, Simeng Sun, Samuel Kriman 等
Khayyam挑战通过20,192道四选题评估波斯语LLM能力。
Omid Ghahroodi, Marzia Nouri, Mohammad Vali Sanian 等
MiniCPM通过可扩展训练策略展示小型语言模型的潜力,性能媲美7B-13B模型。
Shengding Hu, Yuge Tu, Xu Han 等
基于ChatGLM3-6B的AutoWebGLM,通过HTML简化和强化学习实现高效网页导航。
Hanyu Lai, Xiao Liu, Iat Long Iong 等
提出一种构建高质量无关信息的框架,评估LLMs对语义相关性不同的无关信息的鲁棒性,发现其易受误导。
Siye Wu, Jian Xie, Jiangjie Chen 等
采用分布式GPT定量框架,分析950,965篇论文中LLM修改比例,2020-2024年增长显著。
Weixin Liang, Yaohui Zhang, Zhengxuan Wu 等
提出RQ-RAG,通过查询重写、拆解与消歧,提升7B Llama2模型在单、多跳问答中的表现,超越SOTA。
Chi-Min Chan, Chunpu Xu, Ruibin Yuan 等
Gecko通过两步蒸馏大模型知识,使用256维超越768维模型性能。
Jinhyuk Lee, Zhuyun Dai, Xiaoqi Ren 等
LlamaFactory整合多种高效微调技术,支持100+模型,无编码需求。
Yaowei Zheng, Richong Zhang, Junhao Zhang 等
提出“有效截止”概念,通过跨版本探测估算LLM的资源级时间对齐,揭示实际知识截止与报告截止的差异。
Jeffrey Cheng, Marc Marone, Orion Weller 等
SHROOM任务检测NLG系统中的虚假信息,采用4000样本标注,基于模型微调和零样本提示策略。
Timothee Mickus, Elaine Zosa, Raúl Vázquez 等
提出基于Token级不确定性量化的事实核查方法(CCP),在7个模型和4种语言中显著提升准确率。
Ekaterina Fadeeva, Aleksandr Rubashevskii, Artem Shelmanov 等
Design2Code基准测试多模态代码生成在真实网页中的表现,模型在视觉元素召回和布局生成方面仍有差距。
Chenglei Si, Yanzhe Zhang, Ryan Li 等
MathScale通过主题提取与概念图构建,生成200万数学推理问答,显著提升LLMs数学能力。
Zhengyang Tang, Xingxing Zhang, Benyou Wang 等
提出探索驱动的轨迹优化方法ETO,通过学习失败轨迹提升LLM智能体性能,实验显示优于基线。
Yifan Song, Da Yin, Xiang Yue 等
提出Key-Point-Driven Data Synthesis(KPDDS),构建800K+数学推理问答数据集,显著提升模型性能。
Yiming Huang, Xiao Liu, Yeyun Gong 等
本研究比较多种LLM多项选择预测方法,发现结果对评分方法敏感,影响研究可靠性。
Polina Tsvilodub, Hening Wang, Sharon Grosch 等
CLLMs通过改进Jacobi解码实现2.4至3.4倍的生成速度提升,同时保持生成质量。
Siqi Kou, Lanxiang Hu, Zhezhi He 等