Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers
FlexPension-LLM模型预测中国灵活就业者养老金参与,F1值达0.9316。
Yumiao Li, Peixin Liu, Donglin Di 等
FlexPension-LLM模型预测中国灵活就业者养老金参与,F1值达0.9316。
Yumiao Li, Peixin Liu, Donglin Di 等
TeQHallu利用低级符号能力进行无监督幻觉检测,在RAGTruth数据集上表现优异。
Renato Vukovic, Hsien-chin Lin, Carel van Niekerk 等
提出“编译训练”方法,将自然语言描述转化为可重用的神经函数,准确率达83.6%。
Yuntian Deng, Pengyu Nie, Stuart Shieber
ESPO通过结构化误差诊断、多策略候选生成和自助稳定选择,提升提示优化准确率3.76%,缩短47%。
Lihao Liu, Peng Tang, Kunwar Yashraj Singh 等
本研究提出以优势值衡量推理步骤的重要性,发现LLMs难以从文本中完全解码步骤重要性。
Kevin Du, Alexander Hoyle, Laura Ruis 等
本研究提出辅助视角(如重述、类比)能提升大模型的知识获取效率,实验证明在规模扩大下效果更显著。
Joseph Lee, Yidi Huang, Dokyoon Kim 等
提出Last翻译基准,结合人类审查和验证规则,提升模型失败检测能力。
Vilém Zouhar, Niyati Bafna, Mukund Choudhary 等
通过构建合成与真实数据,验证用户反馈对LLMs提升效果显著,揭示评估偏差。
Shachar Don-Yehiya, Leshem Choshen, Omri Abend
本文揭示输出格式影响数据质量与模型能力,Spectral统计不敏感,方向性指标有效识别目标任务。
Chengguang Gan, Hanjun Wei, Yunhao Liang 等
本研究揭示LLM评估器在摘要评价中的内部机制,发现其在层15后通过注意力和MLP实现错误检测与评分决策。
Himil Vasava, Ming Jiang
CordisBench评估语言模型在动态组件生命周期推理中的表现,涉及1200题,揭示模型在复杂依赖下的局限。
Damien Sileo, Dimitri Kachler
提出StudentSim框架,通过池化训练和个性化微调,提升学生模拟器的行为一致性和指导响应性。
Ke Yang, Chenglong Wang, Michel Galley 等
基于35B参数的困难感知数据筛选与质量调整部署,显著降低文档理解成本达80%。
Maksim Evdokimov, Matvey Ivanov, Dmitrii Tsiupin 等
中期训练中的知识蒸馏提升推理能力但减缓事实回忆,提出Switch Distillation方法。
Jacqueline He, Howard Yen, Shuyue Stella Li 等
PersuaRL通过强化学习驱动的多专家选择框架,在保险对话生成中实现了显著的说服力提升。
Rohan Kirti, Akash Ghosh, Aryan Vats 等
提出Phrase-Localized LCG,无需训练即可实现代码切换TTS的本地化口音控制。
Che Hyun Lee, Sangkwon Park, Donghun Kang 等
提出披露门控机制,基于五级门控层次提升用户模拟的真实性,确保排名稳定。
Yao Liu, Yu He
提出上下文感知交错批处理方法,结合VAD边界稳定WhisperX,显著降低WER并提升专有名词识别。
Carlos Bain, Max Bain
AutoSciRub通过自动诱导任务特定的可执行评分标准,提升科研代理的评估与改进能力。
Xuehai Wang, Haowei Qin, Tongxin Liu 等
知识对齐的监督微调减少幻觉,提升事实性。
Arthur Becker, Jakob Kemmler, David Thulke 等