Phi-4 Technical Report
phi-4为14亿参数模型,采用高质量合成数据和创新训练策略,显著超越教师模型GPT-4在STEM问答能力。
Marah Abdin, Jyoti Aneja, Harkirat Behl 等
phi-4为14亿参数模型,采用高质量合成数据和创新训练策略,显著超越教师模型GPT-4在STEM问答能力。
Marah Abdin, Jyoti Aneja, Harkirat Behl 等
Coconut方法通过连续潜在空间推理显著提升逻辑任务表现,实验表明其在ProsQA上优于传统CoT。
Shibo Hao, Sainbayar Sukhbaatar, DiJia Su 等
提出Gated DeltaNet,通过门控与Delta规则结合,显著提升长序列任务性能。
Songlin Yang, Jan Kautz, Ali Hatamizadeh
本论文系统综述了基于大规模语言模型(LLMs)作为评估者的方法,涵盖功能、方法、应用、元评估与局限,强调其创新与挑战。
Haitao Li, Qian Dong, Junjie Chen 等
Aya Expanse为8B/32B多语模型,结合数据套利、偏好训练和模型合并,性能超越同类模型。
John Dang, Shivalika Singh, Daniel D'souza 等
提出Relign框架,通过可靠性对齐显著减少工具幻觉,提升任务可靠性。
Hongshen Xu, Zichen Zhu, Lei Pan 等
大语言模型驱动的社会模拟研究,分类为个体、场景和社会模拟。
Xinyi Mou, Xuanwen Ding, Qi He 等
提出Pragmatic Metacognitive Prompting(PMP),利用语言学 pragmatics 和反思策略,显著提升LLMs在讽刺检测中的表现,GPT-4o在MUStARD和SemEval2018上达成SOTA。
Joshua Lee, Wyatt Fong, Alexander Le 等
MiniKV通过2位层区分KV缓存实现86%压缩率,保持98.5%准确率。
Akshat Sharma, Hangliang Ding, Jianping Li 等
提出结合视觉语言预训练模型与知识推理的VQA新框架,显著提升准确率。
Jiayi Kuang, Jingyou Xie, Haohao Luo 等
提出LLM评判系统的定义与标准,强调一致性、偏差控制与多场景适应。
Jiawei Gu, Xuhui Jiang, Zhichao Shi 等
XGrammar用自适应缓存+持久栈实现CFG结构生成,推理延迟最高降100x。
Yixin Dong, Charlie F. Ruan, Yaxing Cai 等
本文通过MorphScore评估22种语言的词形对齐,发现数据规模比形态复杂性更影响模型性能。
Catherine Arnett, Benjamin K. Bergen
Hymba采用混合头架构,结合Transformer注意力机制与状态空间模型(SSM),实现参数紧凑、性能优越,超越同类小模型。
Xin Dong, Yonggan Fu, Shizhe Diao 等
利用大规模用户日志分析Tetun低资源MT,揭示用户需求与领域偏好。
Raphael Merx, Adérito José Guterres Correia, Hanna Suominen 等
提出RandSymKL方法,结合对称KL和交叉熵,有效减轻孟加拉语分类任务中的外在性别偏见。
Sajib Kumar Saha Joy, Arman Hassan Mahy, Meherin Sultana 等
使用大型语言模型作为用户代理评估任务导向对话系统,提升多样性和任务完成率。
Taaha Kazi, Ruiliang Lyu, Sizhe Zhou 等
Spider 2.0框架评估语言模型在企业级文本到SQL工作流中的表现,仅解决21.3%的任务。
Fangyu Lei, Jixuan Chen, Yuxiao Ye 等
通过合成上下文评估语言模型对不明确查询的响应,发现上下文能显著改变评估结论。
Chaitanya Malaviya, Joseph Chee Chang, Dan Roth 等
提出连续记忆Factoids的框架,采用REMIX策略显著缓解模型遗忘。
Howard Chen, Jiayi Geng, Adithya Bhaskar 等