Efficient Training-Free Multi-Token Prediction via Embedding-Space Probing
通过嵌入空间探测实现高效的无训练多标记预测,提升LLaMA3的接受长度12%。
Raghavv Goel, Mukul Gagrani, Mingu Lee 等
通过嵌入空间探测实现高效的无训练多标记预测,提升LLaMA3的接受长度12%。
Raghavv Goel, Mukul Gagrani, Mingu Lee 等
GSU数据集评估LLMs在网格上的空间推理能力,揭示视觉模态对3D理解的局限。
Risham Sidhu, Julia Hockenmaier
混合深度注意力(MoDA)在1.5B参数模型上提升了2.11%的下游任务表现,计算开销仅增加3.7%。
Lianghui Zhu, Yuxin Fang, Bencheng Liao 等
使用稀疏自编码器纠正语言模型的道德冷漠,提升75%对抗性基准胜率。
Lingyu Li, Yan Teng, Yingchun Wang
Code-A1通过对抗性共进化框架,提升代码生成和测试生成能力。
Aozhe Wang, Yuchen Yan, Nan Zhou 等
AI通过社区反馈强化学习,学习科学品味,提升科学发现效率。
Jingqi Tong, Mingzhe Li, Hangcheng Li 等
通过PDPS方法揭示大型语言模型的长尾安全失败,减少计算成本33%。
Suvadeep Hajra, Palash Nandi, Tanmoy Chakraborty
提出基于变量阶n-gram的递归模型,分析漂移与选择对公共文本生态的影响。
Søren Riis
AIM-SciQA利用大模型自动生成多文档科学问答,构建了13,672个多跳问答,提升跨文献推理能力。
Seungmin Lee, Dongha Kim, Yuni Jeon 等
NAIT框架通过神经元激活模式选择高效指令微调数据,提升LLM性能。
Xin Chen, Junchao Wu, Shu Yang 等
ESG-Bench通过任务特定的思维链提示策略,显著减少大语言模型在长篇ESG报告分析中的幻觉现象。
Siqi Sun, Ben Peng Wu, Mali Jin 等
WALAR方法利用单语数据提升低资源语言翻译能力,超越LLaMAX模型。
Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa 等
提出PCA扫掠方法,优化SSD中的维度选择,提升解释性和稳定性。
Hubert Plisiecki, Maria Leniarska, Jan Piotrowski 等
Long-form RewardBench评估长文本生成的奖励模型,揭示当前模型在长文本奖励建模方面的不足。
Hui Huang, Yancheng He, Wei Liu 等
HMS-BERT通过多任务自训练实现多语言多标签网络欺凌检测,宏F1达到0.9847。
Zixin Feng, Xinying Cui, Yifan Sun 等
本研究利用词频比分析,揭示大型语言模型在个性化写作反馈中存在的刻板偏见,特别是在学生身份属性条件下的词汇偏移。
Mei Tan, Lena Phalen, Dorottya Demszky
Idea-Catalyst框架通过跨学科灵感提高科学创造力,平均新颖性提高21%,洞察力提高16%。
Priyanka Kargupta, Shuhaib Mehri, Dilek Hakkani-Tur 等
CLASP模型通过XGBoost分类器检测恶意令牌,达到95.9%令牌级F1分数。
Alexandre Le Mercier, Thomas Demeester, Chris Develder
IndexCache通过跨层索引重用加速稀疏注意力,减少75%计算量,提升1.82倍速度。
Yushi Bai, Qian Dong, Ting Jiang 等
提出一种能处理8192个token的波兰语长上下文编码器模型,显著提升长文档任务表现。
Sławomir Dadas, Rafał Poświata, Marek Kozłowski 等