Embedding Models Measure in Peculiar Ways
研究发现嵌入模型对物理测量的反映较弱,受表面字符串相似性影响。
Juri Opitz, Andrianos Michail
研究发现嵌入模型对物理测量的反映较弱,受表面字符串相似性影响。
Juri Opitz, Andrianos Michail
JEPA-Anything通过正交预测分解(OPF)实现跨领域预测模型,提升34.8%预测精度。
Taoyong Cui, Zhongyao Wang, Xinyue Xu 等
RetireOPD方法通过自适应退休策略提高RL模型成功率,ALFWorld提升18.8%。
Yan Yu, Zhengxi Lu, Yizhou Liu 等
研究表明GPT模型的性别歧视被转化而非减少,提出了“伤害洗白”概念。
Sarah Wyer, Sue Black, Noura Al Moubayed
dQwen3.5通过混合注意力机制在训练损失上比全注意力模型快一倍。
Anton Xue, Litu Rout, Aditya Akella 等
提出按需注意力(ODA)方法,显著减少全局读取,提升长上下文推理效率。
Haibo Feng, Ruiqi Liang, Hanyang Peng 等
研究探讨在检索主导的抽取式问答中,序列似然信号的有效性,发现其不足以提升准确率。
Gunwoo Lee, Changmin Sung, Sang-Hwan Gwak 等
EB-Decode框架通过自适应分块和并行采样加速dLLM,吞吐量提升3.53-18.76倍。
Lixuan Wei, Wei Zhou, Jianwen Wu 等
研究探讨了截断采样在高温度下对大语言模型准确性的影响。
Francesco La Rosa
Enemray模型通过稳定性-可塑性目标提升Hassaniya语言能力,保持多语言推理和安全性。
Cheikh Ahmed
使用语义不确定性模型预测对话转接点,显著优于基线方法。
Muhammad Umair, Jan P. de Ruiter
IBIB协议通过服务路径而非模型标识符评估企业AI系统,提升可靠性测量精度。
Blake Stenstrom, Charangan Vasantharajan, Brian Sathianathan
SocialRL用多轮PPO与动态过程奖励提升社会对话目标达成率,平均提高9.2个百分点。
Jianing Wang, Xintao Wang, Aili Chen 等
CantoneseLLM v2结合CPT、DPO与RLVR,在HKCanto-Eval达73.16分并实现粤语繁体推理。
Tsz Chung Cheng, Chung Shing Cheng, Chaak Ming Lau 等
提出DH-BPE结合最小Token分割与层级依赖,优化固定词表分配。
Kenny Shao
CONDUIT框架在10%刷新预算下,达到97.0-99.5%的性能。
Pengan Chen, Kaisheng Zheng, Liang Hong 等
WearableQA基准测试评估AI在真实可穿戴数据上的健康推理能力,性能从19.6%到72.9%。
Ji Soo Lee, Xilun Chen, Pierce Chuang 等
LexFlip通过词汇扰动检测法律意义变化,NLI表现最佳。
Gaurab Baral
提出DualCWE模型,通过自监督学习从IPA词表中学习词汇表示,快速推断3399种语言的系统发育树。
Tim Wientzek
通过金锚定QLoRA和RLVR提高推理深度72.20%。
Thi Kim Trang Vo, Nam Tien Le, Thi Kim Nguyet Vo 等