In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback
InTRO通过令牌级探索和自反馈提升LLM推理准确性与简洁性,解决单一“黄金”路径限制。
Mingye Zhu, Yi Liu, Zheren Fu 等
InTRO通过令牌级探索和自反馈提升LLM推理准确性与简洁性,解决单一“黄金”路径限制。
Mingye Zhu, Yi Liu, Zheren Fu 等
C$^3$TG通过冲突感知和协作控制实现多维文本生成,显著提升属性准确率。
Yu Li, Zhe Yang, Yi Huang 等
提出Supervised Rational Attention(SRA),通过对齐模型注意力与人类理据,提升仿真性与公平性。
Brage Eilertsen, Røskva Bjørgfinsdóttir, Francielle Vargas 等
Llama-Embed-Nemotron-8B采用对比学习和多样数据混合,达成多语种和跨语任务的SOTA性能,基于16.1M问答对,公开模型权重。
Yauhen Babakhin, Radek Osmulski, Ronay Ak 等
提出OckBench,结合准确率与Token效率,揭示模型推理中的显著效率差距。
Zheng Du, Hao Kang, Song Han 等
提出BACO框架,通过模型合作在推理时优化多样性与质量,提升21.3%的联合指标。
Yichen Wang, Chenghao Yang, Tenghao Huang 等
批量提示有效抑制大规模推理模型的过度思考,减少76%推理令牌。
Saurabh Srivastava, Janit Bidhan, Hao Yan 等
MUTANT通过两阶段训练和语言感知预处理,显著提升多语种Tokenizer性能,降低Fertility达39.5%。
Souvik Rana, Arul Menezes, Ashish Kulkarni 等
提出SpecDiff-2,结合离散扩散模型与对齐机制,显著提升LLM推理速度达5.5倍。
Jameson Sandler, Jacob K. Christopher, Thomas Hartvigsen 等
Tool Decathlon基准测试32应用,涵盖真实环境和长时任务,模型成功率仅38.6%。
Junlong Li, Wenshuo Zhao, Jian Zhao 等
MDP-Agent通过多路径转化实现AI搜索,提升信息检索准确率至35%
Hongjin Qian, Zheng Liu
基于Gemma 3的MetricX-25和GemSpanEval,提升翻译质量评估与错误检测性能。
Juraj Juraska, Tobias Domhan, Mara Finkelstein 等
提出WebLeaper框架,通过树状推理模型和多源信息合成提升WebAgent的搜索效率和效果。
Zhengwei Tao, Haiyang Shen, Baixuan Li 等
提出R3框架,通过强化学习优化RAG检索性能,提升5.2%。
Jiawei Zhou, Lei Chen
Pie系统通过API和inferlets实现灵活高效的LLM服务,提升1.3x-3.4x吞吐量。
In Gim, Zhiyao Ma, Seung-seob Lee 等
提出时间感知偏差(Temporal Blindness)问题,通过TicToc数据集评估LLM工具调用与人类时间感知的偏差,发现模型表现不足65%。
Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan 等
提出TIR-Judge,通过工具集成强化学习提升LLM评判性能,超越多项基准。
Ran Xu, Jingjing Chen, Jiayu Ye 等
EchoMind提出多层基准测试,评估SLM在语音内容理解、声学线索感知、推理与同理心对话生成中的表现。
Li Zhou, Lutong Yu, You Lyu 等
E2Rank通过在单一文本嵌入模型上继续训练,实现高效的检索与列表重排序,显著提升性能与效率。
Qi Liu, Yanzhao Zhang, Mingxin Li 等
提出GEMs,通过多样架构和高质量语料,提升希腊语NLP性能,准确率提升达3.6%。
Alexandra Apostolopoulou, Konstantinos Kanaris, Athanasios Koursaris 等