RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format
RAIN-Merging是一种无梯度融合方法,提升大规模推理模型的指令遵循能力,保持思考格式。
Zhehao Huang, Yuhang Liu, Baijiong Lin 等
RAIN-Merging是一种无梯度融合方法,提升大规模推理模型的指令遵循能力,保持思考格式。
Zhehao Huang, Yuhang Liu, Baijiong Lin 等
提出MBT框架,通过五阶段结构提升多跳问答准确性和效率。
Ik-hwan Kim, Hyeongrok Han, Mingi Jung 等
提出VeRO框架,结合版本控制与奖励机制,提升编码代理优化性能。
Varun Ursekar, Apaar Shanker, Veronica Chatrath 等
FlowCorrect通过VR接口进行人类纠正,提升机器人操作成功率至80%。
Edgar Welte, Yitian Shi, Rosa Wolf 等
LARFT通过长度感知强化微调,提升模型长度指令遵循,平均提升20.92分。
Wei Zhang, Lintong Du, Yuanhe Zhang 等
UpSkill通过互信息技能学习提升LLM的多次尝试正确率,平均提升约3%。
Devan Shah, Owen Yang, Daniel Yang 等
基于Transformer的基础模型促进机器人全栈迁移,涵盖语言、视觉和动作层面。
Freek Stulp, Samuel Bustamante, João Silvério 等
本研究评估8个前沿大模型在因果发现算法性能预测中的校准能力,发现普遍存在算法盲视。
Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote
ProactiveMobile是一个提升移动设备主动智能的综合基准,Qwen2.5-VL-7B-Instruct成功率达20.82%。
Dezhi Kong, Zhengzhao Feng, Qiliang Liang 等
提出Kareto,通过模拟优化多目标存储配置,提升LLM KV缓存性能与成本效率。
Xianzhe Zheng, Zhengheng Wang, Ruiyan Ma 等
提出PhysicEdit,通过物理状态转移建模实现更真实的图像编辑,提升物理合理性5.9%。
Liangbing Zhao, Le Zhuo, Sayak Paul 等
提出Token-Selective Dual Knowledge Distillation(TSD-KD),在10个基准上提升准确率达54.4%。
Minsang Kim, Seung Jun Baek
LessMimic利用距离场(DF)实现长时段人形机器人自主交互,无需运动参考,支持几何泛化和技能组合。
Yutang Lin, Jieming Cui, Yixuan Li 等
提出自洽的自对偶杨-米尔斯理论(SDYM)在AdS/CFT中的边界数据分析与多边形函数计算。
Evgeny Skvortsov, Richard Van Dongen
提出基于互信息的RAG检索器评估框架MIGRASCOPE,量化检索质量与冗余。
Wenqing Zheng, Dmitri Kalaev, Noah Fatsi 等
ReAct智能体结合VES*与VCES,揭示GPT-4o在大规模Text-to-Big SQL中以准确率换取最高效率。
Germán T. Eizaguirre, Lars Tissen, Marc Sánchez-Artigas
Pancake结合多层索引缓存、跨代理索引管理与GPU-CPU协作,显著提升多代理LLM存储性能,达4.29倍吞吐。
Zhengding Hu, Zaifeng Pan, Prabhleen Kaur 等
提出RoPE-ID方法,通过高频率应用RoPE于部分通道,提升长输入处理能力。
Davis Wertheimer, Aozhong Zhang, Derrick Liu 等
NoRD模型在Waymo和NAVSIM上实现了高效的视觉-语言-动作学习,仅使用60%数据,无需推理。
Ishaan Rawal, Shubh Gupta, Yihan Hu 等
使用张量并行扩展SSM模型,在多GPU上提高推理吞吐量。
Anurag Dutt, Nimit Shah, Hazem Masarani 等