Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
提出多智能体强化学习框架SCMA,有效压缩链式推理,提升准确率与效率。
Yiqun Chen, Jinyuan Feng, Wei Yang 等
提出多智能体强化学习框架SCMA,有效压缩链式推理,提升准确率与效率。
Yiqun Chen, Jinyuan Feng, Wei Yang 等
WebArbiter为基于原则的推理奖励模型,采用文本生成结构化判断,超越传统标量和模板方法。
Yao Zhang, Shijie Tang, Zeyu Li 等
SCOUT框架通过分离探索与利用,使Qwen2.5-3B-Instruct在未见任务中得分0.86,节省60%GPU时间。
Haoyu Wang, Guozheng Ma, Shugang Cui 等
提出Temporal Guidance (TeGu),通过时间维度对比提升LLM生成质量,实验显示在GSM8K上提升3.03%。
Hong-Kai Zheng, Piji Li
CoFreeVLA通过视觉-语言-动作模型和风险估计,将双臂机器人自碰撞率从0.54降至0.23,任务成功率提升至0.61。
Yaohua Liu, Binkai Ou, Hengjun Zhang
UDBM提出一种基于不确定性引导的扩散桥模型,单步实现多任务图像恢复,显著优于SOTA。
Luwei Tu, Jiawei Wu, Xing Luo 等
CORDS通过连续场映射离散结构,实现未知对象数量的精确预测。
Tin Hadži Veljković, Erik Bekkers, Michael Tiemann 等
KAPSO通过知识驱动的长时程优化框架,实现自主程序生成与优化,结合git隔离、知识图谱与记忆机制。
Alireza Nadafian, Alireza Mohammadshahi, Majid Yazdani
使用合成字幕的多模态微调方法在13个基准上显著提升,尤其是小样本学习。
Shohei Enomoto, Shin'ya Yamaguchi
DSCD-Nav采用双姿态合作辩论机制,通过交叉验证提升室内无人导航的可靠性。
Weitao An, Qi Liu, Chenghao Xu 等
MPF-Net通过层次化偏差和微观时序波动检测高保真AI视频伪造,利用Manifold Projection Fluctuations实现高效识别。
Xinan He, Kaiqing Lin, Yue Zhou 等
PTQ4ARVG框架实现了对ARVG模型的6位量化,保持竞争性能。
Xuewen Liu, Zhikai Li, Jing Zhang 等
MAD方法通过自适应解码减少跨模态幻觉,在CMM和AVHBench上提升了7.8%和2.0%。
Sangyun Chung, Se Yeon Kim, Youngchae Chee 等
提出基于vRKHS的正则化方法,解决协变量偏移下的向量回归问题,达成最优收敛速率。
Markus Holzleitner, Sergiy Pereverzyev, Sergei V. Pereverzyev 等
提出分布式主动推理(Distributional Active Inference, DAI),结合分布式强化学习,无需明确模型即可提升复杂环境控制性能。
Abdullah Akgül, Gulcin Baykal, Manuel Haußmann 等
提出ToxSearch-S,通过无监督物种化技术提升大模型毒性搜索多样性,显著增强峰值毒性和语义覆盖。
Onkar Shelar, Travis Desell
本文提出Persona Prompting(PP)方法,分析其在LLMs社会推理中的影响,涉及偏见、合理性与任务性能,基于hate speech等数据集。
Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov 等
提出了一种基于情境的运行时监控框架,显著提升了自动驾驶的安全性。
Alejandro Luque-Cerpa, Mengyuan Wang, Emil Carlsson 等
DeepSeek-OCR 2通过DeepEncoder V2实现视觉因果流,提升OmniDocBench v1.5性能3.73%。
Haoran Wei, Yaofeng Sun, Yukun Li
提出一种基于LoRA微调的敏感性感知方法,使4-bit量化LLM性能提升21.7%。
Dren Fazlija, Iyiola E. Olatunji, Daniel Kudenko 等