Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
提出MetaEvolve,利用强化学习培养LLMs的自我演化核心技能,提升代码任务表现。
Shujin Wu, Cheng Qian, Xiusi Chen 等
提出MetaEvolve,利用强化学习培养LLMs的自我演化核心技能,提升代码任务表现。
Shujin Wu, Cheng Qian, Xiusi Chen 等
提出DomainPilot,基于域级损失的两阶段数据混合优化,提升LLM微调效果。
He Zhang
SCALE通过自监督生成多层布局文本,结合规则引导提升先进节点局部DRV修复成功率达97%。
Chia-Tung Ho, Haoyu Yang, Guanglei Zhou 等
提出Trans-Unet,通过3D点云到2D映射结合CNN与自注意力,实现脑皱褶高保真预测。
Geran Zhao, Xiaotian Li, Poorya Chavoshnejad 等
提出ADSD,通过软崩溃机制攻击推测解码中的验证器,显著降低推理效率。
Run Wang, Chaoyi Zhou, Xi Liu 等
提出ConVBench评估复杂视觉推理,结合GRPO强化学习显著提升LVLM一致性与准确率。
Liqiang Jing, Xiong Zhou, Siddharth Varia 等
提出零流两样本检验(ZF2ST),在合成和图像数据集上表现出色。
Yakun Wang, Leyang Wang, Song Liu 等
DLMRec通过离散扩散语言模型提高推荐系统性能,显著提升召回率和NDCG。
Chengyi Liu, Yongqi Zhou, Junwei Pan 等
用排除池精确审计证明漏检质量,零漏检下标签复杂度为Ω(N₀/m)。
Martin Anthony, Kaveh Salehzadeh Nobari
DAPM模型实现无人机单目深度估计,适用于任意高度、俯仰、滚动和视场,达到最先进性能。
Tong Ling, Wenhui Diao, Yingchao Feng 等
提出基于局部上下文的加权离散流匹配,显著降低生成困惑度达63%。
Daniil Cherniavskii, Daniel Severo, Karen Ullrich
M2S方法通过线性映射预测干净标记后验均值,提升生成PPL至143.3。
Jingyuan Li, Xiaoyi Jiang, Yixuan Jiang 等
构建融合伦理和价值模型的Instruction Tuning数据集,提升LLMs的价值导向能力。
Zhaohui Zeng, Florian Mai
Geo3R是一种无需训练的几何推理框架,有效缓解多模态大模型的空间推理幻觉,提升准确率超10%。
Mingyu Wang, Weilin Jin, Wenbo Li 等
提出Best-of-Evidence(BoE)框架,在部分验证条件下优化候选选择,提升模型表现。
Cenwei Zhang, Teng Fang, Yuxia Wang 等
研究采用DFT+U和HSE06集群扩展方法,揭示SrTiO3-xHx中阴离子长短程有序性,发现O4H2 cis构型的稳定性。
Tzu-chen Liu, Chris Wolverton
提出ViSTR-Bench,评估多模态大模型在动态场景中空间-时间推理能力,涵盖Motion Perception等四维任务。
Han Li, Si Liu, Zehao Huang 等
REFACT通过自适应事实重述提升长文本推理的可靠性与效率。
Zhensheng Jin, Xin Dai, Zhenghao Liu 等
SubSplat用SPGR在低分辨率输入下实现高分辨率3DGS,RealEstate10K达25.52dB。
Jiun Lee, Jaekwang Kim, Sangmin Lee
Robostral Navigate为单目RGB视觉模型,达77.4%成功率,突破多传感器限制。
Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra 等