SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs
SWE-Synth利用LLM模拟调试流程,合成可验证的高质量修复数据,提升开源模型性能。
Minh V. T. Pham, Huy N. Phan, Hoang N. Phan 等
SWE-Synth利用LLM模拟调试流程,合成可验证的高质量修复数据,提升开源模型性能。
Minh V. T. Pham, Huy N. Phan, Hoang N. Phan 等
提出OmniV-Med,融合多模态医学视觉-语言模型,处理14种影像模态和11项临床任务,采用旋转位置编码和令牌剪枝,达成多任务SOTA。
Songtao Jiang, Yuan Wang, Sibo Song 等
提出RoboOcc,利用OSE与GCE提升3D占据预测的几何与语义理解,显著优于SOTA。
Zhang Zhang, Qiang Zhang, Wei Cui 等
提出AIOS服务器实现去中心化AgentSite网络,支持大规模点对点通信与发现。
Xiang Zhang, Yongfeng Zhang
本研究批判性分析RLVR在LLMs中的推理能力提升,发现其未能引入新颖推理路径。
Yang Yue, Zhiqi Chen, Rui Lu 等
提出CheXWorld,基于自监督的放射影像世界模型,捕获局部结构、全局布局与域变异,显著提升多任务表现。
Yang Yue, Yulin Wang, Chenxin Tao 等
CodeVisionary通过多维上下文蒸馏和多评审协商实现复杂代码生成的全面评估。
Xinchen Wang, Pengfei Gao, Chao Peng 等
构建开源的PerceptionLM模型,利用2.8M人类标注视频问答和空间-时间字幕,推动透明视觉理解研究。
Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi 等
基于注意偏差的关联记忆框架Miras,结合多种记忆结构和优化算法,提升序列模型性能。
Ali Behrouz, Meisam Razaviyayn, Peilin Zhong 等
引入睡眠时间计算,通过预计算减少测试时间计算需求,实现准确率提升。
Kevin Lin, Charlie Snell, Yu Wang 等
深度神经网络在表格数据表示学习中表现出色,提升了分类和回归任务的准确性。
Jun-Peng Jiang, Si-Yang Liu, Hao-Run Cai 等
Nemotron-CLIMB通过嵌入和迭代优化数据混合,提升大规模语言模型预训练性能。
Shizhe Diao, Yu Yang, Yonggan Fu 等
提出Uni-Inv与Uni-Edit,基于流模型实现高精度逆向与区域编辑。
Guanlong Jiao, Biqing Huang, Kuan-Chieh Wang 等
研究通过分析AI安全合作的技术风险,建议在验证机制和协议领域开展国际合作。
Ben Bucknall, Saad Siddiqui, Lara Thurnherr 等
MLRBench评估LLM在多语言长文本推理中的表现,揭示资源差距。
Amey Hengle, Prasoon Bajpai, Soham Dan 等
Persona-judge通过令模型自我判断实现个性化对齐,提升了98%的对齐效率。
Xiaotian Zhang, Ruizhe Chen, Yang Feng 等
提出ForgetMe数据集和Entangled评估指标,基于Prompt层级编辑实现Diffusion模型的选择性遗忘。
Zhenyu Yu, Mohd Yamani Inda Idris, Pei Wang
提出衡量LLM生成内容的有效语义多样性框架,揭示偏好调优模型在质量与多样性间的权衡。
Alexander Shypula, Shuo Li, Botong Zhang 等
BrowseComp是衡量AI持续浏览网页搜寻难解信息的挑战性基准,包含1266题,强调持久性与创造性。
Jason Wei, Zhiqing Sun, Spencer Papay 等
RLHF通过偏好模型优化,提升语言模型的风格和安全性,关键算法包括PPO和偏好损失。
Nathan Lambert