HardTests: Synthesizing High-Quality Test Cases for LLM Coding
提出HARDTESTGEN,利用LLMs合成高质量测试用例,提升代码验证的精确率11.3%、召回17.5%。
Zhongmou He, Yee Man Choi, Kexun Zhang 等
提出HARDTESTGEN,利用LLMs合成高质量测试用例,提升代码验证的精确率11.3%、召回17.5%。
Zhongmou He, Yee Man Choi, Kexun Zhang 等
提出UCerF指标,结合不确定性评估LLM公平性,数据集SynthBias提供多样性测试。
Yinong Oliver Wang, Nivedha Sivakumar, Falaah Arif Khan 等
InterMT通过人类反馈实现多轮次多模态偏好对齐,包含15.6k提示和52.6k对话实例。
Boyuan Chen, Donghai Hong, Jiaming Ji 等
ScaleLong通过多时间尺度问题设计,评估长视频理解能力,揭示U形性能曲线。
David Ma, Huaqing Yuan, Xingjian Wang 等
DeepTheorem利用自然语言和强化学习提升LLM的数学推理能力,包含121K非正式定理数据集。
Ziyin Zhang, Jiahao Xu, Zhiwei He 等
提出OWL框架,通过模块化设计实现跨域迁移,提升多智能体系统性能至69.70%,超越OpenAI Deep Research 2.34%。
Mengkang Hu, Yuhang Zhou, Wendong Fan 等
大块测试时训练(LaCT)提升长序列建模效率,最高处理1M上下文。
Tianyuan Zhang, Sai Bi, Yicong Hong 等
Table-R1通过推理痕迹蒸馏和可验证奖励强化学习提升表格推理性能,使用7B参数模型超越GPT-4.1。
Zheyuan Yang, Lyuhao Chen, Arman Cohan 等
SWE-bench-Live引入自动化管道,基于真实GitHub问题,涵盖93仓库,提升动态评估能力。
Linghao Zhang, Shilin He, Chaoyun Zhang 等
InfiMed采用反思增强的SFT和RLVR,提升低资源医学多模态模型性能,达7项基准SOTA。
Zeyu Liu, Zhitian Hou, Guanghao Zhu 等
提出GenCAD-Self-Repairing,通过扩散引导与自修复提升CAD生成的可行性,从10%提升至65%以上。
Chikaha Tsuji, Enrique Flores Medina, Harshit Gupta 等
MathArena基于新颖竞赛流,评估LLMs数学推理与证明能力,避免数据污染。
Mislav Balunović, Jasper Dekoninck, Ivo Petrov 等
TrackVLA为Embodied视觉跟踪提出统一VLA模型,训练集170万样本,显著优于SOTA。
Shaoan Wang, Jiazhao Zhang, Minghan Li 等
LODGE提出基于层级的3D高斯点云快速渲染方法,有效降低GPU内存和计算时间。
Jonas Kulhanek, Marie-Julie Rakotosaona, Fabian Manhardt 等
Infi-MMR采用三阶段课程式强化学习框架,提升MSLMs的多模态推理能力,MathVerse测试达43.68%。
Zeyu Liu, Yuhang Liu, Guanghao Zhu 等
提出K2VAE,结合KoopmanNet和KalmanNet实现长短期概率时间序列预测,显著优于SOTA。
Xingjian Wu, Xiangfei Qiu, Hongfan Gao 等
提出YAQA,基于Hessian结构的自适应量化算法,误差降低约30%。
Albert Tseng, Zhaofeng Sun, Christopher De Sa
WorkForceAgent-R1通过R1风格的强化学习提升LLM在网页导航中的推理能力,性能提升10.26-16.59%。
Yuchen Zhuang, Di Jin, Jiaao Chen 等
FAMA是首个大规模开源的英语和意大利语语音基础模型,速度提升8倍。
Sara Papi, Marco Gaido, Luisa Bentivogli 等
VScan通过双阶段剪枝策略显著提升大视觉-语言模型的推理速度,保持95.4%的性能。
Ce Zhang, Kaixin Ma, Tianqing Fang 等