AlphaEvolve: A coding agent for scientific and algorithmic discovery
AlphaEvolve利用演化算法结合大模型实现算法优化和科学发现,突破矩阵乘法等多领域难题。
Alexander Novikov, Ngân Vũ, Marvin Eisenberger 等
AlphaEvolve利用演化算法结合大模型实现算法优化和科学发现,突破矩阵乘法等多领域难题。
Alexander Novikov, Ngân Vũ, Marvin Eisenberger 等
通过添加平行数据显著提高LLM的多语言能力,尤其在翻译任务上。
Muhammad Reza Qorib, Junyi Li, Hwee Tou Ng
MIDI-RWKV模型实现可控符号音乐填充,提升音乐创作效率。
Christian Zhou-Zheng, Philippe Pasquier
ContextBench评估通过上下文修改激活特定潜在特征的算法,结合EPO增强实现平衡效果。
Robert Graham, Edward Stevinson, Leo Richter 等
KungfuBot采用物理基础全身控制,训练动态技能,误差显著低于现有方法,成功部署于Unitree G1机器人。
Weiji Xie, Jinrui Han, Jiakun Zheng 等
ERL-VLM通过绝对评分学习奖励函数,提升视觉语言模型反馈利用效率。
Tung Minh Luu, Younghwan Lee, Donghoon Lee 等
提出BumbleBee框架,通过行为聚类与模拟到现实迁移,实现 humanoid 机器人全身控制的泛化,达成最优性能。
Yuxuan Wang, Ming Yang, Ziluo Ding 等
使用s(CASP)实现目标导向常识推理,支持16+2可信AI需求。
Alexis R. Tudor, Yankai Zeng, Huaduo Wang 等
Konooz语料库覆盖16种阿拉伯方言和10个领域,揭示NER模型跨领域性能下降38%。
Nagham Hamad, Mohammed Khalilia, Mustafa Jarrar
提出MM-R5,结合强化学习的多模态推理增强重排序模型,显著提升文档检索性能。
Mingjun Xu, Jinhan Dong, Jue Hou 等
提出基于三平面的多摄像头标记策略,减少72% tokens,提升50%推理速度。
Boris Ivanovic, Cristiano Saltori, Yurong You 等
提出DAVID-XR1,结合细粒度缺陷标注与链式推理,实现可解释的AI生成视频检测,提升泛化能力。
Yifeng Gao, Yifan Ding, Hongyu Su 等
DeepResearch Bench提供100个博士级任务,评估深度研究代理的报告生成和信息检索能力。
Mingxuan Du, Benfeng Xu, Chiwei Zhu 等
结合SAM和双层遮挡模型,实现X光违禁品的高精度遮挡感知实例分割。
Yunhan Ren, Ruihuang Li, Lingbo Liu 等
提出QuadricFormer,基于超二次曲面实现高效3D场景占据预测,性能优于现有方法。
Sicheng Zuo, Wenzhao Zheng, Xiaoyong Han 等
SEAL框架使LLM通过自生成微调数据实现自适应,提升SQuAD准确率至47.0%。
Adam Zweiger, Jyothish Pari, Han Guo 等
VINCIE模型通过视频学习上下文图像编辑,取得多轮编辑基准的领先成绩。
Leigang Qu, Feng Cheng, Ziyan Yang 等
CreatiPoster通过多层协议模型生成可编辑的图形设计,结合背景合成实现高质量多样化输出。
Dexiang Hong, Zhao Zhang, Weidong Chen 等
VRBench评估长视频多步推理能力,包含960个视频和8,243个问答对。
Jiashuo Yu, Yue Wu, Meng Chu 等
VideoExplorer通过动态推理和时间定位实现长视频理解,显著优于现有方法。
Huaying Yuan, Zheng Liu, Junjie Zhou 等