Sailor2: Sailing in South-East Asia with Inclusive Multilingual LLMs
Sailor2模型在东南亚语言上实现50-50胜率,支持13种语言。
Longxu Dou, Qian Liu, Fan Zhou 等
Sailor2模型在东南亚语言上实现50-50胜率,支持13种语言。
Longxu Dou, Qian Liu, Fan Zhou 等
提出Riemannian Gaussian Variational Flow Matching(RG-VFM),在流形上实现几何一致的生成模型,提升蛋白质和材料设计性能。
Olga Zaghen, Floor Eijkelboom, Alison Pouplin 等
提出MeCo,通过元认知信号自适应调控大模型工具调用,显著提升效率与准确性。
Wenjun Li, Dexun Li, Kuicai Dong 等
提出ArabCulture数据集,评估阿拉伯文化常识推理,32B参数模型表现不佳。
Abdelrahman Sadallah, Junior Cedric Tonga, Khalid Almubarak 等
IREGB在随机序先验下以O(K log K)实现渐近最优MIR探索。
Gal Bahar, Omer Ben-Porat, Kevin Leyton-Brown 等
扩展V模型以支持AI复杂系统开发,实现自动驾驶中30%的安全性提升。
Lars Ullrich, Michael Buchholz, Klaus Dietmayer 等
基于大规模语言模型(LLM)模拟代理的UX测试框架UXAgent,通过自动生成模拟用户进行网页交互,提供定性与定量数据支持设计迭代。
Yuxuan Lu, Bingsheng Yao, Hansu Gu 等
提出YOLOv12,结合注意力机制与高效架构,实现40.6% mAP,速度1.64ms,优于YOLOv10/11。
Yunjie Tian, Qixiang Ye, David Doermann
该研究综述了视频到音乐生成技术,重点在于条件输入构建、条件机制和音乐生成框架。
Shulei Ji, Songruoyao Wu, Zihao Wang 等
提出一种独立性检验方法,能有效识别语言模型是否独立训练,p值精确。
Sally Zhu, Ahmed Ahmed, Rohith Kuditipudi 等
提出SWE-Lancer基准,涵盖1400余真实自由职业软件任务,模型表现仍远未达成百万美元目标。
Samuel Miserendino, Michele Wang, Tejal Patwardhan 等
提出UTR框架,解决视频MLLM的时间黑客问题,提高视频理解能力。
En Yu, Kangheng Lin, Liang Zhao 等
本研究评估LLMs在真实数学定义自动形式化中的表现,提出Def_Wiki和Def_ArXiv数据集,结合外部反馈和定义基础策略提升性能。
Lan Zhang, Marco Valentino, Andre Freitas
探讨神经网络扩展的缩放法则,揭示模型大小与性能的关系。
Ayan Sengupta, Yash Goel, Tanmoy Chakraborty
提出基于转移性任务嵌入的超网络框架,有效捕获任务关系,提升连续学习性能。
Yanru Wu, Jianning Wang, Xiangyu Chen 等
提出DualIPW模型,结合查询级与位置级点击倾向估计,缓解相关偏差。
Lulu Yu, Keping Bi, Jiafeng Guo 等
OctoTools是一种无需训练、多智能体的复杂推理框架,显著提升16项任务准确率9.3%。
Pan Lu, Bowen Chen, Sheng Liu 等
LLM在医学中应用广泛,但仍需解决幻觉管理和多模态集成等问题。
Wenxuan Wang, Zizhan Ma, Zheng Wang 等
TituLLMs为孟加拉语设计的首个大规模预训练模型,包含1B和3B参数,基于扩展的Llama-3.2 tokenizer,采用37亿标记数据,显著优于多语种版本。
Shahriar Kabir Nahin, Rabindra Nath Nandi, Sagor Sarker 等
CMCTS框架通过约束动作空间提升LLM数学推理能力,7B模型准确率83.4%。
Qingwen Lin, Boyan Xu, Guimin Hu 等