Advancing Arabic Speech Recognition Through Large-Scale Weakly Supervised Learning
利用Conformer架构和弱监督学习,训练出超越现有模型的阿拉伯语语音识别系统。
Mahmoud Salhab, Marwan Elghitany, Shameed Sait 等
利用Conformer架构和弱监督学习,训练出超越现有模型的阿拉伯语语音识别系统。
Mahmoud Salhab, Marwan Elghitany, Shameed Sait 等
WebRollback通过显式回滚机制提升网页代理性能,在Mind2Web-Live和WebVoyager基准上表现优异。
Zhisong Zhang, Tianqing Fang, Kaixin Ma 等
提出闭包原理与e-Benjamini-Hochberg(eBH)改进,显著提升FDR控制能力。
Ziyu Xu, Lasse Fischer, Aaditya Ramdas
AskQE利用问答框架检测机器翻译关键错误,基于ContraTICO和BioMQM数据集,采用LLaMA-3 70B模型实现高相关性评估。
Dayeon Ki, Kevin Duh, Marine Carpuat
提出DeepMath-103K,含高难度题目、去污染和可验证答案,推动推理能力提升。
Zhiwei He, Tian Liang, Jiahao Xu 等
PartField是一种无需预定义模板的3D特征学习方法,提升了20%的准确率。
Minghua Liu, Mikaela Angelina Uy, Donglai Xiang 等
TRELAWNEY重排训练序列,在星图上将NTP准确率从0.05提升至1.00。
Abitha Thankaraj, Yiding Jiang, J. Zico Kolter 等
提出基于Wasserstein重心的协作贝叶斯优化框架,有效保护数据隐私。
Donglin Zhan, Haoting Zhang, Rhonda Righter 等
提出能量匹配框架,将流匹配与能量模型结合,显著提升CIFAR-10和ImageNet生成质量。
Michal Balcerak, Tamaz Amiranashvili, Antonio Terpin 等
GUI-R1利用规则强化学习提升多平台GUI任务理解,数据仅用3K,优于SOTA。
Run Luo, Lu Wang, Wanwei He 等
提出LLM-SRBench,包含239题,评估LLMs科学方程发现能力,挑战模型超越记忆。
Parshin Shojaee, Ngoc-Hieu Nguyen, Kazem Meidani 等
提出文化本地化基准,发现显式提示显著提升文化响应,但带来刻板化,利用激活调控实现跨语言文化引导。
Veniamin Veselovsky, Berke Argin, Benedikt Stroebl 等
SocioVerse利用LLM代理和1000万真实用户数据,构建多场景社会模拟模型,准确反映大规模人口动态。
Xinnong Zhang, Jiayu Lin, Xinyi Mou 等
引入SegEarth-R1,基于大语言模型的遥感像素推理,显著优于传统方法。
Kaiyu Li, Zepeng Xin, Li Pang 等
提出SIFT-50M数据集(5000万样本)用于多语种语音指令微调,超越现有模型。
Prabhat Pandey, Rupak Vignesh Swaminathan, K V Vijay Girish 等
GigaTok通过语义正则化将视觉标记器扩展至30亿参数,解决重建与生成的矛盾,提升图像生成质量。
Tianwei Xiong, Jun Hao Liew, Zilong Huang 等
KARMMA框架在缺失模态下实现稳健的自我动作识别,减少50%计算资源。
Maria Santos-Villafranca, Dustin Carrión-Ojeda, Alejandro Perez-Yus 等
提出多类别语音语言模型(SLMs),涵盖纯语音、语音+文本及语音感知文本模型,推动普适语音处理。
Siddhant Arora, Kai-Wei Chang, Chung-Ming Chien 等
提出混合AI路由器的超级智能体系统,结合本地与云模型实现高效任务调度。
Yuhang Yao, Haixin Wang, Yibo Chen 等
引入基于代理树搜索的AI科学家-v2系统,实现全自主生成、同行评审通过的科研论文,显著提升科研自动化水平。
Yutaro Yamada, Robert Tjarko Lange, Cong Lu 等