Dziri Voicebot: An End-to-End Low-Resource Speech-to-Speech Conversational System for Algerian Dialect
本研究提出基于Whisper模型的低资源阿尔及利亚方言端到端语音对话系统,涵盖ASR、NLU、RAG和TTS,关键指标包括13.74%的词错误率。
Dihia Lanasri, Fairouz Taki, Asma Kemmoum
本研究提出基于Whisper模型的低资源阿尔及利亚方言端到端语音对话系统,涵盖ASR、NLU、RAG和TTS,关键指标包括13.74%的词错误率。
Dihia Lanasri, Fairouz Taki, Asma Kemmoum
Autodata通过元优化训练的代理数据科学家生成高质量合成数据,显著提升模型性能。
Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu 等
提出反向知识蒸馏框架KCas,用学生模型引导复杂教师模型,显著降低非参数多元函数估计计算成本。
Luyang Fang, Haoran Lu, Yongkai Chen 等
本研究评估17种深度模型在大规模代码检索中的召回效果,提出LLM正则化与重写策略提升精度。
Leonardo Venuta, Francesco Tosoni, Paolo Ferragina
UniTeD提出联合时间扩散模型,实现感知与规划的端到端融合,显著提升鲁棒性。
Bo Zhao, Xinting Zhao, Naifan Li 等
提出SSMNBench,基于单视角充分性与多视角必要性诊断多模态大语言模型的跨视角理解能力。
Tianchen Guo, Chen Liu, Ling Chen 等
LCG利用稀疏关系注意力生成长上下文一致图像,提升一致性和可扩展性。
Zihao Wang, Yijia Xu, Haoze Zheng 等
ScaleHP通过显式实例尺度优化相机空间手势估计误差,FreiHand数据集CS-MPJPE达35.8mm。
Ruitao Jing, Xingyu Chen, Hongyang Li 等
提出VPA-Guard,结合检索增强与自我演化,有效防御视觉提示攻击,降低攻击成功率44.2%。
Yining Sun, Haoyu Kang, Jiajun Wu 等
提出BLOCK方法,通过替换模型瓶颈层实现对SD3.5等前沿生成模型的概念去除,效果优异。
Aditya Kumar, Pierre Joly, Adam Dziedzic 等
ASSCG通过RWKV骨干实现快慢系统自适应门控,在nuPlan Hard20上提升2.28分并减少60%延迟。
Sining Ang, Yuan Chen, Liu Haiyan 等
C3-Bench构建了涵盖51个真实场景的多域变化描述基准,结合LLM评估实现细粒度性能分析。
Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim
提出Teach-to-Reason(T2R)框架,通过自我竞争教师和对比监督提升胸部X光VQA中的推理质量。
Xiao Han, Hao Liu, Zhimin Bao 等
提出Hybrid-IR,结合图结构和密集检索,利用迭代推理提升复杂医学问答准确率,达成10%提升。
Sheng Wan, Jiahui Zhang, Zicheng Zhao 等
MM-R2框架在多模态RAG中通过先推理后检索提升准确率。
Tianyu Yang, Shir Simon, Zhenzhen Li 等
EvoFlock利用遗传算法实现多智能体运动模型的逆向设计,优化15个参数以满足多目标行为指标。
Craig Reynolds
提出ASAP,结合多样优化器池与系统协同设计,实现基于墙时钟的自动超参数调优。
Taicheng Guo, Haomin Zhuang, Kehan Guo 等
RAVEN利用视觉嵌入作为长时记忆,实现机器人长距离推理与导航。
Yixun Hu, Zhicheng Zheng, Lihan Zha 等
提出基于中间层熵动态的无训练检测方法,利用中间层轨迹特征区分越狱提示,效果在Llama、Qwen、Gemma模型中均优异。
Sofiia Nikolenko, Michele Papucci, Mina Rezaei 等
TRUSTMEM通过记忆转换验证器提升LLM代理的记忆整合可信度,提升HaluMem提取12.14 F1点。
Tianyu Yang, Sudipta Paul, Vijay Srinivasan 等