DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents
提出DaMo,通过神经网络预测多模态大模型微调中的最优数据混合比例,提升性能3.38%。
Kai Shi, Jun Yang, Ni Yang 等
提出DaMo,通过神经网络预测多模态大模型微调中的最优数据混合比例,提升性能3.38%。
Kai Shi, Jun Yang, Ni Yang 等
使用NeRFs和3DGS进行4D表示生成和重建,提升动态场景理解。
Mingrui Zhao, Sauradip Nag, Kai Wang 等
结合视觉语言模型(VLM)进行网页截图与文本融合,提升线上购物行为模拟准确率超6%。
Yimeng Zhang, Jiri Gesi, Ran Xue 等
LightMem结合人类记忆模型,分三阶段优化长时记忆,提升效率与准确率。
Jizhan Fang, Xinle Deng, Haoming Xu 等
提出搜索自我对弈(SSP)方法,通过自我竞争与合作提升深度搜索代理能力,无需监督,显著优于基线。
Hongliang Lu, Yuhang Wen, Pengyu Cheng 等
提出基于概率风险指标的网络控制系统安全评估方法,量化攻击影响与资源。
Sribalaji C. Anand, Anh Tung Nguyen, André M. H. Teixeira 等
提出PROSPER框架,结合LLMs和残差网络提升产品搜索中的稀疏检索性能,达成10.2%召回提升。
Hongru Song, Yu-an Liu, Ruqing Zhang 等
提出COPPOL,将符合性预测融入语义分割,实现有限样本安全保证,提升危险区域检测6倍。
Daniel Bethell, Simos Gerasimou, Radu Calinescu 等
VFM-VAE利用冻结VFM作为编码器,设计新解码器提升图像重建,显著加速LDM训练,达到gFID 1.62。
Tianci Bi, Xiaoyi Zhang, Yan Lu 等
MAGDrop通过动量自适应梯度丢弃提高DNN泛化,MNIST达99.52%。
Adeel Safder
Glyph通过视觉-文本压缩实现长上下文扩展,达3-4倍压缩率,性能媲美Qwen3-8B。
Jiale Cheng, Yusen Liu, Xinyu Zhang 等
提出企业深度研究(EDR)框架,结合多智能体系统实现企业级自主研究,超越SOTA,性能优异。
Akshara Prabhakar, Roshan Ram, Zixiang Chen 等
FARE使用迭代拒绝采样SFT方法,在推理领域超越70B+评估器。
Austin Xu, Xuan-Phi Nguyen, Yilun Zhou 等
Eudoxia验证的LLM重复采样将FaaS调度吞吐量最高提升371.1%。
Jacopo Tagliabue
提出基于语境的伪标签评分框架,实现零样本视频摘要,F1达57.58(SumMe)
Yuanli Wu, Long Zhang, Yue Du 等
使用LLM驱动的工业代理实现复杂任务的自动化,提升生产力。
Yihong Tang, Kehai Chen, Liang Yue 等
ISE通过在线嵌入更新与失败计划拒绝,在Meta-World五任务、每任务400次试验中实现视频重规划。
Po-Chen Ko, Jiayuan Mao, Yu-Hsiang Fu 等
研究扩展PAC-Bayes框架到非紧对称性,提升模型泛化能力。
Armin Beck, Peter Ochs
提出StreamingThinker,实现LLMs边读边思,减少80%等待时间。
Junlong Tong, Yingqi Fan, Anhao Zhao 等
In-situ Autoguidance用同一模型+dropout自引导,ImageNet上50k图像FID 2.57。
Enhao Gu, Haolin Hou