EmbeddingGemma: Powerful and Lightweight Text Representations
EmbeddingGemma为轻量级文本嵌入模型,参数300M,超越同类模型性能,适合低延迟场景。
Henrique Schechter Vera, Sahil Dua, Biao Zhang 等
EmbeddingGemma为轻量级文本嵌入模型,参数300M,超越同类模型性能,适合低延迟场景。
Henrique Schechter Vera, Sahil Dua, Biao Zhang 等
提出LLM-Filter,利用预训练大模型进行状态估计,显著优于传统方法。
Shiqi Liu, Wenhan Cao, Chang Liu 等
联邦学习中贡献分数计算易受架构和攻击影响,需更稳健方法。
Balazs Pejo, Marcell Frank, Krisztian Varga 等
GUIDE框架结合全局图推理与扩散决策,探索效率提升18.3%,冗余动作减少34.9%。
Zijun Che, Yinghong Zhang, Shengyi Liang 等
提出在线优化的RAG框架,通过实时反馈调整工具嵌入,显著提升工具选择准确率。
Yu Pan, Xiaocheng Li, Hanzhao Wang
EgoBridge通过域适应提升机器人模仿学习成功率44%。
Ryan Punamiya, Dhruv Patel, Patcharapong Aphiwetsa 等
提出Terra:结合地形感知的层级3D场景图,用于大规模户外自主映射。
Chad R. Samuelson, Abigail Austin, Seth Knoop 等
BiGraspFormer是一种端到端变换器框架,直接从点云生成协调双臂抓取,显著提升成功率和速度。
Kangmin Kim, Seunghyeok Back, Geonhyup Lee 等
提出LoRD和B-LoRD模型,基于核k-means的低秩双随机图聚类方法,提升性能。
Wenlong Lyu, Yuheng Jia, Hui Liu 等
提出一种基于不平衡最优传输的模拟与真实联合训练框架,在真实场景中提升30%成功率。
Shuo Cheng, Liqian Ma, Zhenyang Chen 等
APRIL通过超额请求和回收部分响应,提升RL训练中的推理效率,平均提升22.5%。
Yuzhen Zhou, Jiajun Li, Yusheng Su 等
GD2P通过几何感知生成灵巧手的非抓取推拉动作,提升操控效率。
Yunshuang Li, Yiyang Ling, Gaurav S. Sukhatme 等
LAD-VF利用形式验证反馈进行提示优化,无需微调,显著提升机器人规划合规性。
Yunhao Yang, Junyuan Hong, Gabriel Jacob Perin 等
UniPixel结合像素级感知与视觉理解,支持多任务像素推理,达成10项基准优异表现。
Ye Liu, Zongyang Ma, Junfu Pu 等
TempSamp-R1通过强化学习微调提升视频时序定位,显著提高精度。
Yunheng Li, Jing Cheng, Shaoyong Jia 等
现代视频LLM需要听吗?通过LLaVA-OneVision,音频编码器提升了跨模态推理能力。
Geewook Kim, Minjoon Seo
提出MLLM-CD框架,结合对比因子发现和迭代反事实推理,实现多模态因果关系揭示。
Jin Li, Shoujin Wang, Qi Zhang 等
Qwen3-Omni采用Thinker-Talker MoE架构,实现多模态(文本、图像、音频、视频)零性能损失的SOTA表现。
Jin Xu, Zhifang Guo, Hangrui Hu 等
SD-VLM通过MSMU数据集和深度位置编码提升VLM的空间理解能力,超越GPT-4o和Intern-VL3-78B。
Pingyi Chen, Yujing Lou, Shen Cao 等
DIWALI构建了涵盖印度17个文化面向的8,817个文化概念数据集,用于评估大语言模型的文化适应能力,采用自动与人工评估相结合的方法。
Pramit Sahoo, Maharaj Brahma, Maunendra Sankar Desarkar