Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
首篇高效VLA综述:四维分类,聚焦7B/55B到0.24B级压缩
Weifan Guan, Qinghao Hu, Aosheng Li 等
首篇高效VLA综述:四维分类,聚焦7B/55B到0.24B级压缩
Weifan Guan, Qinghao Hu, Aosheng Li 等
利用GPT-4o和Gemini 2.5 Flash进行可用性检测,AI表现优异但仍需人类补充。
Luis F. G. Campos, Leonardo C. Marques, Walter T. Nakamura
提出基于结构化多步推理和多模态系统的时间序列解释框架,强调信任与可解释性。
Kanghui Ning, Zijie Pan, Yushan Jiang 等
SAKE提出首个编辑大音频语言模型听觉属性知识的基准,揭示现有方法在可靠性和泛化性上的局限。
Chih-Kai Yang, Yen-Ting Piao, Tzu-Wen Hsu 等
研究发现,代码翻译中多示例提示会降低功能正确性,最佳示例数为5-25。
Amirkia Rafiei Oskooei, Kaan Baturalp Cosdan, Husamettin Isiktas 等
提出SkipV1Former,通过跳跃连接第一层Value头,降低25% KV缓存同时提升模型表现。
Zhoutong Wu, Yuan Zhang, Yiming Dong 等
提出非交错布局LAC,优化生成推荐中的动作-物品耦合,提升效率与准确性。
Xiaokai Wei, Jiajun Wu, Daiyao Yi 等
使用大型语言模型生成优化算法,平均性能提升72.4%。
Floris-Jan Willemsen, Niki van Stein, Ben van Werkhoven
基于强化学习的智能搜索系统,优化策略提升检索效率和准确率。
Minhua Lin, Zongyu Wu, Zhichao Xu 等
基于背包问题的自动代理组合框架,通过动态测试优化组件选择,提升成功率与成本效率。
Michelle Yuan, Khushbu Pahwa, Shuaichen Chang 等
提出NP-ENGINE框架,结合实例生成、规则验证与启发式求解,提升LLMs的NP-hard优化推理能力。
Xiaozhe Li, Xinyu Fang, Shengyuan Ding 等
提出基于反馈的 conformal prediction(Fb-CP)框架,结合轨迹优化中的风险调整,确保安全且性能提升。
Han Wang, Chao Ning
提出一种基于程序搜索的无LLM错误修正方法,利用程序描述语言实现开放场景布局生成。
Maxim Gumin, Do Heon Han, Seung Jean Yoo 等
VISTA通过多智能体自我优化,提升视频生成质量,达60%胜率。
Do Xuan Long, Xingchen Wan, Hootan Nakhost 等
Chronos-2为多场景时间序列预测设计的预训练模型,支持单变量、多变量及协变量信息,采用组注意力实现零-shot推断。
Abdul Fatir Ansari, Oleksandr Shchur, Jaris Küken 等
提出Critic-LLM-RS,结合协同过滤与预训练大模型提升推荐效果。
Zhisheng Yang, Xiaofei Xu, Ke Deng 等
XModBench评估Gemini 2.5 Pro模型的跨模态一致性,发现其在空间和时间推理上准确率不足60%。
Xingrui Wang, Jiang Liu, Chao Huang 等
DLER通过批量归一化和动态采样优化RL,显著提升模型在长度惩罚下的准确率与效率。
Shih-Yang Liu, Xin Dong, Ximing Lu 等
提出SPA框架,通过自我对弈微调内化世界模型,显著提升OOD环境中的RL表现。
Shiqi Chen, Tongyao Zhu, Zian Wang 等
提出基于原理的原生视觉-语言模型NEO,利用390M图文样本实现像素与词汇的高效对齐,突破模块化模型限制。
Haiwen Diao, Mingxuan Li, Silei Wu 等