A Survey on Efficient Vision-Language-Action Models
提出资源高效的VLAs设计框架,包括模型压缩、训练优化与数据采集,显著降低计算成本。
Zhaoshu Yu, Bo Wang, Pengpeng Zeng 等
提出资源高效的VLAs设计框架,包括模型压缩、训练优化与数据采集,显著降低计算成本。
Zhaoshu Yu, Bo Wang, Pengpeng Zeng 等
提出Video-Thinker,结合grounding与captioning,通过强化学习实现视频推理,显著优于基线模型。
Shijian Wang, Jiarui Jin, Xingjian Wang 等
提出max@k梯度估计,优化强化学习中的Best-of-N采样,提升编码任务性能。
Farid Bagirov, Mikhail Arkhipov, Ksenia Sycheva 等
提出结合扩散策略与多尺度世界模型的深度主动推理框架,提升机器人探索与导航能力。
Riko Yokozawa, Kentaro Fujii, Yuta Nomura 等
提出TIR-Judge,通过工具集成强化学习提升LLM评判性能,超越多项基准。
Ran Xu, Jingjing Chen, Jiayu Ye 等
EchoMind提出多层基准测试,评估SLM在语音内容理解、声学线索感知、推理与同理心对话生成中的表现。
Li Zhou, Lutong Yu, You Lyu 等
E2Rank通过在单一文本嵌入模型上继续训练,实现高效的检索与列表重排序,显著提升性能与效率。
Qi Liu, Yanzhao Zhang, Mingxin Li 等
层剪枝影响LLM推理能力,尤其是长链推理。
Keyu Wang, Tian Lyu, Guinan Su 等
提出Huxley-Gödel机器,通过估算CMP实现人类水平的自我改进编码代理。
Wenyi Wang, Piotr Piękos, Li Nanbo 等
FlexIO结合prompt向量实现多麦克风、多说话人灵活分离,性能优异。
Yoshiki Masuyama, Kohei Saijo, Francesco Paissan 等
提出String Seed of Thought(SSoT)提升LLMs在分布一致性和多样性生成中的表现。
Kou Misaki, Takuya Akiba
SIREN、MFN-Gabor与MHE将血流场压缩约230倍,压力误差约1 mmHg,解剖误差低于1.6 mm。
Jubilee Lee, Daniele E. Schiavazzi
提出ColMAD,通过合作机制提升多智能体辩论的真实性与信息量,错误检测性能提升10%。
Yongqiang Chen, Gang Niu, James Cheng 等
HoloCine通过窗口交叉注意力和稀疏跨镜头自注意力实现多镜头长视频的全局一致性,显著提升叙事连贯性。
Yihao Meng, Hao Ouyang, Yue Yu 等
提出Open-o3-Video,结合显式时空证据实现视频推理,构建高质量数据集STGR,提升模型性能14.4% mAM。
Jiahao Meng, Xiangtai Li, Haochen Wang 等
UI-Ins通过多视角指令推理提升GUI定位,UI-I2E-Bench上达87.3%。
Liangyu Chen, Hanzhang Zhou, Chenglin Cai 等
提出GEMs,通过多样架构和高质量语料,提升希腊语NLP性能,准确率提升达3.6%。
Alexandra Apostolopoulou, Konstantinos Kanaris, Athanasios Koursaris 等
提出WorldTest协议,通过环境级查询评估AI模型的通用性,实验表明人类表现优于AI。
Archana Warrier, Dat Nguyen, Michelangelo Naim 等
SEMPO为时间序列预测设计的轻量级基础模型,结合能量感知频谱分解与提示混合Transformer。
Hui He, Kun Yi, Yuanchi Ma 等
温度采样以τ=1→5的余弦升温重平衡机器人数据,在Libero整体成功率达0.85。
Basavasagar Patil, Sydney Belt, Jayjun Lee 等