排序: 最新 热门 引用
cs.CV 2605.21171

FTerViT: Fully Ternary Vision Transformer

FTerViT实现全三值化,包括所有权重和归一化参数,准确率82.43%,模型压缩达15倍。

Szymon Ruciński, Pietro Bonazzi, Engin Türetken 等

2026-05-20 41
cs.CV 2605.21061

Grounding Driving VLA via Inverse Kinematics

通过逆运动学重建驾驶视觉-语言模型(VLA),引入未来视觉状态预测与逆运动学网络,显著提升轨迹规划性能。

Junsung Park, Hyunjung Shim

2026-05-20 49