cs.CV 2601.05083

Driving on Registers

DrivoR uses pretrained ViT and register tokens to compress multi-camera features, enabling efficient end-to-end autonomous driving with superior performance.

Ellington Kirby, Alexandre Boulch, Yihong Xu et al.

2026-01-09 57
cs.CV 2601.03233

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2 employs an asymmetric dual-stream Transformer with 14B (video) and 5B (audio) parameters, integrating cross-modal attention for synchronized audiovisual generation.

Yoav HaCohen, Benny Brazowski, Nisan Chiprut et al.

2026-01-07 168 citations 33