LTX-2: Efficient Joint Audio-Visual Foundation Model
LTX-2 employs an asymmetric dual-stream Transformer with 14B (video) and 5B (audio) parameters, integrating cross-modal attention for synchronized audiovisual generation.
Yoav HaCohen, Benny Brazowski, Nisan Chiprut et al.