cs.CV 2307.04087

SVIT: Scaling up Visual Instruction Tuning

SVIT introduces a 4.2M high-quality visual instruction dataset, significantly outperforming state-of-the-art multimodal models.

Bo Zhao, Boya Wu, Muyang He et al.

2023-07-09 44
cs.CL 2307.02982

Efficient Semiring-Weighted Earley Parsing

Proposes a semiring-weighted Earley parser with complexity reduced to O(N³|G|), enabling efficient large-scale grammar parsing.

Andreas Opedal, Ran Zmigrod, Tim Vieira et al.

2023-07-06 63
cs.NE 2307.01694

Spike-driven Transformer

Spike-driven Transformer combines SNN and Transformer, achieving 77.1% accuracy on ImageNet-1K.

Man Yao, Jiakui Hu, Zhaokun Zhou et al.

2023-07-04 11