cs.LG 2501.06059

COMIX: Compositional Explanations using Prototypes

COMIX method explains ML model decisions by decomposing images into prototypes, achieving a 48.82% improvement in C-insertion score.

Sarath Sivaprasad, Dmitry Kangin, Plamen Angelov et al.

2025-01-10 44
cs.CV 2501.05874

VideoRAG: Retrieval-Augmented Generation over Video Corpus

VideoRAG leverages LVLM for dynamic video retrieval and multimodal response generation, outperforming baselines with significant improvements in ROUGE-L and BLEU scores.

Soyeong Jeong, Kangsan Kim, Jinheon Baek et al.

2025-01-10 37
cs.CL 2501.04686

Unlocking Multimodal Mathematical Reasoning via Process Reward Model

Introduces URSA framework with large-scale datasets MMathCoT-1M and DualMath-1.1M, combined with PS-GRPO algorithm, significantly enhancing multimodal mathematical reasoning, outperforming GPT-4o by 8.4%.

Ruilin Luo, Zhuofan Zheng, Yifan Wang et al.

2025-01-09 36 citations 36
cs.CL 2501.06246

A Partition Cover Approach to Tokenization

Partition cover-based tokenization algorithm GREEDTOK outperforms BPE and Unigram, achieving ~3% better compression on real-world corpora and lower bits per byte in large-scale pretraining.

Jia Peng Lim, Shawn Tan, Davin Choo et al.

2025-01-09 6 citations 43