OSCAR: One-Step Diffusion Codec Across Multiple Bit-rates
OSCAR introduces a one-step diffusion codec supporting multiple bit-rates, significantly improving efficiency and quality.
Jinpei Guo, Yifei Ji, Zheng Chen et al.
OSCAR introduces a one-step diffusion codec supporting multiple bit-rates, significantly improving efficiency and quality.
Jinpei Guo, Yifei Ji, Zheng Chen et al.
Introduces Visual CounterFact dataset and PvP activation mechanism, achieving 99.3% shift from priors to counterfactuals in color predictions.
Michal Golovanevsky, William Rudman, Michael Lepori et al.
Proposed causal LLM routing framework minimizes decision regret from observational data, outperforming existing baselines.
Asterios Tsiourvas, Wei Sun, Georgia Perakis
Introduces pixel-space reasoning with curiosity-driven RL, achieving 84% accuracy on V* benchmark with a 7B model, surpassing existing open-source models.
Haozhe Wang, Alex Su, Weiming Ren et al.
Proposed taxonomy for LALM evaluation covering auditory processing, reasoning, dialogue, and fairness.
Chih-Kai Yang, Neo S. Ho, Hung-yi Lee
GUI-G1 employs improved RL strategies and reward design, achieving 90.3% accuracy on 17K samples, surpassing similar-sized models.
Yuqi Zhou, Sunhao Dai, Shuai Wang et al.
STAR-R1 enhances spatial reasoning in multimodal LLMs using reinforcement learning, achieving a 23% improvement in cross-view scenarios.
Zongzhao Li, Zongyang Ma, Mingze Li et al.
Soft Thinking generates continuous concept tokens, boosting accuracy by 2.48% and reducing tokens by 22.4% without training.
Zhen Zhang, Xuehai He, Weixiang Yan et al.
LLMs and EC combined for algorithm design, enhancing decision-making.
Dikshit Chauhan, Bapi Dutta, Indu Bala et al.
Moonbeam model combines absolute and relative music attributes to enhance MIDI music generation and understanding.
Zixun Guo, Simon Dixon
Hunyuan-TurboS combines Mamba-Transformer with adaptive chain-of-thought, 560B parameters, achieving top-tier performance.
Tencent Hunyuan Team, Ao Liu, Botong Zhou et al.
REMS framework models COP as resource-task assignment, enabling versatile metaheuristic algorithms; outperforms GUROBI, SCIP, OR-TOOLS on large/complex instances.
Aijuan Song, Guohua Wu
Using physics-related activation functions in neural networks significantly improves nuclear mass extrapolation, reducing RMS error to 328 keV.
C. H. Kim, K. Y. Chae, M. S. Smith
Efficiently scaling diffusion Transformers via $μ$P, PixArt-$α$ surpasses baseline at 0.61B parameters.
Chenyu Zheng, Xinyu Zhang, Rongzhen Wang et al.
BanglaByT5 is the first byte-level model for Bangla, outperforming multilingual models.
Pramit Bhattacharyya, Arnab Bhattacharya
Utilizing PMP for explainable sarcasm detection in Australian and Indian English, achieving significant performance improvements.
Ishmanbir Singh, Dipankar Srirag, Aditya Joshi
Benchmark for financial agents; top model accuracy 46.8%; evaluated on SEC filings with tool support.
Antoine Bigeard, Langston Nashold, Rayan Krishnan et al.
This work introduces a low-dimensional subspace analysis to explain out-of-distribution generalization in in-context learning, showing task diversity enhances robustness.
Soo Min Kwon, Alec S. Xu, Can Yaras et al.
BAGEL employs large-scale interleaved multimodal pretraining with Mixture-of-Transformers, achieving emergent reasoning capabilities surpassing open-source models.
Chaorui Deng, Deyao Zhu, Kunchang Li et al.
CAD-Coder, an open-source VLM based on LLaVA fine-tuned for direct CAD code generation, achieves 100% syntax validity and high geometric accuracy.
Anna C. Doris, Md Ferdous Alam, Amin Heyrani Nobari et al.