RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework
RAD-2 scales reinforcement learning in autonomous driving, reducing collision rate by 56% using a generator-discriminator framework.
Hao Gao, Shaoyu Chen, Yifan Zhu et al.
RAD-2 scales reinforcement learning in autonomous driving, reducing collision rate by 56% using a generator-discriminator framework.
Hao Gao, Shaoyu Chen, Yifan Zhu et al.
The study shows language models exhibit strong spatial transfer in shortest path problems but fail in length scaling due to recursive instability.
Yao Tong, Jiayuan Ye, Anastasia Borovykh et al.
Diagnosing LLM judge reliability using transitivity analysis and conformal prediction sets, revealing 33%-67% documents with at least one 3-cycle.
Manan Gupta, Dhruv Kumar
Muon optimizer outperforms AdamW in MLP-based tabular deep learning, recommended if training efficiency is acceptable.
Yury Gorishniy, Ivan Rubachev, Dmitrii Feoktistov et al.
Study reveals LLMs and VLMs struggle with viewpoint rotation understanding without vision, proposes VRUBench dataset, and improves performance via selective fine-tuning.
Zhen Yang, Ping Jian, Zhongbin Guo et al.
ASTRA method achieves successful policy transfer from abstract simulators to the real world using self-predictive abstraction.
Yunfu Deng, Yuhao Li, Josiah P. Hanna
Structural interpretability in SVMs using truncated orthogonal polynomial kernels reveals model complexity.
Víctor Soto-Larrosa, Nuria Torrado, Edmundo J. Huertas
Proposes a multi-stage context enrichment strategy to improve vision-language models' performance in human emotion recognition.
Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara et al.
Prism uses sGraph for symbolic superoptimization of tensor programs, achieving up to 2.2x speedup.
Mengdi Wu, Xiaoyu Jiang, Oded Padon et al.
SegWithU models uncertainty as perturbation energy for single-forward-pass risk-aware medical image segmentation.
Tianhao Fu, Austin Wang, Charles Chen et al.
Analyzes stability and generalization of looped transformers using a fixed-point framework, validated on chess, sudoku, and prefix-sum tasks.
Asher Labovich
SpecGuard enhances multi-step reasoning efficiency and accuracy using internal signals for step-level verification.
Kiran Purohit, Ramasuri Narayanam, Soumyabrata Pal
Proposed a vision-based human-robot collaboration framework combining uncertainty estimation and OOD detection, significantly enhancing safety.
Jakob Thumm, Marian Frei, Tianle Ni et al.
HiST-AT achieves a 59% success rate in robotic imitation learning using a hierarchical spatiotemporal action tokenizer.
Fawad Javed Fateh, Ali Shah Ali, Murad Popattia et al.
Introduces IRS framework, enhancing multimodal humor understanding with incongruity-resolution supervision, 72B model approaches expert level on NYCC.
Hatice Merve Vural, Doga Kukul, Ege Erdem Ozlu et al.
MADE benchmark enhances multi-label text classification accuracy with uncertainty quantification, especially in medical device adverse events.
Raunak Agarwal, Markus Wenzel, Simon Baur et al.
Policy-Guided Hybrid Simulation (PGHS) achieves 8.80% group simulation error on Meituan, improving over baselines by 45.8% and 40.9%.
Ziyang Chen, Renbing Chen, Daowei Li et al.
Proposed dual pose-graph semantic localization reduces ATE by 56% to 74% on TII-RATM dataset.
David Perez-Saura, Miguel Fernandez-Cortizas, Alvaro J. Gaona et al.
LLMs generate excessive content in translations; detection strategies improve translation quality.
Lisa Vasileva, Karin Sim
Simulating mouse cortical neurogenesis generates a minimal circuit of 85 neurons, achieving over 90% accuracy on MNIST after one training epoch.
Duan Zhou