cs.LG 2510.26491

Data-Efficient RLVR via Off-Policy Influence Guidance

Using influence functions with off-policy estimation and sparse projection, CROPI accelerates large-scale RLVR training by 2.66× with only 10% data per stage.

Erle Zhu, Dazhi Jiang, Yuan Wang et al.

2025-10-30 32
cs.LG 2510.15821

Chronos-2: From Univariate to Universal Forecasting

Chronos-2 is a pretrained universal forecasting model employing group attention, supporting zero-shot predictions for univariate, multivariate, and covariate-informed tasks, achieving SOTA results.

Abdul Fatir Ansari, Oleksandr Shchur, Jaris Küken et al.

2025-10-18 42
cs.LG 2510.14545

Agentic Entropy-Balanced Policy Optimization

AEPO introduces dynamic entropy balancing and gradient regulation, enhancing stability and exploration in multi-turn web agent RL with only 1K samples.

Guanting Dong, Licheng Bao, Zhongyuan Wang et al.

2025-10-16 44
cs.LG 2510.14386

ASecond-Order SpikingSSM for Wearables

SHaRe-SSM excels in ultra-long sequences with 52.1x energy efficiency improvement.

Kartikay Agrawal, Abhijeet Vikram, Vedant Sharma et al.

2025-10-16 7