cs.AI 2602.13407

On-Policy Supervised Fine-Tuning for Efficient Reasoning

Simplified on-policy supervised fine-tuning (SFT) with truncation-based length reward improves reasoning efficiency and training speed, outperforming complex RL methods.

Anhao Zhao, Ziyang Chen, Junlong Tong et al.

2026-02-14 34
cs.AI 2602.07153

ANCHOR: Branch-Point Data Generation for GUI Agents

ANCHOR uses branch-point expansion to generate diverse GUI trajectories, improving model fine-tuning success rates by over 4% on benchmarks.

Jinbiao Wei, Yilun Zhao, Kangqi Ni et al.

2026-02-07 41
cs.AI 2602.05192

First Proof

Research-level math questions test AI's autonomous reasoning; framework involves encrypted questions, external resource access, and human validation.

Mohammed Abouzaid, Andrew J. Blumberg, Martin Hairer et al.

2026-02-05 30