cs.LG 2503.23434

Towards Trustworthy GUI Agents: A Survey

Proposes a taxonomy for GUI agent trust, addressing perception, reasoning, and interaction trust.

Yucheng Shi, Wenhao Yu, Jingyuan Huang et al.

2025-03-30 6
cs.AI 2503.23037

Agentic Large Language Models, a survey

Agentic LLMs enhance decision-making via reasoning, acting, and interacting, significantly improving medical diagnosis and logistics analysis.

Aske Plaat, Max van Duijn, Niki van Stein et al.

2025-03-29 25
cs.CV 2503.21776

Video-R1: Reinforcing Video Reasoning in MLLMs

Introduces Video-R1 with T-GRPO algorithm and hybrid datasets, achieving 37.1% accuracy on VSI-Bench, surpassing GPT-4o.

Kaituo Feng, Kaixiong Gong, Bohao Li et al.

2025-03-28 39
cs.CL 2503.21295

R-PRM: Reasoning-Driven Process Reward Modeling

Proposes R-PRM, leveraging stronger models for seed data, preference optimization, and multi-trajectory inference, boosting step evaluation F1 by 11.9 points.

Shuaijie She, Junxiao Liu, Yifeng Liu et al.

2025-03-27 48 citations 47
cs.CV 2503.21254

Vision-to-Music Generation: A Survey

Survey on vision-to-music generation, analyzing technical challenges and providing datasets and evaluation metrics.

Zhaokai Wang, Chenxi Bao, Le Zhuo et al.

2025-03-27 5