排序: 最新 热门 引用
cs.LG 2412.11006

Entropy-Regularized Process Reward Model

提出熵正则化过程奖励模型(ER-PRM),结合KL正则化平衡策略优化,提升数学推理性能。

Hanning Zhang, Pengcheng Wang, Shizhe Diao 等

2024-12-15 28 引用 31
eess.IV 2412.09405

Learned Compression for Compressed Learning

提出WaLLoC结合线性变换和非线性自编码器,实现高效压缩与压缩域学习,超越现有模型。

Dan Jacobellis, Neeraja J. Yadwadkar

2024-12-13 43
cs.CL 2412.08905

Phi-4 Technical Report

phi-4为14亿参数模型,采用高质量合成数据和创新训练策略,显著超越教师模型GPT-4在STEM问答能力。

Marah Abdin, Jyoti Aneja, Harkirat Behl 等

2024-12-12 34