PhysicsBench: A Unified Leaderboard for Generative and Predictive Models in Engineering Design and Simulation
PhysicsBench统一评估生成与预测模型在工程设计中的几何与物理场表现。
Sang Won Lee, Hyogu Jeong, Namwoo Kang
PhysicsBench统一评估生成与预测模型在工程设计中的几何与物理场表现。
Sang Won Lee, Hyogu Jeong, Namwoo Kang
提出TAGR,结合时间自适应的生成推荐框架,提升直播广告效果,提升8.5%用户进入率。
Wencai Ye, Guangyi Liu, Chaoyi Wang 等
AgentSpec通过结构隔离起草和冗余感知预算分配,提升LLM代理推理效率。
Xin Wang, Ziming Miao, Yi Zhu 等
Luce通过高斯云实现单图像到3D资产生成,FID提升28%。
Mayank Singh, Michele Stoppa, Alvise Memo 等
GlanceWAM通过异步测试时想象,突破速度与成功的两难,达成72.2%成功率。
Linhan Wang, Zijian An, Mingyuan Zhang 等
Wontopos Tablet 2通过无词汇匹配的方式实现多语言和多模态记忆检索,在LongMemEval-S上得分95.7%。
Sunwoo Kim
本研究通过控制实验分析RL后训练中基础模型分布、奖励稀疏性与提示多样性对模型性能的影响。
Donovan Clay, Saket Gollapudi, Sankar Harilal 等
CRISP通过DCO和OMP提升VSSD在遥感语义分割中的边界细节,参数约30M,显著改善性能。
Kangning Wang, Haopeng Zhang, Zhiguo Jiang
本研究评估大规模语言模型(LLMs)在创造性文本自动评价中的局限,发现自动指标与人类评价显著偏离。
Alessandro Tutone, Giorgio Franceschelli, Mirco Musolesi
ReWorld通过分离控制与记忆训练,采用混合注意力窗口和边缘缓存,实现长时记忆与实时控制的平衡。
Zhifei Chen, Luozhou Wang, Guibao Shen 等
提出SWE Refactor Bench,用三阶段评估编码代理的长远全仓库迁移能力,成功率仅5.4%。
Deyao Hong, Yizhe Chi, Wenyi Li 等
提出EG-ARSA:基于专家校准的低资源道路安全视觉模型,利用8亿参数的知识蒸馏实现高效评估。
Md Thamed Bin Zaman Chowdhury, Moazzem Hossain
提出了一种基于离群去噪器的自适应采样方法,减少了采样复杂度。
Daniil Dmitriev, Zhihan Huang, Yuting Wei
Prime Agent通过递归语言模型和持续性工具整合,实现长时程自主评估,提升ARC-AGI-3得分至95.5%。
Seth Karten, Alex L. Zhang, Kevin Thomas 等
ConvergeFlow通过流动匹配实现连续空间收敛到有效的Token嵌入,无需交叉熵解码器。
Na Li, Yuchen Jiao, Changxiao Cai 等
采用贝叶斯潜能模型分析AI帮助对逻辑推理技能的影响,发现自主思考促进技能提升。
Shang Wu, Catarina G Belem, Shuyuan Fu 等
提出基于Adapter的少样本持续学习框架,结合SSL预训练和LoRA,提升恶意包识别性能。
Kyle Stein, Guillermo Francia, III Eman El-Sheikh 等
RVM以速度场直接做奖励微调,较低成本达到或超过轨迹策略梯度方法;论文未报告具体数值。
Jaemoo Choi, Wei Guo, Yuchen Zhu 等
提出ActPair框架,结合动作对齐检索与pairwise多模态重排序,显著提升文本引导的人体异常行为检索性能。
Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen 等
提出安全方向惩罚(SDP)缓解推理引起的模型偏差,基于表示空间分析,显著提升Qwen2.5-3B和7B模型安全性。
Yipeng Zhao, Qishun Yang, Shenzhe Zhu 等