Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
Youtu-Parsing通过高并行解码实现文档解析,速度提升5-11倍,在OmniDocBench等基准上达到SOTA性能。
Haoyu Cao, Kun Yin, Yunfei Wu 等
Youtu-Parsing通过高并行解码实现文档解析,速度提升5-11倍,在OmniDocBench等基准上达到SOTA性能。
Haoyu Cao, Kun Yin, Yunfei Wu 等
本研究分析AGENTS.md文件对AI编码代理在GitHub拉取请求中的运行时间和Token消耗的影响,结果显示有文件时效率提升明显。
Jai Lal Lulla, Seyedmoein Mohsenimofidi, Matthias Galster 等
HINT采用层级交互建模的自回归多人运动生成框架,达成低FID(3.100)和高一致性。
Mengge Liu, Yan Di, Gu Wang 等
OmegaUse通过混合专家模型实现96.3%的ScreenSpot-V2得分。
Le Zhang, Yixiong Xiao, Xinjiang Lu 等
AMA框架通过多代理协作实现自适应记忆,减少80%令牌消耗。
Weiquan Huang, Zixuan Wang, Hehai Lin 等
研究表明,表示几何的有效维度能强烈预测深度神经网络的泛化能力。
Sumit Yadav
提出TRACE基准,通过对比分析检测代码环境中的奖励黑客,GPT-5.2在对比设置中检测率达63%。
Darshan Deshpande, Anand Kannappan, Rebecca Qian
提出Self-Distillation Fine-Tuning(SDFT),实现模型连续学习,显著减少灾难性遗忘,提升新任务准确率。
Idan Shenfeld, Mehul Damani, Jonas Hübotter 等
提出Keel,结合Post-LayerNorm与Highway连接,实现深层Transformer稳定训练,深度超1000层,显著优于Pre-LN。
Chen Chen, Lai Wei
VGGT-SLAM 2.0通过改进因子图设计和注意力层验证,实现实时高精度场景重建,减少23%的位姿误差。
Dominic Maggio, Luca Carlone
提出ULEE,无监督预训练策略,结合自我目标生成和元学习,提升探索与适应能力。
Octavio Pappalardo
利用深度自编码器(DAE)识别FPUT模型轨迹的非线性内在维度,发现弱非线性时为2,β=1.1时升至3。
Gionni Marchetti
MDGR以掩码扩散生成SID,较基线最高提升10.78%,线上收入提升1.20%。
Lingyu Mu, Hao Deng, Haibo Xing 等
PROTEUS通过拉格朗日强化学习实现多LLM系统的SLA目标路由,准确率达94.0%,成本节省89.8%。
Amit Singh Bhatti, Vishal Vaddina, Dagnachew Birru
DeFM基于深度图像自监督预训练,学习几何与语义表示,达成多任务最优性能。
Manthan Patel, Jonas Frey, Mayank Mittal 等
提出自我蒸馏算法OPSD,单模型兼任教师与学生,利用已知正确答案提升大模型推理效率。
Siyan Zhao, Zhihui Xie, Mengchen Liu 等
K-Myriad通过最大化多策略集的状态熵,提升强化学习的探索效率和多样性。
Vincenzo De Paola, Mirco Mutti, Riccardo Zamboni 等
GenAgent通过代理式多模态推理,解耦理解与生成,提升文本到图像性能,达成+23.6%提升。
Kaixun Jiang, Yuzheng Wang, Junjie Zhou 等
通过14.8百万提示测试不同人口线索对LLM个性化和偏见的影响,发现效果不一致。
Manuel Tonneau, Neil K. R. Seghal, Niyati Malhotra 等
提出基于LoD的3D高斯点云流式重建框架StreamLoD-GS,实现稀疏视角下的高效高保真视频重建。
Xinhui Liu, Can Wang, Lei Liu 等