Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion
Docling结合DocLayNet和TableFormer实现高效多格式文档解析,速度快且资源占用低。
Nikolaos Livathinos, Christoph Auer, Maksym Lysak 等
Docling结合DocLayNet和TableFormer实现高效多格式文档解析,速度快且资源占用低。
Nikolaos Livathinos, Christoph Auer, Maksym Lysak 等
BORA结合LLM和贝叶斯优化,提升高维实验设计效率。
Abdoulatif Cissé, Xenophon Evangelopoulos, Vladimir V. Gusev 等
提出参数化检索增强生成(Parametric RAG),通过将外部知识直接注入模型参数,提升效率与效果。
Weihang Su, Yichen Tang, Qingyao Ai 等
ClearSight利用生物启发的双驱动混合网络实现事件驱动的运动去模糊,优于现有方法。
Xiaopeng Lin, Yulong Huang, Hongwei Ren 等
本文综述自监督学习在时间序列异常检测中的方法,提出分类体系并分析未来挑战。
Aitor Sánchez-Ferrera, Borja Calvo, Jose A. Lozano
提出LoTbench框架,通过Oogiri游戏评估多模态大语言模型的创造力,发现其与人类差距不大。
Zhongzhan Huang, Shanshan Zhong, Pan Zhou 等
提出Humanity's Last Exam(HLE),涵盖2500题多模态学术题,挑战当前大模型能力。
Long Phan, Alice Gatti, Ziwen Han 等
本研究提出基于人类偏好的视频生成强化学习方法,利用VideoReward模型实现流式模型的对齐,显著提升视频质量。
Jie Liu, Gongye Liu, Jiajun Liang 等
本研究评估28个支持印地语等印地语系语言的LLMs性能,发现印度语表现差异显著。
Aatman Vaidya, Tarunima Prabhakar, Denny George 等
提出GUI-Bee利用自主探索和Q-ICRL优化环境特异数据,提升GUI动作定位在新环境中的表现。
Yue Fan, Handong Zhao, Ruiyi Zhang 等
CuriousBot用可行动三维关系图实现移动交互探索,平均成功率82%,显著优于二维VLM基线。
Yixuan Wang, Leonor Fermoselle, Tarik Kelestemur 等
提出VideoLLaMA3,基于视觉中心训练范式,结合多阶段优化,显著提升图像与视频理解性能。
Boqiang Zhang, Kehan Li, Zesen Cheng 等
提出基于评估头的高效提示压缩方法EHPC,显著降低长文本推理成本。
Weizhi Fei, Xueyan Niu, Guoqing Xie 等
VRank利用自洽性提升大模型Verilog生成质量,平均正确率提升10.5%。
Zhuorui Zhao, Ruidi Qiu, Ing-Chao Lin 等
提出基于范式的自动HDL代码生成方法,显著提升Verilog代码正确率。
Wenhao Sun, Bing Li, Grace Li Zhang 等
UniRestore结合扩散模型与编码器特征,实现感知与任务导向的图像修复。
I-Hsiang Chen, Wei-Ting Chen, Yu-Wei Liu 等
Kimi k1.5通过强化学习扩展LLM,取得77.5分AIME等领先成绩。
Kimi Team, Angang Du, Bofei Gao 等
使用DiverseAR数据集,GPT等VLM在AR场景识别中TPR达93%。
Lin Duan, Yanming Xiu, Maria Gorlatova
InternLM-XComposer2.5-Reward通过多模态奖励模型提升LVLMs的生成质量,达成70%准确率。
Yuhang Zang, Xiaoyi Dong, Pan Zhang 等
提出MCNI方法,通过噪声注入量化神经网络的不确定性,优于基线模型。
Xueqiong Yuan, Jipeng Li, Ercan Engin Kuruoglu