DiT4SR: Taming Diffusion Transformer for Real-World Image Super-Resolution
提出DiT4SR,结合双向注意机制和局部信息注入,有效提升真实场景下图像超分性能。
Zheng-Peng Duan, Jiawei Zhang, Xin Jin 等
提出DiT4SR,结合双向注意机制和局部信息注入,有效提升真实场景下图像超分性能。
Zheng-Peng Duan, Jiawei Zhang, Xin Jin 等
提出GUI代理信任分类法,解决感知、推理、交互信任问题。
Yucheng Shi, Wenhao Yu, Jingyuan Huang 等
提出Magiv3模型,将漫画元素识别与文本生成结合,实现无障碍漫画叙事。
Ragav Sachdeva, Andrew Zisserman
代理型LLM通过推理、行动和互动提升决策能力,显著改善医疗诊断和物流分析。
Aske Plaat, Max van Duijn, Niki van Stein 等
Hi3DGen通过法线桥接实现从图像生成高保真3D几何,显著提升细节保真度。
Chongjie Ye, Yushuang Wu, Ziteng Lu 等
提出增强实例回放(EIR),通过动态类别组合和背景融合,有效缓解持续语义分割中的背景偏移与灾难性遗忘。
Hongmei Yin, Tingliang Feng, Fan Lyu 等
CORAL利用对比偏好扩展和学习,显著提升多轮对话推荐准确率,Recall@10最高达99.72%。
Heejin Kook, Junyoung Kim, Seongmin Park 等
OntoAligner:支持大规模本体对齐的模块化Python工具,结合AI技术提升准确性。
Hamed Babaei Giglou, Jennifer D'Souza, Oliver Karras 等
提出Video-R1模型,结合T-GRPO算法和图像视频混合数据,显著提升视频推理性能。
Kaituo Feng, Kaixiong Gong, Bohao Li 等
该研究综述了物理认知在视频生成中的演变,提出了三层分类法。
Minghui Lin, Xiang Wang, Yishan Wang 等
LeX-Art通过高质量数据合成和模型微调,提升文本图像生成中的文本渲染精度,PNED提升79.81%。
Shitian Zhao, Qilong Wu, Xinyue Li 等
UI-R1通过规则强化学习提升GUI动作预测,准确率提升22.1%。
Zhengxi Lu, Yuxiang Chai, Yaxuan Guo 等
提出基于方法论的LLM智能体体系结构,涵盖构建、协作与演化,推动人工通用智能发展。
Junyu Luo, Weizhi Zhang, Ye Yuan 等
提出R-PRM,通过强模型生成种子数据和偏好优化,显著提升数学推理步骤评估准确率,F1提升11.9点。
Shuaijie She, Junxiao Liu, Yifeng Liu 等
综述视觉到音乐生成,分析技术挑战,提供数据集和评估指标。
Zhaokai Wang, Chenxi Bao, Le Zhuo 等
使用Llama-3.1-8B模型,73%的回答高度相关,召回率达100%。
Julia Ive, Felix Jozsa, Nick Jackson 等
提出全局数学建模,利用多层网络和仿真,突破还原论限制,推动生物系统理解。
Ramón Nartallo-Kaluarachchi, Renaud Lambiotte, Alain Goriely
提出RIM流形优化方法,复杂度从O(n^3)降至O(n),在图像去噪等实验中表现优异。
Jinghui Yuan, Fangyuan Xie, Feiping Nie 等
Wan采用扩散变换器架构,训练规模达14B参数,显著提升视频生成性能。
Team Wan, Ang Wang, Baole Ai 等
提出3MDBench,结合多模态多智能体模拟真实远程诊疗,提升LVLM诊断与对话质量。
Ivan Sviridov, Amina Miftakhova, Artemiy Tereshchenko 等