TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters
TextRefine结合监督微调与奖励优化,提升产品海报中文本的保真度和排布精度。
Honglie Wang, Jia Sun, Zijun Li 等
TextRefine结合监督微调与奖励优化,提升产品海报中文本的保真度和排布精度。
Honglie Wang, Jia Sun, Zijun Li 等
HiRA-CAM通过多层区域一致性增强CNN的细粒度空间解释,优于LayerCAM和Grad-CAM。
Manasi Nerurkar, Ali A. Minai
提出DistScan,通过预NMS预测分布偏移检测目标检测模型中的后门,准确率达97.22%。
Longtian Wang, Zhengyu Zhao, Chenhao Lin 等
SiConMo在ADE20K仅0.6 GFLOPs达34.8 mIoU,以瓶颈融合局部与全局上下文。
Mian Muhammad Naeem Abid, Nancy Mehta, Zongwei Wu 等
VA-Judger基于人类偏好反馈,采用链式推理和维度强化学习,显著提升视频音频生成的符合度。
Yinming Huang, Shuyuan Tu, Xi Yan 等
提出能力驱动数据基础设施,构建440M图像T2I语料,提升多能力迁移,采用多阶段课程调度。
Xingjian Wang, Zhao Wang, Taihang Hu 等
提出“即插即用”的交通元素感知方法,显著提升端到端自主驾驶性能,覆盖多模型架构。
Zongzheng Zhang, Jijun Wang, Saining Zhang 等
GS-Voxel:无需拟合的大规模3DGS生成结构化潜变量,支持百万级体素。
Ming Qian, Zijian Wang, Minchao Sun 等
提出“入口门控”机制,验证跨任务可用性,发现绑定位置决定能力转移,关键在理解路径的语义格式。
Zongyang Qiu, Yihan Wu, Kaixuan Fan 等
PixRestore是一款无需VAE的像素空间扩散变换器,参数仅50M,单步推理实现高质量图像修复。
Lingchen Sun, Rongyuan Wu, Xiangtao Kong 等
GenRouter通过动态路由优化图像生成流程,降低95%计算成本。
Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu 等
提出基于Prototypical Network的ID卡反欺诈方法,仅需4个样本实现跨国域泛化。
Mario Nieto-Hidalgo, Juan M. Espin, Juan E. Tapia
Ultra框架通过CTDN和CMIL实现恶劣天气下的无监督跨任务优化,在ACDC数据集上达到73.0%的mIoU。
Shiqin Wang, Zhiqian Li, Haoyuan Du 等
利用条件GAN和DDPM增强乌克兰战损农田卫星图像分类,提升准确率至88%。
Marta Sumyk, Oleksandr Kosovan, Iryna Voitsitska
本研究利用CRP和CRAFT在MS-COCO多标签分类中揭示概念级解释的偏差与困惑趋势。
Haadia Amjad, Ronald Tetzlaff
ConceptFormer通过学习自适应潜在概念提升视觉文档检索性能,NDCG@10提升16.7%。
Chunyi Peng, Zhipeng Xu, Yukun Yan 等
提出同步感知稀疏注意机制,有效加速音视频生成,保持同步与质量。
Shengchuan Gao, Teng Hu, Bohao Feng 等
提出StructFlow,通过空间相关的噪声分布改善图像生成的局部结构和编辑能力。
Arman Zarei, Mahdi M. Kalayeh
提出统一骨干-专家框架,在RML2016.10b上达到67.28%的准确率。
Zhixiang Deng, Houbiao Li, Zongyong Cui
MOSS-VL是一款支持实时交互的开源视觉-语言模型,采用门控交叉注意力实现感知与生成同步,参数11.3B。
Pengyu Wang, Chenkun Tan, Shaojun Zhou 等