CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
提出CoRe框架,通过结构化数据和奖励机制提升跨图像细粒度推理能力。
Lin Peng, Cong Wan, Zeyu Guo 等
提出CoRe框架,通过结构化数据和奖励机制提升跨图像细粒度推理能力。
Lin Peng, Cong Wan, Zeyu Guo 等
提出LookME,通过层级检索和稀疏注入提升视觉-语言模型的多模态嵌入效果,显著优于文本专用方法。
Zeyu Xu, Xingzhong Hou, Pengkai Guo 等
CAtFM通过对比学习增强流匹配,实现风格与内容的解耦,提升了在ImageNet等数据集上的表现。
Yusong Li, Pingchuan Ma, Ming Gui 等
SeamGen通过流匹配学习艺术家偏好,基于网格图生成UV缝合线,显著优于传统方法。
Hao Xu, Yuqing Zhang, Yiqian Wu 等
SARSI以自我模型+证据门控递归改进,提出个人奇点架构;论文无实证数据。
Chengshuai Yang
RegHead通过前馈注册生成非人形头部表情混合形状,速度快于优化方法。
Jiahao Luo, Hao Zhang, Jianqi Chen 等
SymbOmni通过符号概念学习实现模型的持续演化,显著提升生成质量和效率。
Jinxiu Liu, Jianru Li, Tanqing Kuang 等
ABot-3DWorld 0利用统一空间生成原语,将多模态输入转化为高保真可探索3D场景。
Mingchao Sun, Luyang Tang, Yu Liu 等
DynEval通过动态评估框架提升T2I模型的文本图像对齐和图像质量,使用GenDB和DynEvalInstruct数据集。
Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane 等
SynthDocBench通过合成长文本文档,系统控制长度、布局、模态,揭示模型在长文理解中的三大失效模式。
Abhigya Verma, Khyati Mahajan, Amit Kumar Saha 等
ABot-N1采用双速架构,结合Chain-of-Thought推理与像素锚点,实现多任务通用视觉导航。
Ruiyan Gong, Yingnan Guo, Junjun Hu 等
提出SigLIP-HD,通过细到粗监督提升低成本视觉感知能力,性能优于基线模型。
Lihe Yang, Zhen Zhao, Hengshuang Zhao
提出动态逆渲染方法,结合物体追踪与表面重建,显著提升材料-光照解缠效果。
Raza Yunus, Benjamin Ummenhofer, Jan Eric Lenssen 等
OmniMapBench通过VDI指标验证地图文档的视觉推理能力,25个LVLM中最高准确率仅75.03%。
Yang Chen, Yunwen Li, Yufan Shen 等
提出MOSAIC自动搜索异构架构,结合线性、稀疏和低秩机制,显著提升视觉-语言模型效率。
Yuncheng Yang, Feiyang Ye, Shixian Luo 等
引入MultiView-Bench,评估VLM多视角空间整合能力,发现模型在3D空间关系和跨视点信息融合方面存在明显不足。
Hantao Zhang, Jinru Sui, Ed Li 等
提出结构稀疏自编码器(S2AE),通过语义和空间正则化提升跨模态概念一致性,提升mIoU6.06%。
Weiduo Liao, Yunqiao Yang, Ying Wei
WCog-VLA结合语义预测与生成模型,实现主动驾驶,PDMS达92.9。
Xuerun Yan, Zhexi Lian, Nuoheng Zhang 等
提出Temporal Ratio(TR)衡量视频动作模型对未来潜在状态的依赖,改善机器人任务中的泛化能力。
Utkarsh A. Mishra, Yongxin Chen, Danfei Xu 等
DreamCharacter-1通过几何和纹理后训练生成高保真3D角色,超越现有方法。
Weizhe Liu, Yunjie Wu, Xiangqian Shu 等