Kling-Omni Technical Report
Kling-Omni为多模态视频生成框架,融合多模态输入实现高保真内容,支持编辑与推理。
Kling Team, Jialu Chen, Yuanzheng Ci 等
Kling-Omni为多模态视频生成框架,融合多模态输入实现高保真内容,支持编辑与推理。
Kling Team, Jialu Chen, Yuanzheng Ci 等
提出TODSynth框架结合MM-DiT和CRFM,有效提升遥感语义分割合成数据质量。
Yunkai Yang, Yudong Zhang, Kunquan Zhang 等
N3D-VLM通过原生3D感知与空间推理,显著提升3D目标定位与理解能力。
Yuxin Wang, Lei Ke, Boqiang Zhang 等
提出VoP方法,利用Web规模知识提升MLLM在城市导航中的表现,成功率显著提高。
Dwip Dalal, Utkarsh Mishra, Narendra Ahuja 等
提出“Off-The-Grid”架构,通过子像素级检测优化3D高斯原语布局,显著提升场景重建质量与效率。
Arthur Moreau, Richard Shaw, Michal Nazarczuk 等
提出O-Voxel结构结合稀疏压缩VAE,实现复杂拓扑和细节丰富的3D生成,模型参数达4B,生成效率高且质量优异。
Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu 等
ART是一种类别无关的前馈模型,用于从稀疏多状态RGB图像重建完整的3D关节对象,预测几何、纹理和关节参数。
Zizhang Li, Cheng Zhang, Zhengqin Li 等
LINA框架通过学习提示特定干预,改善扩散模型的物理对齐和OOD指令遵循,显著提升性能。
Shu Yu, Chaochao Lu
提出了一个统一视频模型的下一场景预测任务,使用Qwen-VL和LTX,达到73%的因果一致性。
Xinjie Li, Zhimin Chen, Rui Zhao 等
CoRe3D提出结合语义链式推理与空间结构的3D生成框架,显著提升3D理解与生成性能。
Tianjiao Yu, Xinzhuo Li, Yifan Shen 等
FysicsWorld提供全模态基准,支持图像、视频、音频、文本的双向输入输出,涵盖16项任务。
Yue Jiang, Dingkang Yang, Minghao Han 等
提出AdaptiveDetector,结合YOLOv11和VLM,动态调整检测阈值提升零样本多肽检测召回率。
Shengkai Xu, Hsiang Lun Kao, Tianxiang Xu 等
WeDetect通过检索实现快速开放词汇目标检测,在15个基准上达到SOTA性能,推理效率极高。
Shenghao Fu, Yukun Su, Fengyun Rao 等
UFVideo实现多尺度多粒度视频理解,融合全局、像素和时间信息,显著优于GPT-4。
Hewen Pan, Cong Wei, Dashuang Liang 等
提出Group Diffusion,通过跨样本注意力提升图像生成质量,FID最高改善32.2%。
Sicheng Mo, Thao Nguyen, Richard Zhang 等
提出SEPL方法,通过特征探测和预测集成提高噪声域泛化性能。
Wang Lu, Jindong Wang
Tri-Bench基准测试VLM在倾斜相机和物体干扰下的空间推理能力,平均准确率约69%。
Amit Bendkhale
InfiniteVL结合线性和稀疏注意力,实现高效无限输入视觉语言模型,解码速度提升1.7倍。
Hongyuan Tao, Bencheng Liao, Shaoyu Chen 等
Fast-ARDiff通过熵信息加速AR+扩散生成,ImageNet上实现4.3倍加速。
Zhen Zou, Xiaoxiao Ma, Jie Huang 等
首次全面综述面部与身体动作生成,涵盖数据集、评估指标及生成技术,强调GAN、DDPM等模型的多模态应用。
Lownish Rai Sookha, Nikhil Pakhale, Mudasir Ganaie 等