Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models
Chat-Edit-3D++通过大型语言模型实现灵活的3D和4D场景编辑,提升了编辑效率和效果。
Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai 等
Chat-Edit-3D++通过大型语言模型实现灵活的3D和4D场景编辑,提升了编辑效率和效果。
Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai 等
首次大规模评估文本引导模型在面部编辑中的表现,Nano Banana等模型处理约1百万图像。
Rahul Nair, Saurav Pandit, Hannah Kerner
基于Gemma模型的GeBDA,将建筑损伤作为序列预测,利用双时相卫星影像实现自动定位与等级划分。
Olivier Dietrich, Krishna Sapkota, Konrad Schindler 等
利用预训练视频生成模型作为几何学习器,通过下一帧预测实现单目深度与法线估计,显著减少标注数据需求。
Haosen Yang, Jifei Song, Zhensong Zhang 等
LayerRecall为视频生成引入状态条件的记忆路由器,显著提升长距离内容恢复能力。
Yixuan Ding, Jiahao Kong, Wei Huang 等
ARC-CT利用解剖引导的对比学习,结合区域特征提升胸部CT异常检测,达0.86宏平均AUC。
Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol 等
本研究通过比例定律分析,验证了视频扩散模型在驾驶数据上的规模效应,最大模型达9B参数,验证损失预测误差仅3.6%。
Victor Besnier, Anh-Quan Cao, Elias Ramzi 等
StreamEMS通过自进化记忆机制提升视觉语言模型的视频流理解能力,在OVO-Bench上表现优异。
Yuxin Liu, Peiqin Zhuang, Yali Wang
VGTok通过区域可分离性优化高分辨率目标检测,提升VisDrone数据集AP至48.38。
Khayrul Islam
Code-as-World通过可执行代码表示物理世界,在QuantiPhy上表现优异。
Hanyang Wang, Yimo Cai, Weiliang Chen 等
本研究提出MILO框架,利用大规模重建模型(LRMs)从单幅图像重建3D人-物交互,超越现有方法的精度。
Agniv Chatterjee, Georgios Pavlakos
LeVJEPA采用无崩溃目标,简化架构,显著提升视频预训练效率,减少计算成本达20倍。
Lukas Kuhn, Lucas Maes, Giuseppe Serra 等
提出TADP:基于任务感知的变形预测模型,KITTI数据集车检测mAP达80.91%。
Su Wang, Yaochen Li, Min Yang 等
DINOcular通过自监督学习结合深度信息,提升3D空间感知能力。
Farkhat Almukhamedov, Sami Azirar, Hermann Blum
PACE通过像素自适应压缩和双注意力提取,在保留93.8%性能的同时将视觉令牌减少90%,实现3.1倍推理加速。
Junjie Liu, Shengyuan Ye, Xu Chen
Video-FLAIR通过强化学习选择推理模式,提升准确率并减少计算量。
Yogesh Kulkarni, Pooyan Fazli
VBVR-Pro通过300任务生成、可验证奖励和多模态评估,推动视觉推理的规模化与可靠性。
Junxiang Xu, Ruisi Wang, Fanyi Pu 等
提出VDA框架,结合VC-OT与VMA,有效应对多模态无监督连续后训练中的视觉依赖结构漂移。
Kaichen Li, Zhilin Zhu, Jianhao Huang 等
StreamPI通过指令锚定的时间建模实现单帧VLA的时序推理,无参数扩展。
Zhe Liu, Jinghua Hou, Yuxiang Lu 等
4DStreamCtrl通过统一3D点轨迹实现实时视频生成和控制,提升运动精度。
Shiqian Li, Chenguo Lin, Zhiguang Liu 等