GptGet
Features PaperForge Apps Papers Blog Contact AI Chat 中文
Sort: Latest Popular Citations
All Artificial Intelligence Computation and Language Computer Vision Information Retrieval Machine Learning Machine Learning (Stats) Neural and Evolutionary Computing Robotics
cs.CV 2602.06427

Bridging the Indoor-Outdoor Gap: Vision-Centric Instruction-Guided Embodied Navigation for the Last Meters

Proposes BridgeNav, a vision-based, instruction-guided indoor-outdoor navigation system achieving 89.55% success rate without priors.

Yuxiang Zhao, Yirong Yang, Yanqing Zhu et al.

2026-02-06 22
cs.CV 2602.05202

GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

GT-SVJ transforms video generative models into energy-based discriminators using contrastive learning, reducing human annotation by 6-65x while improving temporal sensitivity.

Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki et al.

2026-02-05 29
cs.CV 2602.05049

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA enhances VLA visual conditioning via track-following preference optimization, improving success rate by 3.15%.

Yiye Chen, Yanan Jian, Xiaoyi Dong et al.

2026-02-05 38
cs.CV 2602.04802

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench reveals a significant modality gap in vision-language models when processing visualized text versus pure text, based on multi-task evaluation.

Qing'an Liu, Juntong Feng, Yuhao Wang et al.

2026-02-05 49
cs.CV 2602.04361

SparVAR: Exploring Sparsity in Visual AutoRegressive Modeling for Training-Free Acceleration

SparVAR accelerates VAR models by exploiting sparsity, generating 1024x1024 images in just 1 second.

Zekun Li, Ning Wang, Tongxin Bai et al.

2026-02-04 37
cs.CV 2602.03782

QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization

QVLA reduces VRAM usage to 29.2% while retaining 98.9% performance in LIBERO using channel-wise quantization.

Yuhao Xu, Yantai Yang, Zhenyang Fan et al.

2026-02-04 36
cs.CV 2602.03339

Composable Visual Tokenizers with Generator-Free Diagnostics of Learnability

CompTok employs diffusion-based visual tokenization with InfoGAN objectives, enhancing compositionality and predictability of the token space, achieving SOTA in image generation.

Bingchen Zhao, Qiushan Guo, Ye Wang et al.

2026-02-03 18
cs.CV 2602.02380

Unified Personalized Reward Model for Vision Generation

UnifiedReward-Flex enhances vision generation with context-adaptive reasoning for personalized rewards.

Yibin Wang, Yuhang Zang, Feng Han et al.

2026-02-03 2
cs.CV 2602.02214

Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation

Causal Forcing uses AR teacher for ODE initialization, bridging architecture gap, boosting real-time video quality by 19.3%.

Hongzhou Zhu, Min Zhao, Guande He et al.

2026-02-02 25
cs.CV 2602.01756

Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation

Mind-Brush enhances image generation with a dynamic knowledge-driven workflow, boosting Qwen-Image performance on Mind-Bench from 0.02 to 0.31.

Jun He, Junyan Ye, Zilong Huang et al.

2026-02-02 31
cs.CV 2602.01753

ObjEmbed: Towards Universal Multimodal Object Embeddings

ObjEmbed achieves fine-grained image-text alignment through multimodal object embeddings, excelling on 18 benchmarks.

Shenghao Fu, Yukun Su, Fengyun Rao et al.

2026-02-02 44
cs.CV 2602.00579

Bridging Degradation Discrimination and Generation for Universal Image Restoration

Proposes BDG framework combining MAS-GLCM and diffusion models for multi-task universal image restoration, significantly improving fidelity.

JiaKui Hu, Zhengjian Yao, Lujia Jin et al.

2026-01-31 52
cs.CV 2602.00508

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen framework enhances interleaved multimodal generation by data curation and architecture design, improving text quality and image consistency.

Min Shi, Xiaohui Zeng, Jiannan Huang et al.

2026-01-31 36
cs.CV 2602.00267

PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories

PLACID leverages pre-trained video diffusion models with synthetic trajectories for multi-object compositing, achieving high fidelity and identity preservation.

Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer et al.

2026-01-31 48
cs.CV 2601.22744

Beauty and the Beast: Imperceptible Perturbations Against Diffusion-Based Face Swapping via Directional Attribute Editing

Proposes FaceDefense, combining directional attribute editing and diffusion loss to generate imperceptible adversarial faces, enhancing defense against diffusion-based face swapping.

Yilong Huang, Songze Li

2026-01-30 39
cs.CV 2601.22060

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Proposes Vision-DeepResearch, enabling multi-turn, multi-entity, multi-scale visual-text search for deep reasoning, supporting dozens of reasoning steps and hundreds of engine interactions.

Wenxuan Huang, Yu Zeng, Qiuchen Wang et al.

2026-01-30 42
cs.CV 2601.22046

PLANING: A Loosely Coupled Triangle-Gaussian Framework for Streaming 3D Reconstruction

PLANING combines triangle-Gaussian hybrid representation for streaming 3D reconstruction, achieving 18.52% improvement in Chamfer-L2 and 1.31dB PSNR over SOTA.

Changjian Jiang, Kerui Ren, Xudong Li et al.

2026-01-30 28
cs.CV 2601.21592

Unifying Heterogeneous Degradations: Uncertainty-Aware Diffusion Bridge Model for All-in-One Image Restoration

UDBM introduces an uncertainty-guided diffusion bridge for single-step multi-task image restoration, outperforming state-of-the-art methods with 6× faster inference.

Luwei Tu, Jiawei Wu, Xing Luo et al.

2026-01-29 40
cs.CV 2601.21408

MPF-Net: Exposing High-Fidelity AI-Generated Video Forgeries via Hierarchical Manifold Deviation and Micro-Temporal Fluctuations

MPF-Net detects high-fidelity AI video forgeries via hierarchical manifold deviation and micro-temporal fluctuation analysis, achieving 99.97% accuracy on VidProM.

Xinan He, Kaiqing Lin, Yue Zhou et al.

2026-01-29 41
cs.CV 2601.21238

PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models

PTQ4ARVG framework achieves 6-bit quantization for ARVG models while maintaining competitive performance.

Xuewen Liu, Zhikai Li, Jing Zhang et al.

2026-01-29 33
Prev 1 ... 43 44 45 46 47 48 49 ... 138 Next

© 2026 GptGet.net - Paper Insights Platform

Paper List Submit Paper Help GptGet Home