Image Difference Quantification Using Autoencoder-Based Latent Representations
Autoencoder-based latent cosine similarity quantifies image differences, achieving 98.4% class separation.
Manish Sharma, Timothy Yim, Clifton Forlines
Autoencoder-based latent cosine similarity quantifies image differences, achieving 98.4% class separation.
Manish Sharma, Timothy Yim, Clifton Forlines
Ensemble CNN achieves 99.52% accuracy in stroke prediction, outperforming individual models.
Md Shahriar Sajid
X-MULTI leverages pretrained VLM to improve factor disentanglement in image synthesis, boosting novel combination accuracy by 12%.
Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch et al.
Luce uses Gaussian clouds for single-image to 3D asset generation, improving FID by 28%.
Mayank Singh, Michele Stoppa, Alvise Memo et al.
GlanceWAM achieves 72.2% success by asynchronously imagining future frames in latent space, breaking speed-success trade-off.
Linhan Wang, Zijian An, Mingyuan Zhang et al.
CRISP enhances VSSD for remote sensing segmentation via DCO and OMP, achieving ~30M parameters with significant accuracy gains.
Kangning Wang, Haopeng Zhang, Zhiguo Jiang
Expert-grounded distillation creates an 8B-parameter vision-language model for scalable road safety audits, outperforming larger teachers and proprietary models with 81% accuracy.
Md Thamed Bin Zaman Chowdhury, Moazzem Hossain
RVM fine-tunes diffusion velocity fields without trajectories, matching or exceeding policy-gradient baselines at lower cost; no numerical scores are provided.
Jaemoo Choi, Wei Guo, Yuchen Zhu et al.
ActPair framework combines action-aligned retrieval and pairwise multimodal reranking, significantly improving text-based person anomaly search accuracy.
Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen et al.
GeoWAM predicts future scene geometry with point clouds, significantly improving autonomous driving trajectory planning.
Yiren Lu, Xin Ye, Jiaming Liu et al.
MomADv2 employs selective state-space memory and flow-matching residual correction, significantly improving long-horizon autonomous driving stability and safety.
Ziying Song, Shengkai Zhang, Lin Liu et al.
JoyAI-Echo-1.5 enhances long-form audio-visual generation with memory and geometric control, improving consistency and visual quality.
Nan Duan, Haoyang Huang, Weiyang Jin et al.
EchoWM generates 720p video, environmental sound, music, and speech, supporting continuous navigation.
Songchun Zhang, Yaowei Li, Junhao Zhuang et al.
AquaFlow achieves efficient underwater streaming reconstruction with monocular Gaussian Splatting SLAM, reducing localization error by 13.2% and improving PSNR by 4.74 dB.
Yingxiang Xu, Kerui Ren, Wenqi Guo et al.
GAN-Diff combines pretrained WGAN-GP features with conditional diffusion U-Nets, achieving PSNR gains of 4.40dB for denoising and 3.70dB for super-resolution.
Saif Ahmed, Asadullah Hil Galib, S. M. Riaz Rahman Antu et al.
Proposes K-DCT covariance model to accelerate DDPM sampling, capturing non-diagonal correlations in natural images, improving quality with fewer steps.
Rui Xia, Ayan Das, Artem Artemev et al.
GuardPaint uses speculative decoding to repair unsafe regions during diffusion, reducing attack success rates while preserving image quality.
Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi et al.
DefaultShift quantifies semantic default shift in accelerated text-to-image models, reducing human-measured shift by 10.3%-35.1%.
Xuanhua Yin, Chuanzhi Xu, Shunqi Mao et al.
Introduces OmniAssistBench, a dataset built via reverse engineering of internet videos, to evaluate Omni-LLMs in multi-turn multimodal interactions.
Xianyun Sun, Chaoyou Fu, Zhengye Zhang et al.
Re3Cap employs retrieval-guided reasoning with k-core analysis to boost image captioning, achieving 8.64% improvement in relation reasoning on COCO-LN500.
Haonan Jia, Shichao Dong, Zenghui Sun et al.