Flicker-DDPM: Accelerating Denoising Diffusion via 1/f Colored Noise Injection
Flicker-DDPM accelerates sampling by 3.33× using 1/f colored noise while improving generation quality.
KeXiang Mao, FanCheng Li
Flicker-DDPM accelerates sampling by 3.33× using 1/f colored noise while improving generation quality.
KeXiang Mao, FanCheng Li
OpenEAI-Platform integrates low-cost robotic arm and VLA model, achieving success rates comparable to large-scale pretrained baselines.
Jinyuan Zhang, Luoyi Fan, Leiyu Wang et al.
GTP-FA framework improves robotic manipulation success rates by 30% through failure attribution.
Jiahao Xu, Peiyuan Wang, Hanzhuo Zhang et al.
LiftQuant enables continuous bit-width control via high-dimensional projection, compressing a 70B model to 2.4 bits with superior performance.
Liulu He, XuanAng Liu, Juntao Liu et al.
LEAP uses blueprint-driven decomposition and iterative self-correction to boost formal proof success from below 10% to 70%, solving all 12 Putnam 2025 problems.
Po-Nien Kung, Linfeng Song, Dawsen Hwang et al.
EaDex uses low-cost demonstrations for dexterous manipulation, achieving a 55.3% improvement.
Qian Zhao, Xin Tong, Chengdong Wu et al.
Proposes Steady-Forcing, combining V-Sink and EMA-Sink, to improve long-horizon natural video diffusion stability and fluid motion.
Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong et al.
MemoGen enhances image generation via experience memory, surpassing Nano Banana Pro and GPT-Image-1.
Wenshuo Chen, Kuimou Yu, Bowen Tian et al.
Proposes an information-gain-based clarification framework for LLM agents, improving success rate by 3.7% with 0.3 fewer interaction steps.
Mengyi Deng, Zhiwei Li, Xin Li et al.
BAHSD improves long-tail user performance in black-box recommendation via adaptive distillation, achieving an 80% Recall@10 boost for tail users.
Xi Zhou, Famin Wu, Mingming Li et al.
SEA-Embedding employs contrastive learning and distribution matching, trained solely on public data, achieving SOTA in Southeast Asian multilingual embeddings.
Peerat Limkonchotiwat, Raymond Ng, Sarana Nutanong et al.
AsymCache integrates multi-segment attention with latency-aware eviction, reducing TTFT by up to 2.03× and improving GPU utilization in LLM inference.
Chunan Shi, Yilei Chen, Yilin Chen et al.
Any2Poster enables cross-modal, domain-general poster generation with 87.25% accuracy, integrating unified parsing, adaptive layout, and VLM-guided visual repair.
Amogh Vinaykumar, Aiden Li, Suozhi Huang et al.
Qift proposes fixed no-zero W2 level sets based on Gaussian-like weight distribution, significantly improving LLaMA W2A4 inference performance.
Chi-Wei Huang, Chia-Chi Tsai
Proposes SEIG, a staged framework leveraging pretrained vision-language models (VLMs) to reconstruct editable 3D scenes from a single image, achieving high fidelity in geometry, materials, and lighting.
Guangzhao He, Rundong Luo, Wei-Chiu Ma et al.
AdaCodec employs predictive visual coding, transmitting full reference frames only when prediction is costly, reducing visual tokens by 84.7% and boosting long-video understanding efficiency.
Haowen Hou, Zhen Huang, Zheming Liang et al.
This paper introduces VLM as a teacher for video reasoning via test-time online optimization, achieving a 16.7-point performance boost, surpassing traditional methods.
Junhao Cheng, Liang Hou, Tianxiong Zhong et al.
SubFit introduces non-contiguous submodule replacement in LLMs, achieving superior compression with 84.6% accuracy at 25% sparsity, using residual fitting without retraining.
Elia Cunegatti, Marcus Vukojevic, Erik Nielsen et al.
Proposed Script-Normalized WER (SN-WER), reducing script mismatch inflation by up to 12% across five Indic languages, enhancing multi-script ASR evaluation accuracy.
Priyaranjan Pattnayak
SimSD employs a plug-and-play masking strategy to enable token-level speculative decoding in diffusion LLMs, achieving up to 7.46× speedup while maintaining quality.
Junxia Cui, Haotian Ye, Runchu Tian et al.