Show-o2: Improved Native Unified Multimodal Models
Show-o2 model enhances multimodal understanding and generation via autoregressive modeling and flow matching.
Jinheng Xie, Zhenheng Yang, Mike Zheng Shou
Show-o2 model enhances multimodal understanding and generation via autoregressive modeling and flow matching.
Jinheng Xie, Zhenheng Yang, Mike Zheng Shou
Versatile symbolic music modeling via function alignment enhances chord recognition and melody generation performance.
Junyan Jiang, Daniel Chin, Liwei Lin et al.
Proposed a multi-scale Transformer with frequency fusion, achieving PSNR 25.90 on WSRD+ dataset.
Florin-Alexandru Vasluianu, Tim Seizinger, Zhuyun Zhou et al.
Hunyuan3D 2.1 generates high-fidelity 3D assets using Hunyuan3D-DiT and Hunyuan3D-Paint, enhancing geometric detail and material quality.
Team Hunyuan3D, Shuhui Yang, Mingxin Yang et al.
Proposed a real-time endoscopic image denoising system, improving PSNR from 21.16 to 33.05.
Yu Xing, Shishi Huang, Meng Lv et al.
HeurAgenix leverages large language models (LLMs) for automatic heuristic evolution and adaptive selection, outperforming existing hyper-heuristics on classic benchmarks.
Xianliang Yang, Ling Zhang, Haolong Qian et al.
Proposes PeRL, a permutation-enhanced RL framework, achieving state-of-the-art on multi-image reasoning benchmarks with significant margin.
Yizhen Zhang, Yang Ding, Shuoshuo Zhang et al.
Introduces autoregressive U-Net for multi-scale byte embedding, matching BPE performance, enhancing low-resource and multilingual NLP.
Mathurin Videau, Badr Youbi Idrissi, Alessandro Leite et al.
Proposes CSVC, a causal prompt optimization framework guiding diffusion models to generate causally consistent counterfactual videos, improving effectiveness and quality.
Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios et al.
AgentSynth uses chain-based subtask generation to create over 6000 diverse, high-quality computer tasks, enabling scalable dataset expansion.
Jingxu Xie, Dylan Xu, Xuandong Zhao et al.
Integrating LLMs like GPT-3 with vision models enhances traffic scene segmentation, achieving 85% mIoU and 78% zero-shot accuracy on Cityscapes and BDD100K.
Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma
Proposed a multi-robot acoustic levitation system with phase control and FPGA IR synchronization, validated for stable contactless airborne transport.
Narsimlu Kemsaram, Akin Delibasi, James Hardwick et al.
VL-GenRM enhances vision-language verification using vision experts and iterative training, significantly improving multimodal reasoning.
Jipeng Zhang, Kehao Miao, Renjie Pi et al.
VideoPDE employs video diffusion transformers to solve PDEs as high-fidelity video inpainting, outperforming state-of-the-art methods.
Edward Li, Zichen Wang, Jiahe Huang et al.
Vid-CamEdit enables video camera trajectory editing via generative rendering and geometry estimation, enhancing novel view video synthesis quality.
Junyoung Seo, Jisang Han, Jaewoo Jung et al.
OneRec employs an end-to-end generative architecture, boosting recommendation model FLOPs tenfold, significantly improving computational efficiency and resource utilization, deployed at Kuaishou, enhancing user engagement.
Guorui Zhou, Jiaxin Deng, Jinghao Zhang et al.
MiniMax-M1 combines hybrid MoE architecture with Lightning Attention, enabling efficient long-context reasoning with 456B parameters and 1 million token support.
MiniMax, :, Aili Chen et al.
PALIRS uses active learning to train MLIP, enabling fast, accurate IR spectra prediction for small molecules with significantly reduced computational cost.
Nitik Bhatia, Patrick Rinke, Ondrej Krejci
TR2M leverages image and text to predict pixel-wise scale maps, converting relative to absolute depth with high cross-domain generalization.
Beilei Cui, Yiming Huang, Long Bai et al.
RecGRELA model uses Rotary-Enhanced Linear Attention and Adaptive Rank Modulation for efficient long-sequence recommendation.
Juntao Hu, Wei Zhou, Haini Cai et al.