Show-o2: Improved Native Unified Multimodal Models
Show-o2模型通过自回归建模和流匹配提升多模态理解与生成能力。
Jinheng Xie, Zhenheng Yang, Mike Zheng Shou
Show-o2模型通过自回归建模和流匹配提升多模态理解与生成能力。
Jinheng Xie, Zhenheng Yang, Mike Zheng Shou
通过函数对齐实现多功能符号音乐建模,提升和弦识别和旋律生成性能。
Junyan Jiang, Daniel Chin, Liwei Lin 等
采用多尺度Transformer与频域融合,提升阴影去除性能,PSNR达25.90。
Florin-Alexandru Vasluianu, Tim Seizinger, Zhuyun Zhou 等
Hunyuan3D 2.1通过Hunyuan3D-DiT和Hunyuan3D-Paint生成高保真3D资产,提升了几何细节和材质质量。
Team Hunyuan3D, Shuhui Yang, Mingxin Yang 等
提出一种实时内窥镜图像去噪系统,PSNR从21.16提升至33.05。
Yu Xing, Shishi Huang, Meng Lv 等
HeurAgenix利用大语言模型(LLMs)实现启发式算法的自动演化与动态选择,在多个复杂组合优化问题中表现优越。
Xianliang Yang, Ling Zhang, Haolong Qian 等
提出PeRL,通过序列置换和多阶段策略提升多图推理的强化学习性能,显著优于基线。
Yizhen Zhang, Yang Ding, Shuoshuo Zhang 等
引入自回归U-Net,学习字节级嵌入,支持多尺度序列建模,提升低资源语言处理能力。
Mathurin Videau, Badr Youbi Idrissi, Alessandro Leite 等
提出CSVC框架,利用因果知识引导扩散模型生成具有因果一致性的反事实视频,提升效果与质量。
Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios 等
AgentSynth通过链式生成子任务,构建超6000个多样化高质量任务,显著提升数据规模与复杂性。
Jingxu Xie, Dylan Xu, Xuandong Zhao 等
结合大语言模型(如GPT-3)与图像分割技术,提出面向智能交通的多模态方法,显著提升场景理解能力。
Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma
提出基于相控阵超声的多机器人无接触空中物体运输系统,验证稳定性与效率。
Narsimlu Kemsaram, Akin Delibasi, James Hardwick 等
VL-GenRM通过视觉专家和迭代训练提升视觉语言验证,显著提高多模态推理能力。
Jipeng Zhang, Kehao Miao, Renjie Pi 等
VideoPDE利用视频扩散变换器,将PDE求解转化为高保真视频修复,显著优于现有方法。
Edward Li, Zichen Wang, Jiahe Huang 等
Vid-CamEdit通过生成渲染和几何估计实现视频相机轨迹编辑,提升了新视角视频生成的质量。
Junyoung Seo, Jisang Han, Jaewoo Jung 等
OneRec采用端到端生成模型,提升推荐模型FLOPs十倍,显著优化计算效率和资源利用率,应用于快手,提升用户留存和体验。
Guorui Zhou, Jiaxin Deng, Jinghao Zhang 等
MiniMax-M1结合混合专家架构与Lightning Attention,实现长文本推理高效扩展,参数4560亿,支持百万级上下文。
MiniMax, :, Aili Chen 等
利用PALIRS的主动学习训练MLIP,快速准确预测小分子IR光谱,成本显著降低。
Nitik Bhatia, Patrick Rinke, Ondrej Krejci
TR2M利用图像和文本预测像素级尺度变换,将相对深度转为绝对深度,提升跨域泛化能力。
Beilei Cui, Yiming Huang, Long Bai 等
RecGRELA模型通过旋转增强线性注意力和自适应秩调制,实现长序列推荐的高效性和准确性。
Juntao Hu, Wei Zhou, Haini Cai 等