MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm
提出MindGPT-4ov,通过多阶段后训练提升多模态大模型性能,创新数据生成与微调策略。
Wei Chen, Chaoqun Du, Feng Gu 等
提出MindGPT-4ov,通过多阶段后训练提升多模态大模型性能,创新数据生成与微调策略。
Wei Chen, Chaoqun Du, Feng Gu 等
ReVSeg利用强化学习优化显式推理链,实现视频目标分割的可解释性和SOTA性能。
Yifan Li, Yingda Yin, Lingting Zhu 等
RULER-Bench评测视频生成规则推理,SOTA仅48.87%
Xuming He, Zehao Fan, Hengjia Li 等
DeepSeek-V3.2通过引入稀疏注意机制和大规模强化学习,显著提升开放式大模型的推理和代理能力,达到了与GPT-5相当的性能。
DeepSeek-AI, Aixin Liu, Aoxue Mei 等
提出Temporal Dynamics Enhancer提升SNNs时序建模能力,mAP50-95达57.7%和47.6%。
Fan Luo, Zeyu Gao, Xinhao Luo 等
Chain-of-Ground通过迭代推理和反馈提升GUI定位,ScreenSpot-Pro准确率68.4%。
Aiden Yiliu Li, Bizhi Yu, Daoan Lei 等
将Transformer注意力视为粒子系统,分析其极限行为,揭示多簇聚类机制。
Philippe Rigollet
提出多解任务中的推理过度自信问题,Long-CoT缓解该问题,基于认知刚性假设。
Jiannan Guan, Qiguang Chen, Libo Qin 等
SPARK以VLM、DiT和可微运动学从单图重建可仿真的关节物体,CD达0.3959。
Yumeng He, Ying Jiang, Jiayin Lu 等
FRAMER方法利用频率对齐自蒸馏和扩散先验提升图像超分辨率,显著提高PSNR和SSIM。
Seungho Choi, Jeahun Sung, Jihyong Oh
提出结构化频谱推理(SSR)框架,通过频域分解、掩码、融合和对齐提升多模态推荐性能。
Wei Yang, Rui Zhong, Yiqun Chen 等
AI-Trader利用自主多市场实时评估,揭示LLMs在金融交易中的局限。
Tianyu Fan, Yuhao Yang, Yangqin Jiang 等
本文提出基于流匹配的表格数据合成方法TabbyFlow,优于扩散模型,能低成本生成高质量数据。
Bahrul Ilmi Nasution, Floor Eijkelboom, Mark Elliot 等
提出三类离散扩散模型的非渐近收敛保证,基于Euler近似,适用于有限与无限状态空间。
Giovanni Conforti, Alain Durmus, Le-Tuyet-Nhi Pham 等
FR-TTS通过填充奖励优化NTP图像生成,显著提升生成质量。
Hang Xu, Linjiang Huang, Feng Zhao
提出反射Langevin扩散算法,证明其在Wasserstein-2距离下的收敛性。
Tarika Mane, Amine Boukardagha
提出WMAct,通过奖励重标和频率退火实现大语言模型高效世界模型推理。
Bao Shu, Yan Cai, Jianjian Sun 等
采用PPO和DQN的多智能体强化学习实现奶牛场P2P能源交易,显著降低成本和峰值需求。
Mian Ibad Ali Shah, Marcos Eduardo Cruz Victorio, Maeve Duffy 等
SpaceMind采用摄像头引导的模态融合,实现RGB图像的3D空间推理,超越SOTA指标。
Ruosen Zhao, Zhikang Zhang, Jialei Xu 等
DiskChunGS通过块状内存管理实现大规模3D高斯SLAM,成功完成KITTI数据集所有序列。
Casimir Feldmann, Maximum Wilder-Smith, Vaishakh Patil 等