ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
ArtiScene利用图像中介,无需训练,实现基于文本的艺术3D场景生成。
Zeqi Gu, Yin Cui, Zhaoshuo Li 等
ArtiScene利用图像中介,无需训练,实现基于文本的艺术3D场景生成。
Zeqi Gu, Yin Cui, Zhaoshuo Li 等
提出C3PO,通过中心路径思想改进PPO,增强约束满足与性能。
Nikola Milosevic, Johannes Müller, Nico Scherf
提出了一种非线性约束的局部贝叶斯优化框架,减少了函数评估次数。
André L. Marchildon, David W. Zingg
AnnaAgent利用三级记忆和情感调节,实现心理咨询中 seekers动态演化与多会话记忆的逼真模拟。
Ming Wang, Peidong Wang, Lin Wu 等
使用自回归LLM的多模态生成AI实现人类动作理解与生成,提升动作质量。
Muhammad Islam, Tao Huang, Euijoon Ahn 等
提出PointODE,基于神经常微分方程的轻量级点云特征提取模型,参数仅0.58M。
Keisuke Sugiura, Mizuki Yasuda, Hiroki Matsutani
提出TSGD-M,通过动态采样与动量机制扩展文本梯度,提升提示优化的规模与稳定性。
Zixin Ding, Junyuan Hong, Zhan Shi 等
RoboMoRe通过联合优化形态和奖励,显著提升机器人设计效率。
Jiawei Fang, Yuxuan Sun, Chengtian Ma 等
ComposeRAG采用模块化设计,通过问句分解、检索决策、验证机制提升多跳问答性能,达成15%准确率提升。
Ruofan Wu, Youngwon Lee, Fan Shu 等
PhySense:基于原则的物理推理基准,揭示LLMs在物理问题上的推理缺陷。
Yinggan Xu, Yue Liu, Zhiqiang Gao 等
TW-GRPO框架通过聚焦思维和密集奖励提升视频推理,CLEVRER准确率达50.4%。
Jisheng Dang, Jingze Wu, Teng Wang 等
通过语音转换提高阿拉伯语方言识别的跨域鲁棒性,准确率提升34.1%。
Badr M. Abdullah, Matthew Baas, Bernd Möbius 等
提出RT-X Net,利用跨注意力机制融合RGB与热成像信息,显著提升低光照图像质量。
Raman Jha, Adithya Lenka, Mani Ramanagopal 等
提出SCRIPT编码方案,基于Unicode脚本与类别实现鲁棒多语预分词,优化BPE合并策略。
Sander Land, Catherine Arnett
提出VG LLM,利用3D视觉几何编码器从视频中学习3D先验,显著提升场景理解与空间推理能力。
Duo Zheng, Shijia Huang, Yanyang Li 等
提出基于主动推理的分布式智能框架,优化计算连续体中的服务管理。
Victor Casamayor Pujol, Boris Sedlak, Tommaso Salvatori 等
BinConv利用累积二进制编码实现时间序列的序数信息建模,显著提升预测性能。
Andrei Chernov, Vitaliy Pozdnyakov, Ilya Makarov
提出跨层归因算法分析稀疏MoE模型的知识分配,揭示“中激活、后放大”模式,提升37%的层效率。
Junzhuo Li, Bo Wang, Xiuze Zhou 等
提出对象中心概念瓶颈(OCB)框架,结合预训练的对象中心模型,提升复杂视觉任务的表现与可解释性。
David Steinmann, Wolfgang Stammer, Antonia Wüst 等
AReaL采用异步强化学习系统,显著提升GPU利用率,训练速度提升至2.77倍,保持或改善模型性能。
Wei Fu, Jiaxuan Gao, Xujie Shen 等