Native and Compact Structured Latents for 3D Generation
提出O-Voxel结构结合稀疏压缩VAE,实现复杂拓扑和细节丰富的3D生成,模型参数达4B,生成效率高且质量优异。
Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu 等
提出O-Voxel结构结合稀疏压缩VAE,实现复杂拓扑和细节丰富的3D生成,模型参数达4B,生成效率高且质量优异。
Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu 等
ART是一种类别无关的前馈模型,用于从稀疏多状态RGB图像重建完整的3D关节对象,预测几何、纹理和关节参数。
Zizhang Li, Cheng Zhang, Zhengqin Li 等
ParaFormer结合PageRank增强注意力,有效缓解图深层模型的过平滑问题。
Chaohao Yuan, Zhenjie Song, Ercan Engin Kuruoglu 等
采用七角色大模型协作的共识矩阵系统,利用Kendall's W量化多学科团队一致性,结合强化学习优化治疗建议。
Xudong Han, Xianglun Gao, Xiaoyi Qu 等
FLAME结合Legendre Memory与归一化流,实现高效且支持概率预测的时间序列基础模型。
Xingjian Wu, Hanyin Cheng, Xiangfei Qiu 等
RoboTracer利用3D感知和强化微调,实现机器人空间追踪与推理,达79.1%成功率。
Enshen Zhou, Yibo Li, Jingkun An 等
提出以“形式-功能-动态”三维框架系统化归纳代理记忆,涵盖三种主要实现与多样功能。
Yuyang Hu, Shichun Liu, Yanwei Yue 等
Transformer预测距离并结合遗传算法,在F8发现至少6个新冠军码。
Yang-Hui He, Alexander Kasprzyk, Q Le 等
BlossomRec通过块级稀疏注意力机制提升推荐效率,减少内存使用。
Mengyang Ma, Xiaopeng Li, Wanyu Wang 等
FIN-bench-v2通过整合多种基准测试,评估芬兰语大模型的表现,使用2.15B参数模型进行验证。
Joona Kytöniemi, Jousia Piha, Akseli Reunamo 等
MedInsightBench评估多模态医学数据分析,MedInsightAgent提升LMM表现。
Zhenghao Zhu, Chuxue Cao, Sirui Han 等
LINA框架通过学习提示特定干预,改善扩散模型的物理对齐和OOD指令遵循,显著提升性能。
Shu Yu, Chaochao Lu
AutoTool通过双阶段优化实现动态工具选择,提升LLM推理能力,平均在数学、科学、代码和多模态任务中提升6.4%。
Jiaru Zou, Ling Yang, Yunzhe Qi 等
提出了一个统一视频模型的下一场景预测任务,使用Qwen-VL和LTX,达到73%的因果一致性。
Xinjie Li, Zhimin Chen, Rui Zhao 等
利用可反驳性和非平凡性,证明当代大规模语言模型(LLMs)缺乏意识,强调持续学习的重要性。
Erik Hoel
DrivePI:一种空间感知的4D MLLM,提升自动驾驶的理解、感知、预测和规划能力,超越现有模型。
Zhe Liu, Runhui Huang, Rui Yang 等
提出JointAVBench,结合五个认知维度和四种音频类型,采用自动化生成问答,评估多模态大模型的音视频联合推理能力。
Jianghan Chao, Jianzhang Gao, Wenhui Tan 等
CoRe3D提出结合语义链式推理与空间结构的3D生成框架,显著提升3D理解与生成性能。
Tianjiao Yu, Xinzhuo Li, Yifan Shen 等
FysicsWorld提供全模态基准,支持图像、视频、音频、文本的双向输入输出,涵盖16项任务。
Yue Jiang, Dingkang Yang, Minghao Han 等
NL2Repo-Bench通过长远目标任务评估编码智能体的完整软件仓库生成能力,平均测试通过率不足40%。
Jingzhe Ding, Shengda Long, Changxin Pu 等