MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
MSVBench通过层级脚本和参考图像,结合LMM与专家模型,实现多镜头视频生成的高水平评估。
Haoyuan Shi, Yunxin Li, Nanhao Deng 等
MSVBench通过层级脚本和参考图像,结合LMM与专家模型,实现多镜头视频生成的高水平评估。
Haoyuan Shi, Yunxin Li, Nanhao Deng 等
提出SPLARE,基于稀疏自编码器的多语言稀疏检索模型,性能优于词汇空间方法。
Thibault Formal, Maxime Louis, Hervé Dejean 等
提出OmniXtreme框架,通过流匹配和物理感知微调,突破高动态 humanoid 控制的泛化瓶颈。
Yunshen Wang, Shaohang Zhu, Peiyuan Zhi 等
提出Fourier角度对齐(FAA)提升遥感目标检测中的旋转角度预测精度,实验在DOTA和HRSC数据集取得优异结果。
Changyu Gu, Linwei Chen, Lin Gu 等
FuXi-Linear模型通过线性注意力机制在长序列推荐中实现高效性,提升21倍解码速度。
Yufei Ye, Wei Guo, Hao Wang 等
提出LFQA-HP-1M数据集,基于九项评分指标评估长文问答质量,模型表现与人类偏好相当。
Rafid Ishrak Jahan, Fahmid Shahriar Iqbal, Sagnik Ray Choudhury
提出证据神经辐射场(Evidential NeRF),可同时估算数据和模型不确定性,提升场景重建与可信度。
Ruxiao Duan, Alex Wong
SOTAlign通过少量配对样本结合最优传输实现视觉与语言模型的半监督对齐,显著优于传统方法。
Simon Roschmann, Paul Krzakala, Sonia Mazelet 等
EvoX通过元演化优化搜索策略,在200个任务中优于AlphaEvolve,提升搜索效率。
Shu Liu, Shubham Agarwal, Monishwaran Maheswaran 等
提出RaWMPC,无需专家监督,通过风险感知预测控制实现自主驾驶的泛化能力。
Jiangxin Sun, Feng Xue, Teng Long 等
SPARR结合模拟训练和现实残差策略,提高装配成功率38.4%,减少周期时间29.7%。
Yijie Guo, Iretiayo Akinola, Lars Johannsmeier 等
利用Takeuchi信息准则(TIC)评估深度神经网络(DNN)在接近NTK regime下的泛化能力,实验验证其相关性。
Hiroki Naganuma, Taiji Suzuki, Rio Yokota 等
提出PATRA模型,通过模式感知对齐与平衡推理提升时间序列问答性能。
Junkai Lu, Peng Chen, Xingjian Wu 等
SkillNet构建统一技能体系,支持多源创建与多维评估,提升AI技能积累效率。
Yuan Liang, Ruobin Zhong, Haoming Xu 等
ToProVAR通过三维熵感知语义分析和稀疏优化实现3.4倍加速。
Jiayu Chen, Ruoyu Lin, Zihao Zheng 等
提出Operation-R1框架,利用轻量级LLM一次性生成高质量数据预处理管道,显著提升表格问答性能。
Fengyu Li, Junhao Zhu, Kaishi Song 等
通过跨学科策略框架,提升说服对话代理的成功率,特别是对低意图用户。
Shinnosuke Nozue, Yuto Nakano, Yotaro Watanabe 等
个性化LLM代理通过用户信号实现跨组件交互,提升长期适应性。
Yue Xu, Qian Chen, Zizhan Ma 等
提出LegoOcc,基于语言嵌入高斯模型实现室内场景单目开源占用预测,IoU达59.50。
Changqing Zhou, Yueru Luo, Han Zhang 等
STATIC将Trie矢量化,TPU/GPU上每步仅0.033 ms,显著加速受限生成检索。
Zhengyang Su, Isay Katsman, Yueqi Wang 等