MidiTok Visualizer: a tool for visualization and analysis of tokenized MIDI symbolic music
MidiTok Visualizer通过可视化MIDI符号音乐的标记化数据简化音乐研究。
Michał Wiszenko, Kacper Stefański, Piotr Malesa 等
MidiTok Visualizer通过可视化MIDI符号音乐的标记化数据简化音乐研究。
Michał Wiszenko, Kacper Stefański, Piotr Malesa 等
MusicFlow通过级联流匹配实现文本引导的音乐生成,模型小2-5倍,迭代步骤少5倍。
K R Prajwal, Bowen Shi, Matthew Lee 等
SWE-Search结合蒙特卡洛树搜索与自我优化,提升软件代理性能23%。
Antonis Antoniades, Albert Örwall, Kexun Zhang 等
提出OGBench基准,涵盖8类环境、85个数据集,评估离线目标条件强化学习能力。
Seohong Park, Kevin Frans, Benjamin Eysenbach 等
MAPO利用动量增强梯度法优化大模型提示,显著提升收敛速度和性能。
Anthony Cui, Pranav Nandyalam, Andrew Rufail 等
LRDS结合先验模态位置,提升多模态分布采样效率。
Maxence Noble, Louis Grenioux, Marylou Gabrié 等
利用稀疏自编码器(SAEs)在生物知识领域实现可解释的知识去除,效果有限。
Eoin Farrell, Yeu-Tong Lau, Arthur Conmy
MoGe模型实现单目图像3D几何估计,采用仿射不变点云预测,训练引入全局与局部超监督。
Ruicheng Wang, Sicheng Xu, Cassie Dai 等
OSCAR通过状态感知推理和重新规划,实现对操作系统的控制,提升用户生产力。
Xiaoqiang Wang, Bang Liu
专家模型在记忆任务中表现优于推理任务,MoE架构在记忆任务中表现出色。
Samy Jelassi, Clara Mohri, David Brandfonbrener 等
MazeNet是一种解决OARSMT问题的深度学习方法,具有100%的准确率。
Gabriel Díaz Ramos, Toros Arikan, Richard G. Baraniuk
提出概念引导条件扩散和原型网络,提升模型可解释性。
Alba Carballo-Castro, Sonia Laguna, Moritz Vandenhirtz 等
本研究发现机器人模仿学习中的数据规模遵循幂律关系,环境和对象多样性比数据量更关键,4小时采集实现90%成功率。
Fanqi Lin, Yingdong Hu, Pingyue Sheng 等
AgentStore通过MetaAgent和AgentToken策略提升OSWorld基准性能至23.85%。
Chengyou Jia, Minnan Luo, Zhuohang Dang 等
提出结构语言模型(SLM)用于蛋白质构象生成,结合离散变分自编码器与条件语言模型,提升速度20-100倍。
Jiarui Lu, Xiaoyin Chen, Stephen Zhewen Lu 等
AVHBench为音视频大模型设计的跨模态幻觉评估基准,揭示模型在关系理解上的不足。
Kim Sung-Bin, Oh Hyun-Bin, JungMok Lee 等
提出LAMPS,通过预测策略优化API增强大模型推理,显著降低延迟。
Rana Shahout, Cong Liang, Shiji Xin 等
提出TranSPORTmer,一体化变换器模型,能实现多运动体轨迹预测、插补、推断与状态分类,显著优于SOTA方法。
Guillem Capellera, Luis Ferraz, Antonio Rubio 等
提出一种基于张量分解的多标记预测模型,提高采样效率,保持准确性。
Artem Basharin, Andrei Chertkov, Ivan Oseledets
提出相似性调节的惊异理论,结合Ricotta和Szeidl的多样性指数,提升阅读时间预测能力。
Clara Meister, Mario Giulianelli, Tiago Pimentel