OSCAR: One-Step Diffusion Codec Across Multiple Bit-rates
提出OSCAR单步多比特率图像压缩模型,显著提升效率和质量。
Jinpei Guo, Yifei Ji, Zheng Chen 等
提出OSCAR单步多比特率图像压缩模型,显著提升效率和质量。
Jinpei Guo, Yifei Ji, Zheng Chen 等
提出Visual CounterFact数据集与PvP机制,控制视觉-知识优先级,模型在颜色和大小预测中99.3%成功转向反事实。
Michal Golovanevsky, William Rudman, Michael Lepori 等
提出因果LLM路由框架,通过观测数据最小化决策遗憾,超越现有基线。
Asterios Tsiourvas, Wei Sun, Georgia Perakis
提出像素空间推理框架,结合好奇心驱动强化学习,7B模型在视觉推理任务中达84%最高准确率。
Haozhe Wang, Alex Su, Weiming Ren 等
提出LALM评估分类法,涵盖听觉处理、知识推理、对话能力、公平性等四维度。
Chih-Kai Yang, Neo S. Ho, Hung-yi Lee
提出GUI-G1,结合改进的RL策略和奖励设计,在17K样本上实现90.3%的准确率,超越同规模模型。
Yuqi Zhou, Sunhao Dai, Shuai Wang 等
STAR-R1通过强化学习提升多模态大模型的空间推理能力,跨视图场景下性能提升23%。
Zongzhao Li, Zongyang Ma, Mingze Li 等
Soft Thinking通过连续概念空间提升LLMs推理能力,准确率提升2.48%,节省22.4% tokens。
Zhen Zhang, Xuehai He, Weixiang Yan 等
LLMs与EC结合优化算法设计,提升决策能力。
Dikshit Chauhan, Bapi Dutta, Indu Bala 等
Moonbeam模型结合绝对与相对音乐属性,提升MIDI音乐生成与理解。
Zixun Guo, Simon Dixon
Hunyuan-TurboS结合Mamba-Transformer,采用自适应链式推理,参数560B,性能优异。
Tencent Hunyuan Team, Ao Liu, Botong Zhou 等
提出REMS框架,将COP转化为资源任务模型,设计多元元启发式算法解决多类问题。
Aijuan Song, Guohua Wu
使用物理相关激活函数的神经网络显著提高核质量外推性能,RMS误差降低至328 keV。
C. H. Kim, K. Y. Chae, M. S. Smith
通过$μ$P高效扩展扩散Transformer,PixArt-$α$在0.61B参数下超越基线。
Chenyu Zheng, Xinyu Zhang, Rongzhen Wang 等
BanglaByT5是首个专为孟加拉语设计的字节级模型,优于多语言模型。
Pramit Bhattacharyya, Arnab Bhattacharya
利用PMP方法在澳大利亚和印度英语中实现可解释的讽刺检测,显著提高性能。
Ishmanbir Singh, Dipankar Srirag, Aditya Joshi
提出金融智能体基准,评估LLMs在SEC文件分析中的表现,最高准确率仅46.8%。
Antoine Bigeard, Langston Nashold, Rayan Krishnan 等
本研究提出低维子空间视角,分析变换器在OOD条件下的ICL泛化能力,证明子空间多样性促进泛化。
Soo Min Kwon, Alec S. Xu, Can Yaras 等
BAGEL模型通过大规模多模态预训练实现复杂推理,超越开源模型。
Chaorui Deng, Deyao Zhu, Kunchang Li 等
提出CAD-Coder,基于LLaVA微调的开源视觉语言模型,能直接生成可编辑的CadQuery代码。
Anna C. Doris, Md Ferdous Alam, Amin Heyrani Nobari 等