Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

TL;DR

Mobius-v0通过知识与推理分离架构,在推理效率上实现近4倍提升,同时保持准确性。

cs.AI 🔴 高级 2026-08-14 29 次浏览
Kai Chen Jifeng Ding Ning Ding Jiaye Ge Lixin Gu Yicheng Gu Qipeng Guo Ermo Hua Haian Huang Haozheng Hou Jie Hou Xiangyu Hong Che Jiang Minxi Jin Cheng Liang Dahua Lin Dawei Liu Kuikun Liu Chengqi Lv Haijun Lv Han Lv Ningsheng Ma Biqing Qi Jianmin Qian Shiya Su Youbang Sun Huanze Tang Zhongbo Tian Hanjing Wang Rui Wang Ting Wang Yi Wang Baiting Wu Jun Xu Bowen Yang Hui Wang Weida Wang Haochen Ye Jiashuo Yu Shan Yu Xiaoyi Yu Qirui Zeng Qi Zhang Ming Zhang Wenwei Zhang Bowen Zhou Xinyu Zhou
知识分离 推理优化 Transformer 高效推理 深度学习

核心发现

方法论

Mobius-v0采用全局共享知识库(FFN)和多推理模块(Self-Attn),通过隐藏状态作为缓存与载体,推理模块反复查询知识库以获取所需知识向量,并将知识回传至推理操作。此架构提高了知识压缩率和推理效率。

关键结果

  • 结果1:7B模型使用62.6%的训练数据,达到与传统Transformer 7B模型相当的下游任务表现。
  • 结果2:Intern-S2-Mobius在Qwen3.5-35B基础上持续预训练,推理速度提高近4倍,同时保持性能。
  • 结果3:在科学任务如Mol-Instructions中,Intern-S2-Mobius的平均分数为52.14,而Qwen3.5仅为18.20。

研究意义

Mobius通过知识与推理分离解决了Transformer架构中知识冗余和推理效率低下的问题,为大规模模型的高效推理提供了新路径。这一架构在学术研究和工业应用中均具有重要意义。

技术贡献

Mobius提出了反向残差连接和动态潜在推理两个创新点,显著提升了推理效率。同时,通过全局共享知识库实现了知识压缩,减少了训练数据需求。

新颖性

Mobius首次实现了知识与推理的完全解耦,并通过共享知识库和动态推理机制优化了推理效率,与现有Transformer架构形成显著差异。

局限性

  • 局限1:共享知识库的构建在大规模模型中可能导致内存访问压力增加。
  • 局限2:推理效率的提升依赖于特定任务,可能不适用于所有场景。
  • 局限3:需要进一步验证其在更大规模模型上的性能表现。

未来方向

未来研究方向包括探索Mobius在超大规模模型中的适用性,优化共享知识库的存储和访问效率,以及扩展其在更多任务中的应用。

AI 总览摘要

Mobius-v0是一种全新的基础模型架构,旨在解决Transformer在知识存储与推理效率上的瓶颈问题。通过引入全局共享知识库(FFN)和多推理模块(Self-Attn),Mobius实现了知识与推理的完全解耦。推理模块通过隐藏状态反复查询知识库以获取所需知识向量,并将知识回传至推理操作,从而提高了推理效率。

在实验中,Mobius表现出显著的性能优势。其7B模型在使用62.6%的训练数据情况下,达到了与传统Transformer 7B模型相当的下游任务表现。同时,基于Qwen3.5-35B的持续预训练版本Intern-S2-Mobius实现了近4倍的推理速度提升,并在科学任务中表现优异。

Mobius的创新点包括反向残差连接和动态潜在推理,这些技术显著提升了推理效率,同时减少了训练数据需求。尽管存在内存访问压力和任务适用性等局限性,Mobius为大规模模型的高效推理提供了新思路,并为未来研究指明了方向。

深度分析

研究背景

Transformer架构已成为深度学习的主流范式,在语言、视觉等领域取得了广泛应用。然而,随着模型规模和数据量的扩展,Transformer的推理效率和知识存储冗余问题逐渐显现,限制了其进一步发展。

核心问题

Transformer的自注意力机制具有二次复杂度,导致长上下文推理效率低下。此外,知识存储冗余使得模型需要大量数据才能达到理想性能。这些问题阻碍了模型在实际应用中的部署。

核心创新

Mobius通过知识与推理分离架构解决了上述问题。其创新点包括:1)全局共享知识库,减少知识冗余;2)反向残差连接,增强跨层信息传递;3)动态潜在推理,优化推理效率。

方法详解

  • �� 全局共享知识库:FFN存储知识向量,供所有推理模块访问。
  • �� 多推理模块:Self-Attn通过隐藏状态反复查询知识库,进行多轮推理。
  • �� 动态潜在推理:减少冗余推理链,提升信息密度。
  • �� 反向残差连接:实现跨层知识访问,增强信息综合能力。

实验设计

实验包括从零训练和持续预训练两部分。7B模型在1TB数据上训练,Mobius在使用62.6%数据情况下达到Transformer的性能。同时,基于Qwen3.5-35B的持续预训练版本在科学任务中表现优异。

结果分析

Mobius在MMLU任务中以62.6%的数据达到Transformer的性能。在科学任务中,Intern-S2-Mobius的平均分数为52.14,而Qwen3.5仅为18.20。此外,推理速度提高近4倍。

应用场景

Mobius适用于需要高效推理的大规模语言模型场景,如实时问答、科学计算和代码生成。这些场景要求模型具有高信息密度和快速响应能力。

局限与展望

尽管Mobius在推理效率上表现优异,但其共享知识库可能导致内存访问压力增加。此外,其性能提升依赖于特定任务,需进一步验证广泛适用性。

通俗解读 非专业人士也能看懂

可以将Mobius比作一个图书馆,知识库是图书馆的书架,推理模块是读者。传统Transformer每个读者只能访问自己楼层的书,而Mobius允许所有读者随时访问整栋图书馆的书籍。这种设计让读者更快找到所需信息,减少了重复查询。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要找到线索解谜。传统模型像是每次只能看一个房间的线索,而Mobius像是你可以随时查看整个地图的所有线索!这让你解谜更快、更聪明,是不是很酷?

术语表

FFN (前馈网络)

存储知识向量的模块,负责知识压缩和传递。

Mobius中用于构建共享知识库。

Self-Attn (自注意力)

推理模块,负责信息综合和推理。

Mobius中用于多轮推理操作。

反向残差连接

允许深层访问浅层知识的机制,增强信息传递。

Mobius中用于跨层知识访问。

动态潜在推理

减少冗余推理链,优化推理效率的技术。

Mobius中用于提升推理效率。

知识压缩

通过减少冗余存储提高模型效率的技术。

Mobius中通过共享知识库实现。

开放问题 这项研究留下的未解疑问

  • 1 如何优化共享知识库的存储和访问效率?
  • 2 Mobius在超大规模模型中的适用性是否能进一步验证?

应用场景

近期应用

实时问答系统

通过高效推理实现快速响应,适用于客服和搜索引擎。

科学计算

在生物和化学领域加速复杂问题的解答。

远期愿景

通用人工智能

通过优化推理效率和知识存储,为构建更智能的模型铺平道路。

原文摘要

We introduce Mobius-v0, an architecture that comprises a globally shared Memory (FFN) that stores knowledge vectors and multiple Reasoners (Self-Attn) that iteratively achieve compositional reasoning. Using hidden states as cache and carrier, reasoners repeatedly query memory for required knowledge-vectors, while the knowledge is transmitted back to reasoning operators. Through this knowledge-reasoning-separation architecture, Mobius achieves better knowledge compression and reasoning efficiency. Built upon Mobius-v0 architecture: 1) Our 7B model trained-from-scratch achieves similar downstream score as a 7B Transformer baseline with 62.6% of baseline's training data. 2) Our Intern-S2-Mobius, continually-pretrained from Qwen3.5-35B, achieves similar downstream score while delivering nearly 4x end-to-end inference speedup.

cs.AI