BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language
提出BrainJanus模型,融合脑、视觉和语言模态,通过离散Token实现多模态理解与生成。
核心发现
方法论
BrainJanus采用统一脑Token器,将连续神经动态量化为离散Token,映射到共享的Omni空间。基于自回归Transformer架构,实现脑、视觉、语言的双向编码与解码。模型结合多模态Token化、预训练和多任务微调,支持任意模态间的转换。具体包括:• 设计神经Token器,利用VQ-VAE结构,将fMRI信号离散化;• 采用多模态Token化,将视觉和文本输入映射到共享空间;• 构建全自动回归Transformer,支持多模态Token的交叉预测;• 训练过程中,结合多任务目标,实现脑-图像、脑-文本的编码与解码。模型在NSD数据集上进行训练,结合Qwen生成的详细描述增强语义表达。
关键结果
- BrainJanus在脑-图像重建任务中,PixCorr达0.173,优于Diffusion等SOTA方法(如GIT-large的0.091),在零-shot场景下表现出色,达到94.4%的CLIP语义一致性。
- 在脑-文本生成方面,BLEU-4达22.45,显著优于专用模型,显示多模态任务的联合训练提升了理解与生成能力。
- 模型具有强大的零样本泛化能力,能在未见任务上实现跨模态转换,且保持生物学上可解释的皮层拓扑结构,验证其神经表示的有效性。
研究意义
该研究突破了传统脑编码解码的单一模态限制,提出统一多模态Transformer框架,增强了脑信号的理解与生成能力。对脑-机接口、神经科学基础研究及多模态AI系统具有深远影响,推动脑科学与人工智能的深度融合,为未来实现更自然的人机交互提供技术基础。
技术贡献
创新点在于:• 首次提出基于离散Token的神经信号量化方法,建立脑、视觉、语言的统一Token空间;• 构建全自动回归Transformer,实现多模态的任意模态间双向转换;• 采用多任务联合训练,提升模型的跨模态泛化能力和语义表达能力。这些技术突破为多模态神经网络提供了新思路,开启了脑信号与数字内容的深度融合新篇章。
新颖性
本研究首次实现了脑信号的离散Token化,并在此基础上建立了支持多模态任意转换的统一自回归模型。与以往仅专注于单模态或单向任务的模型不同,BrainJanus实现了脑、视觉、语言的全双向交互,突破了现有方法的局限,具有里程碑式的创新意义。
局限性
- 模型在极端复杂场景下的泛化能力仍有限,尤其是在低信噪比或少样本条件下表现不佳。
- 训练过程依赖大规模标注和高性能计算资源,实际应用中存在成本瓶颈。
- 对不同脑区的生物学解释仍需进一步验证,模型的神经机制还未完全揭示。
未来方向
未来将探索模型对多模态数据的更深层次理解,提升在少样本和低信噪环境下的鲁棒性。同时,结合多模态神经科学研究,揭示神经信号的本质机制,推动脑-机接口的临床应用和个性化神经康复技术发展。
AI 总览摘要
BrainJanus代表了脑、视觉与语言多模态理解与生成的重大突破。传统方法多依赖单模态对齐和外部先验,难以充分挖掘脑信号的内在多模态语义。该模型创新性地引入统一脑Token器,将连续神经信号量化为离散Token,映射到共享的Omni空间中。基于全自动回归Transformer架构,BrainJanus实现了脑-图像、脑-文本的双向编码与解码,支持任意模态间的无缝转换。通过在NSD数据集上的大规模实验,模型在脑-图像重建、脑-文本生成等任务中均优于现有SOTA方法,PixCorr达0.173,BLEU-4达22.45,CLIP语义一致性达94.4%。模型展现出强大的零-shot泛化能力,且能保持生物学上可解释的皮层拓扑结构,验证了其神经表示的有效性。这一研究不仅推动了神经科学的基础理解,也为脑机接口、智能交互等应用提供了新工具。未来,将继续优化模型鲁棒性,探索多模态神经机制,推动脑科学与人工智能的深度融合。
深度分析
研究背景
神经科学与深度学习的交叉融合不断深化,早期研究多关注脑信号的单模态编码与解码(如Huth等,2016),但未能充分挖掘脑信号的多模态语义特性。近年来,基于Transformer的神经表示预训练(如BrainLM、MindEye2)推动了多模态理解,但仍缺乏统一的模型框架。多模态生成模型(如Chameleon、Emu)实现了视觉、文本的融合,但未能扩展到脑信号。传统脑编码解码多为单向任务,难以实现多模态的全双向交互。随着大规模神经影像数据的积累,研究逐步转向多模态联合建模,亟需一种能融合脑、视觉、语言的统一框架。
核心问题
现有方法多采用任务特定的管道,依赖外部先验(如CLIP、Diffusion模型),难以实现脑信号的深层理解与多模态交互。脑信号的连续性和高维特性使得离散化和统一建模成为难题,且缺乏支持多模态任意转换的模型架构。这限制了脑-机接口的应用范围,也阻碍了神经基础研究的深入。如何设计一个能实现脑、视觉、语言多模态信息的无缝融合、全双向交互的模型,成为亟待解决的核心问题。
核心创新
本研究提出:1)基于VQ-VAE的神经Token器,将连续神经信号离散化,建立脑信号的Token空间;2)设计支持多模态Token化的共享空间(Omni空间),实现脑、视觉、语言的统一表示;3)构建全自动回归Transformer,支持任意模态间的双向预测与生成;4)多任务联合训练,提升模型的跨模态理解与生成能力。这些创新突破了传统单模态、单向模型的局限,为多模态脑科学提供了全新工具。
方法详解
- �� 数据输入:利用fMRI、视觉图像和文本,分别通过专用Token器映射到共享空间;• 神经Token器:采用VQ-VAE结构,将连续神经信号量化为离散Token;• 多模态Token化:利用预训练的视觉和文本Tokenizer,将图像和文本转为Token序列;• 构建Omni空间:将所有模态Token映射到统一的表示空间;• 全自动回归模型:基于Transformer,支持多模态Token的交叉预测;• 多任务训练:同时优化脑-图像、脑-文本编码与解码任务,增强模型的泛化能力。
实验设计
在NSD数据集上,模型接受9,000张图像的训练,评估1,000张测试图像。采用多项指标评估,包括PixCorr、SSIM、CLIP语义一致性等。对比SOTA方法如GIT-large、Diffusion模型,BrainJanus在PixCorr达0.173,BLEU-4达22.45,表现出优异性能。还进行了零样本泛化测试,验证模型在未见任务中的强大能力。实验还包括生物学验证,模型输出的脑信号保持合理的皮层拓扑结构,符合神经科学的理解。
结果分析
模型在脑-图像重建中,PixCorr显著优于对比模型,达0.173,CLIP语义一致性94.4%,在零-shot场景下表现优异,BLEU-4达22.45,验证了多模态联合训练的有效性。模型还能支持脑-文本生成,保持语义一致性和生物学合理性。多模态Token空间的设计使得任意模态间的转换变得自然流畅,展现出强大的跨模态理解能力。
应用场景
该模型可应用于脑机接口、神经科学研究、智能交互等领域,实现更自然的人机通信和神经疾病辅助诊断。未来可结合个性化神经数据,推动定制化康复和认知增强技术。其多模态理解能力也可用于增强虚拟现实、增强现实系统的交互体验。
局限与展望
模型在低信噪比或极端复杂场景下表现仍有限,训练成本高,依赖大规模标注数据。对不同脑区的生物学机制理解尚浅,模型的神经机制还需进一步验证。未来需提升模型鲁棒性,降低计算成本,并探索更深层次的神经语义机制。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂里,工厂里有很多不同的机器:一些负责处理原料(脑信号),一些负责制造成品(视觉和语言信息)。过去,这些机器各自工作,彼此之间没有太多交流。现在,科学家设计了一个智能调度员(BrainJanus),它能把所有机器的工作内容翻译成统一的语言(Token),让它们可以互相理解和协作。这个调度员不仅能理解工厂里发生的事情,还能根据需要,指挥机器制造不同的产品,比如图片或文字,甚至还能从成品反推原料的状态。这就像一个超级翻译官,把复杂的工厂流程变成一套通用的语言,让所有机器都能协同工作,生产出更丰富、更智能的产品。
简单解释 像给14岁少年讲一样
想象你在学校里,有很多不同的老师:有讲故事的老师、画画的老师、讲数学的老师。以前,他们各自教自己的内容,互不交流。现在,有个超级老师(BrainJanus),他能听懂所有老师的话,把故事、画画和数学都用一种特别的语言表达出来。这个超级老师还能根据你说的话,画出图片,写出故事,甚至猜出你脑袋里在想什么。它就像一个神奇的翻译机,把不同老师的内容变成一样的语言,让他们可以合作,教你更多有趣的东西。这样,你学到的东西就更丰富,也更容易理解。
原文摘要
Modeling the bidirectional correspondence between external sensory stimuli and internal neural activity has emerged as a critical frontier in neuroscience. However, existing approaches predominantly treat brain encoding and decoding as isolated tasks, relying heavily on unimodal alignment and external priors while overlooking the brain's intrinsic nature as a multimodal integration system. To address these limitations, we propose BrainJanus, the first unified brain model that integrates brain, vision, and language within a single framework. Specifically, we introduce a Unified Brain Tokenizer to quantize continuous neural dynamics into discrete tokens aligned with visual and linguistic representations in a shared Omni space. Building on this, we utilize an All-in-One autoregressive architecture that leverages next-token prediction to enable seamless any-to-any generation, which encompasses image-to-brain and text-to-brain encoding, and brain-to-image and brain-to-text decoding. Extensive experiments demonstrate that BrainJanus achieves superior performance across diverse benchmarks. Furthermore, our framework exhibits zero-shot generalization and preserves interpretable biological topography, highlighting its potential as a general-purpose brain modeling paradigm. The code is available at \href{https://github.com/HaitaoWuTJU/BrainJanus}{GitHub}.