新闻动态
京研大模型支撑神经科学研究, 将成为解答复杂生命科学问题工具
2026-07-22
6月10日,记者从智源人工智能研究院获悉,该院构建的全球首个理解与生成统一的多模态神经科学大模型,为神经科学研究提供了数据分析技术支撑,成功助力解析记忆与睡眠之间的神经机制关联。相关研究成果已在《科学》杂志发表。
理解神经信号中蕴含的信息,就像让人工智能(AI)学习陌生的“语言”。更棘手的是,神经信号的获取包含电信号、磁共振等多种方式,分别对应着不同“语言”。而科学家在每种神经“语言”中,目前都只掌握了极少的“词汇”,这种“数据孤岛”限制了神经科学大模型的构建。
“常规的神经信号编码思路,很难直接实现不同‘语种’间的交流,更不用说将它们和物理世界对应起来了。”面对难题,智源研究院研究员雷博带领团队提出了一套新思路:将各类神经信号的多模态数据“词元(Token)化”,使它们与当前大模型熟悉的语言、图像等模态联系起来。“这样一来,常见预训练大模型就具备了理解多模态神经信号的能力,打破‘数据孤岛’难题。”
雷博举例,一段品尝美食的脑电信号,和欣赏美食节目的脑部磁共振信号,虽然分属不同模态、不同场景,但都与美食相关。将两种信号Token化并与语言模态整合,就能利用预训练多模态模型,围绕“美食”的语义概念建立对应关系。随着数据集规模不断扩大,聚沙成塔,不同模态信号就有望统一为一种标准化“语言”。
在向这一目标努力的过程中,他们构建起全球最大的Token化神经科学数据集。这个涵盖了人类、小鼠、猕猴3个物种的11种模态的神经信号数据集,汇聚起以北京高校、科研院所、医院等机构为主力的全球开源神经科学数据,总量超1万亿Token。
在此基础上,悟界·Brainμ成为全球首个理解与生成统一的多模态神经科学大模型。前不久,该模型走进清华大学生命学院教授钟毅的实验室,成功解析睡眠活动、记忆活动等多模态、长时程数据。相关研究为理解记忆与睡眠的双向作用机制,提供了新的实验证据。
“但客观地讲,这套模型还处在科研辅助阶段。这次合作中,我们为清华团队在记忆与睡眠交互问题上定制了一位‘小助手’,承担数据分析、辅助验证假设等初级任务。实验任务一旦变化,模型也要重新定制。”雷博坦承,让这款模型达到当前大语言模型的通用形态,并有能力模拟神经系统在各种场景下的活动状态、帮助科学家开展问题导向的研究,是他们下一阶段努力的方向。
这次合作尝试,展现了该模型参与复杂生命科学基础研究的潜力。“将人脑信号翻译成易于理解的语言、文字图像,将开拓巨大的应用空间。”智源研究院院长王仲远表示,目前,该院正基于该模型,与首都医科大学宣武医院展开合作,探索抑郁症、阿尔茨海默病、帕金森病等脑疾病的早期诊断和筛查应用。
王仲远认为,多模态模型是新一代大模型技术的突破方向。智源研究院近年持续推进AI赋能生命科学研究,除了神经信号解析,还在数字孪生心脏、蛋白质建模辅助AI制药等方面展开探索。“未来,我们还要探索建立能感知真实世界时间、空间和物理规律的世界模型,研发类脑具身技术,让AI与现实世界实现真正的融合。”