一个模型,同时读懂DNA双螺旋、蛋白质折叠、分子结构、气象场和医学影像——这件事在2026年7月变成了现实。

7月18日,上海科学智能研究院在2026世界人工智能大会科学智能开放论坛上,正式发布“神珍”科学多模态基础模型。它不是又一个专用模型,而是一个试图让AI真正“看懂”科学的底层超级大脑。

一、专用模型的困境:数据孤岛正在制约科学突破

过去几年,AI for Science领域涌现出一批性能出色的专用模型——AlphaFold2能预测蛋白质结构,专用模型能生成分子、设计材料。但问题也随之而来:这些模型各自为政,表征空间被锚定在单一模态和特定物理尺度内,既难以跨领域迁移知识,也无法与其他科学模态建立语义关联。

疾病研究就是一个典型例子。面对基因序列、蛋白质构象与药理活性数据交织而成的复杂因果网络,研究者需要的不是一个预测精准的蛋白质模型,而是一个能同时“阅读”序列语言、“理解”空间构象、“推演”动态交互的统一框架。

另一种思路是把科学数据强行转成文本token喂给大模型——把分子、蛋白质翻译成一串字母。但科学数据本质上是结构化的,被压扁为文本时,结构性信息会出现系统化损失。正如上智院院长漆远所说:“想发现底层规律,前提就是在第一步别把关键的细节信息丢掉。”

“神珍”正是对这一问题的一次系统探索。

二、110亿参数,一个模型打通六类科学数据

“神珍”总参数约110亿,面向DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,在一个统一模型中同时支持科学理解与多类结果生成。

它的名字取自《西游记》中的“天河定底神珍铁”。团队希望这套开放模型以相对精炼的形态承载多样的科学任务。

架构上,“神珍”以Qwen3-VL-8B为共享主干,为六类科学数据各设专门的数据处理通路。区别于把所有数据转换成同一种格式,它在进入共享模型前分别保留序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节。

蛋白质和核酸按序列处理,小分子按结构处理,气象数据保留空间分布,医学影像保留图像细节。这些能力被集成在同一个模型中,使用时按任务调用相应功能。

更关键的是,“神珍”不仅能理解,还能直接生成——RNA序列、可供计算机读取的分子表示(SMILES)、全球气象场和医学影像分割结果。理解与生成两套能力被捏进了同一个框架。

三、评测:110亿参数打出万亿级水平

在约110亿参数的规模下,“神珍”在生物序列、小分子、气象和医学影像等任务中展现出竞争力。

生物序列:在覆盖DNA、RNA、蛋白质以及不同生物序列关系判断的20项任务中,“神珍”有9项取得三款参评模型中的最优结果,17项位列前二。与总参数约1万亿的Intern-S1-Pro相比,两款模型各在10项任务上得分更高。参数规模并不是衡量科学模型能力的唯一维度。

小分子:在公开基准SMolInstruct的6项小分子属性理解任务中,“神珍”有4项取得或并列取得最优结果。

气象:给定一帧初始大气场,模型每6小时滚动预报一步,持续推演至第10天——在第10天的预报中,500hPa位势高度、2米温度、海平面气压等多项指标达到或优于业务级数值预报的水平。

医学影像:在覆盖CT、MRI、病理等九种影像模态、逾十万个图文样本的评测中,“神珍”衡量预测区域与人工标注重合程度的平均Dice得分为91.20,在7种参评方法中最优。

四、开源开放:让更多研究者参与共建

“神珍”的发布同步提供了模型权重、推理代码、示例脚本、输入说明和使用文档。研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台上汇聚的1500余个科学模型和工具组合使用;也可以在Hugging Face下载权重、在GitHub获取代码。

上智院方面表示,欢迎全球科研团队围绕“神珍”开展验证和二次开发,共建开放的科学智能社区。

五、从“背科学”到“发现科学”

“神珍”是今年3月初面世的系统级科研智能体“大圣”的超级大脑。两者的组合构成了一个完整的科研闭环——模型提供理解与生成能力,智能体组织复杂的研究流程。

漆远在论坛上点出了这场变革的终局想象:“AI要从‘预测’下一个Token走向‘发现’未知的规律,而AI发现未知科学规律将是超级智能的开始。”

真实的科研是包含文献、假设、数据、模型、仿真、实验及反馈的长链条过程。当110亿参数的“神珍”把六类科学数据收进同一个大脑,科学发现的形态,或许正被悄悄改写。