7月19日,上海科学智能研究院在2026世界人工智能大会的科学智能开放论坛上,正式向全球开放科学多模态基础模型“神珍”(Monkey King Bang, MKB)。模型总参数约110亿,面向DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,在一个统一模型中同时支持科学理解与多类结果生成。
一、从“大圣”到“神珍”:科研智能体的超级大脑
“神珍”之名取自《西游记》中的“天河定底神珍铁”。今年3月,上智院发布了系统级科研智能体“大圣”,而“神珍”正是支撑其运行的底层超级大脑。“大圣”以“神珍”为大脑,能直接读取DNA、蛋白质等科学结构信息,在ncRNA分类任务中准确率达96.3%。团队希望这套开放模型以相对精炼的形态承载多样科学任务,也让更多研究者参与检验、使用与共建。
二、六类科学数据“各走各的路”,一个模型全读懂
在科学智能领域,蛋白质、分子、气象和医学影像等方向已形成一批性能出色的专用模型。但不同科学对象背后的规律并不相同:序列强调前后依赖,分子强调原子之间的连接,气象场强调时空演化,医学影像强调局部结构。
“神珍”的解题思路是:以Qwen3-VL-8B为共享主干,为六类科学数据各设专门的数据处理通路。区别于把所有数据转换成同一种格式,“神珍”在进入共享模型前,分别保留序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节。蛋白质和核酸仍按序列处理,小分子仍按结构处理,气象数据仍保留空间分布,医学影像仍保留图像细节。
这些能力被集成在同一个模型中,使用时按任务调用相应功能。研究者无需在多个彼此独立的领域模型之间切换。
三、不止于问答:直接生成RNA、分子、气象场和医学影像
“神珍”不止于问答式理解,还能直接生成新内容——核糖核酸(RNA)序列、可供计算机读取的分子表示(SMILES)、全球气象场和医学影像分割结果。相当于把理解与生成两套能力捏进同一个框架。
四、性能验证:110亿参数叫板万亿级模型
在约110亿参数的规模下,“神珍”在生物序列、小分子、气象和医学影像等任务中展现出竞争力。
生物序列:在覆盖DNA、RNA、蛋白质以及不同生物序列关系判断的20项任务中,“神珍”有9项取得三款参评模型中的最优结果,17项位列前二。逐项比较,“神珍”在16项任务上得分高于同量级的Biology-Instructions;与总参数约1万亿的Intern-S1-Pro相比,两款模型各在10项任务上得分更高。这组结果表明,参数规模并不是衡量科学模型能力的唯一维度。
小分子:在公开基准SMolInstruct的6项小分子属性理解任务中,“神珍”有4项取得或并列取得最优结果。
气象:给定一帧初始大气场,模型每6小时滚动预报一步,持续推演至第10天。在第10天的预报中,500hPa位势高度、2米温度、海平面气压等多项指标达到或优于业务级数值预报的水平。
医学影像:在覆盖CT、MRI、病理等九种影像模态、逾十万个图文样本的评测中,“神珍”衡量预测区域与人工标注重合程度的平均Dice得分为91.20,在7种参评方法中最优。
五、全面开放:权重、代码、文档一应俱全
上智院已同步开放模型权重、推理代码、示例脚本与使用文档。研究者可通过星河启智科学智能开放平台下载模型或调用API,与平台上汇聚的1500余个科学模型和工具组合使用;也可在Hugging Face下载权重、在GitHub获取代码,共建开放的科学智能社区。
从“大圣”的超级大脑到面向全球开放的科学基础设施,“神珍”正在把110亿参数变成一个跨学科的科学发现引擎。


