视觉大模型长期被一个隐形门槛卡着:想拿到顶尖效果,就得先囤够天量数据和算力。这让先进视觉能力成了少数头部团队的专属玩具。7月21日,小鹏集团正式发布TuringViT高效视觉编码器,用十分之一的数据量,把SOTA基线甩在了身后。
一、一个模型通吃智驾、座舱和机器人
TuringViT的定位很清晰:面向VLM(视觉语言模型)与VLA(视觉语言动作模型)时代,全面支撑小鹏智能驾驶、智能座舱和IRON人形机器人三大业务场景。
在智能驾驶领域,TuringViT是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token。面向智能座舱与驾泊一体化场景,TuringViT让视觉特征与语言模型实现更高效对齐,支持不同画幅和比例的视觉输入。同时,它也为具身智能提供了通用视觉基础。
今年上半年,小鹏已密集发布多视角生成式世界模型X-World、推理加速引擎X-Cache、预测式世界模型X-Foresight及X-Mind技术框架。TuringViT的加入,让小鹏全栈自研的物理AI底层技术能力进一步完善。
二、三大核心创新:架构、数据、训练全面重构
第一,Turing线性注意力架构,把计算复杂度从二次方降到近线性。
TuringViT创新性地提出Turing线性注意力(TLA)作为核心计算单元,构建“5层线性注意力+1层标准多头注意力”的混合Turing Block架构。线性注意力承担主要的全局上下文聚合工作,仅周期性插入少量标准注意力层保障token级交互精度。
实测数据显示,随着输入分辨率提升,TuringViT的延迟增长曲线远平缓于标准softmax ViT。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍。
TuringViT共推出两个版本:
版本 | 架构 | 定位 |
TuringViT-18L | 3组Turing Block(15层TLA+3层MHA) | 动态分辨率下高效部署 |
TuringViT-24L | 4组Turing Block(20层TLA+4层MHA) | 更高表征能力 |
第二,VISTA-Curation数据治理,从“堆数据”转向“用优质监督”。
不同于行业“堆数据规模”的粗放路线,TuringViT打造了VISTA-Curation多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升。
针对图文数据,流水线分三步精细筛选:先过滤低分辨率、模糊的低质量图片;再通过多模型、多提示词生成多样化候选字幕并交叉验证视觉一致性;最后综合打分,筛出视觉贴合度高、语义信息密度高的优质标注。针对视频数据,同样进行全流程治理——切分、过滤、融合生成具备变换感知能力的视频标注。
第三,原生动态分辨率训练,告别“固定分辨率预训练+事后适配”。
TuringViT采用四阶段渐进式原生动态分辨率训练范式——视觉初始化、范围受限动态分辨率、原生分辨率精调、图文视频混合训练——从预训练之初就适配下游VLM/VLA的输入特性。
三、十分之一数据,交出更优成绩单
数据效率的提升直接反映在了成绩上。TuringViT仅用0.85B图文对(约为SigLIP2-L训练数据规模的10%),便在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越使用10B数据训练的主流开源基线。
在COCO与Flickr30K图文检索任务上同样优势显著。零样本分类对比中,TuringViT-24L(83.6%)超过了SigLIP2-ViT-L(83.4%)和InternVL-ViT-6B(82.5%)。
四、行业意义:把先进视觉大模型从“头部专属”推向“行业普惠”
视觉大模型的训练长期被数据和算力门槛卡住——想拿到顶尖效果,就得先囤够天量数据。TuringViT证明了一条不同的路:用更聪明的架构设计、更精细的数据治理,同样可以抵达SOTA,甚至走得更远。
小鹏表示,TuringViT的价值在于为行业提供了一条可复现、低成本训练SOTA级视觉Transformer的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。
这不是小鹏第一次在AI底层技术上做开源输出。从X-World到X-Cache,从X-Foresight到TuringViT,小鹏正在把自研的物理AI技术体系一步步拆解、开源、推向行业。当一家车企开始系统性输出视觉大模型的底层能力,竞争的逻辑正在从“谁的车卖得多”转向“谁的技术能定义行业标准”。



