摘要:DeepSeek 在 Hugging Face 开源 V4-Flash-Vision-Exp,MIT 协议放出权重、Tokenizer 与最小推理实现,多模态 Agent 能力据称接近 Opus-4.8。

DeepSeek 这次开源的诚意,藏在附带的文件清单里。

模型本体是 DeepSeek-V4-Flash-Vision-Exp,名字里的 Exp 说明是实验性版本,Flash 对应轻量高吞吐定位,Vision 是首次进入多模态。授权协议选了 MIT——这是开源许可里最宽松的一档,商用、修改、闭源再分发都不设限,比 Llama 系列那种带附加条款的“开放权重”要彻底得多。

真正专业的部分是配套内容:模型文件、Tokenizer、Prompt Encoding 参考实现,以及一份最小化的 PyTorch 推理实现。

做过开源模型接入的人知道,权重只是入场券。多模态模型最折磨人的地方是图文交错的编码规则——图片 token 怎么插入序列、分辨率如何切片、特殊标记怎么排布,这些细节文档里往往写得含糊,社区要靠反复试错才能对齐官方效果。DeepSeek 直接给出 Prompt Encoding 参考实现,等于把这块最容易踩坑的地方铺平了。最小化推理实现的价值同理:它是可读的、不依赖庞大框架的正确性基线,任何人想做推理优化或移植到别的框架,都有了对照物。

03_DeepSeek多模态开源封面.jpg

关于“多模态 Agent 能力接近 Opus-4.8”这个说法,需要保持谨慎。这类横向对比通常来自特定基准的得分,而多模态 Agent 涉及的能力维度非常多——视觉定位、界面理解、长程规划、工具调用鲁棒性,单一综合分很难反映真实体验差异。要判断它到底能不能用在你的业务上,只有一个办法:拿你自己的场景样本跑一遍。

放在近一周的开源节奏里看,中国团队的密度相当可观:智谱 GLM-5.3 开放权重(智能体编码与网络防御方向),GLM-5.3-Flash 以 320B-A18B 结构在 AA 综合智能指数拿到 57 分、与 Claude Opus 4.8 持平且定价只有其 1/40;腾讯混元 Hy4 preview 放出 770B 总参数、49B 激活、1M 上下文的开源版本。加上 DeepSeek 这一发,旗舰级能力的开源可获得性,正在以季度为单位往前跳。

对企业技术选型来说,这个趋势的含义很实际:以前“用闭源 API 还是自建开源”是个能力差距问题,现在越来越接近纯粹的成本、数据合规与运维能力问题。

给准备实际接入的团队几条务实提醒。

名字里的 Exp 要当真。实验性版本意味着接口约定、prompt 格式、甚至权重本身都可能在正式版里变动。适合做技术验证、跑内部基准、探索产品形态,不适合直接进生产环境——除非你能接受几周后重做一遍适配。

其次,MIT 协议解决的是法律问题,不解决成本问题。开源权重的真实成本在推理侧:GPU 采购或租用、显存规划、并发调度、监控告警、版本管理,还有一个常被低估的项目——出问题时没有供应商可以打电话。对调用量不大的团队,闭源 API 在总成本上往往更优。开源的价值集中在三类场景:数据不能出域、调用量大到 API 账单显著、以及需要在模型上做深度定制。

第三,多模态模型的评测比纯文本麻烦得多。建议至少准备三类样本:清晰的标准图(基线)、你业务里真实的低质量图(模糊、遮挡、光照差)、以及带密集文字的截图(这是多模态模型最容易露短板的地方)。只用第一类样本测出来的结论,上线后一定会被现实教育。