8月3日,腾讯云宣布CodeBuddy全面支持DeepSeek-V4-Flash正式版,同时WorkBuddy、CodeBuddy IDE、插件及CLI全系产品均已完成适配。这标志着腾讯AI编程工具矩阵完成了对最新一代Agent模型的系统级对接。

一次“后训练”驱动的能力跃迁

DeepSeek-V4-Flash正式版于7月31日开启API公测。该模型采用MoE架构,总参数规模284B(激活参数仅13B),支持最长100万token上下文。值得注意的是,其模型结构与预览版完全一致,性能跃迁全部来自强化后训练与自研Harness。

这是一条此前未被充分验证的路径——在不改动模型架构的前提下,通过训练策略的优化实现能力代际提升。DeepSeek团队显然在这条路上找到了某种底层突破。

基准测试数据印证了这一判断。在Terminal Bench 2.1上,Flash正式版得分从61.8跃升至82.7;DeepSWE从预览版的7.3分飙升至54.4分;Agent智能体终极测试得分25.2,远高于V4-Pro预览版的15.8,已接近Opus 4.8的25.7。CyberGym网络安全测试达到76.7分。

一个Flash模型在多项Agent基准上反超自家三个月前的Pro预览版,这在大模型行业并不多见。Agent能力的提升也让模型在终端操作、代码开发等多环节展现出更强的执行能力。

从“补全”到“执行”:Agent竞争的新阶段

此次适配的意义,不止于“多了一个模型选项”。

CodeBuddy此前已支持DeepSeek V4 Pro和Flash两个推理模型,均支持1M上下文窗口、工具调用和图片理解能力。但正式版Flash带来的是一套完全不同的能力基线——从Terminal Bench 82.7分到DeepSWE 54.4分,模型在终端操作、代码仓库理解、复杂任务执行等维度已具备接近旗舰级的Agent能力。

这恰好对应了AI编程工具正在经历的核心转变:从“代码补全”向“完整任务执行”演进。当模型不仅能补全一行代码,还能理解项目结构、自主调用工具、执行多步骤任务时,开发工具的价值锚点就从“辅助输入”变成了“自主交付”。

CodeBuddy全系产品的适配,意味着开发者无论在IDE、插件还是CLI环境中,都能直接调用这套能力。这种全链路覆盖的适配策略,降低了开发者在不同工具间切换的摩擦成本。

国产模型与开发工具生态的双向验证

从更宏观的视角看,这次适配也是一次双向验证。

对DeepSeek而言,CodeBuddy的全面接入意味着其模型在真实开发场景中的大规模验证。CodeBuddy集成了腾讯混元与DeepSeek双模型架构,是国内AI编程工具的重要标杆。Flash正式版能否在真实开发环境中兑现基准测试的成绩,将直接影响开发者对DeepSeek模型能力的信任度。

对腾讯而言,DeepSeek-V4-Flash在Agent能力上的显著提升,直接扩充了CodeBuddy在复杂任务场景下的处理上限。当模型能自主完成更多开发环节时,工具本身的自动化水平也会随之提升。

目前,用户已可通过WorkBuddy及CodeBuddy系列产品体验基于DeepSeek-V4-Flash正式版的AI开发能力。对于正在评估AI编程工具选型的开发者来说,这套组合的实际表现,值得花一个下午亲自跑一跑。