摘要:微软发布MAI Code 1.1 Flash,1370亿参数、3-bit量化实现本地推理,成本降至前代四分之一。GitHub Copilot月底支持云端与本地模型自动切换,AI编程助手迎来混合架构时代。
MAI Code 1.1 Flash定位为轻量化代理式编码模型。模型卡显示,其支持256K上下文窗口,输入覆盖文本与图像,适用于仓库问答、代码重构和工具调用等场景。
微软对其进行了3-bit量化,模型体积缩小近80%,本地运行仅需约53GB内存。官方推荐120GB以上RAM设备以获得最佳性能。在Surface Laptop Ultra上,解码吞吐量在2K至256K提示长度区间稳定在每秒40至63词元。
成本砍到四分之一
定价是最直观的变化。MAI Code 1.1 Flash每百万输入Token收费0.20美元,缓存输入0.02美元,输出1.20美元。上一代MAI-Code-1-Flash对应价格为0.75、0.075和4.50美元,降幅恰好为75%。
效率提升同样明显。相比6月版本,新模型在GitHub Copilot CLI的Terminal-Bench 2.1上提升约22%,.NET任务提升约15%,Token流速度提升25%,完成任务所需Token减少25%。SWE-Bench Verified得分为72.6%。
隐私与安全的双刃剑
本地推理的核心卖点之一是与数据隐私的天然契合。对处理敏感代码的企业团队而言,本地模型意味着推理数据无需离开设备。用户可通过Windows ML调用MAI Code 1.1 Flash,或接入兼容OpenAI API的本地端点。
安全防护方面,系统集成了微软执行容器(MXC),利用操作系统原生隔离机制保障代码运行安全。但本地部署并非零门槛——超过120GB内存的硬件要求,意味着多数开发者短期内仍需依赖云端补充。
微软此次将模型能力下沉至终端,标志着AI编程助手从“纯云端”向“云边协同”的架构转折。对AI行业而言,这不仅是产品更新,更是算力分发逻辑的一次重要试验。








