摘要:8月26日AWS与英伟达宣布扩展合作,计划2027至2028年在AWS全球基础设施中额外部署200万颗英伟达GPU。双方还将在AI工厂、CPU、网络技术、开放模型、数据处理及机器人技术等领域深化合作。这是云厂商迄今最大规模的单笔GPU采购计划,AI算力需求仍在加速膨胀。
合作内容:200万颗GPU的超级订单
8月26日,亚马逊云科技(AWS)与英伟达联合宣布扩展战略合作,核心内容是在2027至2028年期间,在AWS全球基础设施中额外部署200万颗英伟达GPU。这个数字是什么概念?作为参考,AWS此前多年累计部署的英伟达GPU数量估计在数百万颗级别,一次性追加200万颗意味着在两年内将现有规模再提升一个量级。这是全球云厂商迄今公布的最大规模单笔GPU采购计划。
除了GPU采购,双方还宣布在多个领域深化合作,包括AI工厂(AI Factory)、CPU、网络技术、开放模型、数据处理以及机器人技术。AI工厂是英伟达提出的概念,指的是专门为AI训练和推理优化的一体化计算基础设施,集成了GPU、CPU、高速网络、存储和软件栈。AWS与英伟达在AI工厂层面的合作,意味着AWS将提供更深度优化的英伟达AI算力服务,而不仅仅是简单的GPU租赁。
为什么是现在:需求端的三重驱动
AWS选择在这个时间点宣布200万颗GPU的追加部署,背后有三重驱动因素。第一是智能体(Agent) workload 的爆发。黄仁勋在英伟达财报会上提到,智能体AI工作负载消耗的Token量是简单聊天请求的15倍。随着AI应用从对话式向智能体式演进,单位用户的算力消耗呈指数级增长,云厂商必须提前布局算力才能满足客户需求。AWS作为全球最大的云服务商之一,如果算力供给跟不上,就会把客户拱手让给Google Cloud和Microsoft Azure。

第二是AI推理市场的快速增长。此前AI算力需求主要由训练驱动,但随着大模型能力的成熟和应用场景的扩展,推理需求正在快速增长,且推理市场的规模有望超过训练市场。推理 workload 对GPU的需求特征与训练不同,更看重能效比和延迟,但总量同样巨大。AWS追加的200万颗GPU中,预计有相当比例将用于推理服务。
第三是竞争压力。Microsoft Azure与OpenAI深度绑定,在AI云服务市场占据先发优势;Google Cloud拥有自研TPU和Gemini模型的组合拳。AWS虽然是全球最大的云厂商,但在AI领域的品牌认知度不如前两者。通过与英伟达深化合作、大规模采购GPU,AWS可以强化"最强大AI算力平台"的定位,吸引更多AI初创企业和企业客户。
对产业链的影响
AWS 200万颗GPU的采购计划将对整个AI算力产业链产生连锁影响。对英伟达来说,这是一个巨大的订单保障,进一步确认了未来两年的收入增长确定性。200万颗GPU如果按平均每颗1万美元的保守估算,对应200亿美元的收入,实际上高端GPU(如GB200、Rubin系列)的单价远高于此,实际订单金额可能达到数百亿美元甚至上千亿美元。这也解释了为什么黄仁勋敢于给出2028财年70%增长的指引——大客户的长期订单已经摆在那里。
对GPU供应链来说,200万颗的需求意味着台积电的先进制程产能、HBM存储(三星、SK海力士、美光)、封装测试(CoWoS)、光互连模块等环节都将持续紧张。供应链的交付能力将成为决定英伟达和AWS能否兑现承诺的关键瓶颈。这也是为什么黄仁勋说"供给决定我们有把握交付70%"——不是需求不够,而是能造出多少芯片的问题。
对AI应用开发者和企业用户来说,AWS大规模扩容GPU意味着AI算力的供给将更加充裕,云服务的价格有望逐步下降,排队等待GPU资源的情况将得到缓解。这对于AI应用的商业化是利好消息——算力成本的下降将使更多AI应用场景具备商业可行性。
需要观察的问题
200万颗GPU的计划虽然壮观,但落地过程中仍有几个问题需要观察。一是交付节奏,200万颗是两年内的总量,具体的季度交付节奏如何?是否会因为供应链瓶颈而延期?二是GPU型号构成,这200万颗中,有多少是当前的Blackwell架构,有多少是下一代的Rubin架构?不同型号的性能和能效差异很大。三是自研芯片的平衡,AWS同时也在发展自研的Trainium和Inferentia芯片,200万颗英伟达GPU与自研芯片之间是什么关系?是互补还是竞争?四是投资回报,如此大规模的资本开支能否通过AI云服务的收入收回?AI云服务市场的竞争越来越激烈,价格战可能压缩利润率。
不管怎样,AWS 200万颗GPU的宣布,与英伟达财报的超预期表现形成了呼应,共同确认了一个事实:AI基础设施建设的周期远未结束,需求仍在加速。对于整个AI行业来说,算力供给的持续扩张是应用创新的基础,更多的算力意味着更低的成本、更强的模型、更丰富的应用。


