摘要:基于SemiAnalysis InferenceX公开基准的深度对比:OpenAI Jalapeño在每瓦工作量上达GB200/GB300的1.5-1.9倍,端到端延迟降低1.7-3.6倍,高交互负载性能提升2.1-4.1倍,单用户Token输出1459/s vs GB200的535/s。但Jalapeño仅支持推理、2026年底才小批量交付,英伟达在训练市场和生态系统上仍具绝对优势。专用芯片与通用GPU的推理之战才刚刚开始。
测评背景:推理芯片市场的巅峰对决
8月25日OpenAI公布的Jalapeño芯片测试结果,在AI芯片行业引发了强烈震动。这是OpenAI首次展示自研芯片的性能数据,而且直接对标英伟达当前最先进的推理GPU——GB200和GB300。为了给读者提供全面、客观的对比分析,本文基于SemiAnalysis开发的InferenceX公开基准测试数据,从能效比、延迟、吞吐量、适用场景、生态系统等多个维度,对Jalapeño和英伟达GB200/GB300进行深度对比测评。
需要说明的是,本次对比基于OpenAI公布的官方测试数据,测试使用了三款不同规模的大模型:GPT-OSS 120B(1200亿参数)、DeepSeek R1 670B(6700亿参数)和Kimi K2.5 1T(1万亿参数)。测试涵盖了峰值吞吐量、端到端延迟、高交互负载等多个场景。Jalapeño的额定功耗为700W,实测持续功耗550W以下;GB200和GB300的功耗分别为约1000W和1200W。

维度一:能效比(每瓦AI工作量)
能效比是推理芯片最重要的指标之一,因为它直接决定了数据中心的运营成本(电力和冷却)和部署密度。在InferenceX测试中,Jalapeño在所有三款模型上都实现了1.5至1.9倍的每瓦AI工作量提升。具体来说,在GPT-OSS 120B模型上,Jalapeño的每瓦工作量是GB200的1.9倍;在DeepSeek R1 670B模型上,是GB300的1.6倍;在Kimi K2.5 1T模型上,是GB300的1.5倍。
这一能效比优势的来源是Jalapeño的专用推理芯片架构。与通用GPU(如英伟达GB200/GB300)需要兼顾训练和推理、图形渲染等多种工作负载不同,Jalapeño是专门为大语言模型推理设计的。它在内存带宽、张量计算单元、数据通路、调度逻辑等方面都针对推理 workload 进行了深度优化。例如,推理任务对内存带宽的需求远高于训练任务,Jalapeño在内存带宽配置上进行了针对性的强化,避免了通用GPU在推理场景中常见的"内存带宽瓶颈"。
能效比1.5-1.9倍的提升意味着什么?对于一个大规模部署AI推理的数据中心而言,这意味着同样的电力预算下,可以处理1.5-1.9倍的推理请求,或者同样的推理量下,电力成本降低35%-47%。考虑到电力成本是AI数据中心运营成本的重要组成部分(通常占30%-50%),这一能效比优势可以转化为巨大的成本节约。以OpenAI为例,如果其推理 workload 全部迁移到Jalapeño,每年可以节省数十亿美元的电力和硬件成本。
维度二:端到端延迟与交互性能
延迟是用户体验的关键指标,特别是在对话式AI和交互式AI应用中。在InferenceX测试中,Jalapeño的端到端延迟比GB200/GB300低1.7至3.6倍。在高度交互的工作负载场景下(如实时对话、代码补全、多轮推理等),Jalapeño的性能提升更是达到了2.1至4.1倍。以单用户Token输出速度为例,Jalapeño每秒可输出1459个Token,而GB200仅为535个,差距接近3倍。
Jalapeño在延迟和交互性能上的优势,主要来自以下几个方面:一是专用推理调度逻辑,Jalapeño的调度器针对推理任务的特点(如批量小、请求到达时间随机、对延迟敏感)进行了优化,能够更高效地调度计算资源;二是内存子系统优化,推理任务需要频繁地从内存中读取模型参数,Jalapeño的内存子系统针对这一访问模式进行了优化,减少了内存访问延迟;三是低功耗设计,Jalapeño的实测持续功耗在550W以下,低于GB200/GB300,较低的功耗意味着更低的发热和更稳定的性能,避免了因过热导致的降频。
低延迟和高交互性能对于AI应用的用户体验至关重要。在对话式AI中,用户期望AI能够快速响应,延迟超过1秒就会明显影响体验。Jalapeño的低延迟特性可以让AI应用提供更流畅、更自然的交互体验。在代码补全场景中,低延迟意味着开发者可以获得更即时的代码建议,提升编程效率。在多轮推理和智能体场景中,低延迟可以显著缩短复杂任务的完成时间。
维度三:适用场景与局限性
尽管Jalapeño在推理性能上表现出色,但它也有明确的适用场景和局限性。适用场景方面,Jalapeño最适合大规模、高并发的大语言模型推理 workload,特别是对延迟敏感和对能效比要求高的场景。对于OpenAI这样的超大规模AI服务商而言,Jalapeño的专用推理架构可以显著降低推理成本,提升用户体验。
局限性方面,首先,Jalapeño仅支持推理,不支持训练。大模型的训练需要极高的算力和复杂的分布式训练框架,专用推理芯片无法胜任。OpenAI在模型训练方面仍然需要依赖英伟达的GPU集群。其次,Jalapeño2026年底才开始小批量交付,2027年才能大规模扩展,短期内无法替代英伟达GPU。第三,Jalapeño是OpenAI的自研芯片,不对外出售(至少目前如此),其他AI公司和企业无法使用。第四,Jalapeño的软件生态还不成熟,英伟达GPU拥有CUDA等成熟的软件生态和丰富的开发工具,而Jalapeño的软件栈还需要时间完善。
相比之下,英伟达GB200/GB300虽然在推理能效比上不如Jalapeño,但它们是通用GPU,可以同时支持训练和推理,还可以支持图形渲染、科学计算、数据分析等多种工作负载。英伟达拥有成熟的CUDA软件生态、丰富的开发工具和庞大的开发者社区,这是专用推理芯片短期内难以超越的。此外,英伟达GPU可以通过云服务(如AWS、Azure、GCP)灵活获取,而Jalapeño只能在OpenAI内部使用。
维度四:市场格局与未来展望
Jalapeño的发布将对AI芯片市场格局产生深远影响。短期来看(6-12个月),英伟达的市场地位不会受到根本动摇。Jalapeño要到2027年才能大规模部署,且仅供OpenAI内部使用,对英伟达的整体收入影响有限。同时,英伟达在AI训练芯片市场仍占据绝对主导地位,而训练市场的规模和利润率都高于推理市场。
中期来看(1-3年),推理芯片市场的竞争将加剧。OpenAI的Jalapeño、Google的TPU、Amazon的Inferentia、Meta的MTIA等专用推理芯片将逐步成熟和规模化部署,在推理市场对英伟达形成挑战。特别是对于超大规模AI服务商而言,自研推理芯片可以显著降低成本,提升竞争力,这将成为一种趋势。英伟达可能会推出更具性价比的专用推理产品(如Grace推理优化版)来应对竞争。
长期来看(3-5年),AI芯片市场将分化为"训练"和"推理"两个相对独立的赛道。训练芯片追求极致算力和互联带宽,英伟达的地位短期内难以撼动;推理芯片追求能效比、低延迟和低成本,专用芯片将占据更大的市场份额。同时,"模型-芯片协同设计"将成为主流,AI公司将根据自家模型的特点设计专用芯片,实现从算法到硬件的全栈优化。
对于AI应用开发者和企业用户而言,Jalapeño的发布传递了一个积极信号:AI推理成本将持续下降,推理性能将持续提升。这意味着更多AI应用场景将具备商业可行性,AI应用的用户体验将不断改善。建议关注AI推理成本和性能的变化趋势,优化AI应用的部署策略,在保证质量的前提下实现成本最优。对于AI芯片行业的从业者和投资者而言,推理芯片市场将是未来几年的重要增长点,建议关注专用推理芯片的技术进展和市场动态。