摘要:8月31日新智元报道,OpenAI新模型Bel被曝预训练完成,参数高达10万亿。同时,OpenAI最强模型Astra被曝下周四可能发布,目前已扩大测试范围。内部机密泄露显示,Astra已正式接管自研芯片Jalapeño的底层代码,AI编写核心代码运行速度大幅提升。Astra此前以约2000美元算力成本破解10项悬而未决的数学难题,其核心能力是驱动多个AI智能体长期协同运作。

8月31日,新智元报道了OpenAI两款新模型的最新进展。一款代号为Bel的新模型被曝预训练已经完成,参数规模高达10万亿,这是OpenAI迄今为止参数规模最大的模型。另一款代号为Astra的模型则被曝可能在下周四(9月4日左右)正式发布,目前已经扩大了测试范围。两款模型同时曝光,表明OpenAI正在加速模型迭代,试图在与Anthropic、Google、Meta等竞争对手的竞赛中保持领先。

Bel和Astra的定位有所不同。Bel是一个超大规模的预训练模型,10万亿参数的规模远超当前主流模型(GPT-4约1.8万亿参数,GPT-5约3-5万亿参数)。超大规模参数的优势在于模型的知识容量和推理能力更强,能够处理更复杂的任务和更长的上下文。但超大规模模型也面临训练成本高、推理延迟大、部署困难等挑战。Bel可能主要用于研究和内部测试,或者作为其他模型的基座,而不是直接面向用户的产品。

97bf5f373c8848a9bff2c47829b65f4e.jpeg~tplv-a9rns2rl98-image.jpg

Astra则是一个更接近产品化的模型家族。早在8月初,The Information就报道OpenAI正在准备一个名为Astra的新模型家族,其核心能力不是"更聪明的单模型",而是让多个AI智能体协同工作、拆分任务、长时间跑完复杂项目。奥尔特曼曾亲自向美国国会议员演示Astra,展示其驱动多个智能体协同解决复杂问题的能力。Astra的内部测试版本此前以约2000美元的算力成本,成功破解了10项悬而未决十余年的数学和理论计算机科学难题,覆盖高维几何、编码理论、群论、量子复杂性等领域,并发布了249页的手稿合集和Lean 4可验证证明。

Astra最大的技术突破在于多智能体协同能力。传统的大模型是单智能体模式——一个模型接收输入、生成输出,完成一个任务。而Astra采用多智能体架构,能够同时调度多个AI智能体,让不同智能体分工处理任务、相互协作并汇总结果。一个复杂项目可以被拆分为多个子任务,分配给不同的智能体并行处理,然后由主控智能体汇总结果、协调进度、解决冲突。

这种多智能体协同的能力,使得Astra能够处理传统单模型无法完成的复杂、长周期任务。比如,在破解数学难题时,Astra可以调度多个智能体分别尝试不同的解题思路,有的智能体负责搜索相关文献和已知结果,有的负责推导和验证,有的负责检查证明的正确性,最后汇总出完整的证明过程。这种分工协作的方式,比单个模型从头到尾独立解题要高效得多,也更容易取得突破。

多智能体协同还带来了另一个优势:长时间持续工作的能力。传统单模型的处理能力受限于上下文窗口和单次推理的时间,无法持续工作数小时甚至数天。而Astra的多智能体架构可以实现任务的持久化——不同智能体可以接力工作,一个智能体完成一部分任务后,将状态和结果传递给下一个智能体,整个系统可以持续工作很长时间,直到复杂项目完成。这种持久化工作能力,使得Astra能够应用于软件开发、科学研究、数据分析等需要长时间持续投入的复杂任务。

内部机密泄露还显示,Astra已经正式接管了OpenAI自研芯片Jalapeño的底层代码编写工作。这意味着Astra不仅能够解决数学问题,还能够编写高性能的芯片底层代码,而且AI编写的核心代码运行速度比人类编写的更快。这是一个重要的信号——AI不仅能够替代人类的知识工作,还能够深入到硬件设计和底层代码编写等高度专业化的领域。如果Astra能够持续优化自研芯片的代码,将显著提升OpenAI自研芯片的性能和效率,降低对英伟达GPU的依赖。

OpenAI两款新模型的同时曝光,标志着大模型竞赛进入了一个新的阶段。这个阶段的特点不是单纯的参数规模竞争,而是模型架构、能力形态、应用场景的多元化竞争。

从参数规模来看,10万亿参数的Bel表明OpenAI仍在探索超大规模模型的边界。虽然业界对"参数规模是否还有意义"存在争议,但超大规模模型在知识容量、复杂推理、长上下文等方面的优势仍然明显。特别是在科学研究、数学证明、代码生成等需要深度知识和复杂推理的领域,超大规模模型可能带来质的突破。Bel的10万亿参数如果能够有效训练和部署,可能在这些领域带来显著的能力提升。

从能力形态来看,Astra的多智能体协同代表了大模型发展的另一个重要方向——从"单模型对话"到"多智能体协作"。随着大模型能力的提升,单模型已经能够完成很多任务,但面对复杂、长周期、多步骤的任务时,单模型的能力仍然有限。多智能体协同通过分工协作,能够显著提升处理复杂任务的能力和效率。这不仅是技术架构的变化,更是AI应用形态的变化——未来的AI可能不是一个聊天机器人,而是一个由多个智能体组成的团队,能够自主完成复杂的项目。

从应用场景来看,Astra破解数学难题和编写芯片代码的能力,表明AI正在从"通用助手"向"专业专家"演进。数学研究和芯片设计都是高度专业化、需要深厚领域知识的领域,AI在这些领域取得突破,说明大模型的能力已经从通用知识扩展到了专业知识。未来,AI可能在更多专业领域(如药物研发、材料科学、工程设计等)取得突破,成为科学家和工程师的重要助手甚至合作者。

从竞争格局来看,OpenAI的加速迭代将给竞争对手带来更大的压力。Anthropic正在筹备IPO,Claude系列模型在企业市场有很强的竞争力;Google的Gemini系列模型在多模态和搜索整合方面有优势;Meta的Llama系列开源模型在开发者生态方面有优势;国内的百度、阿里、腾讯、智谱、DeepSeek等公司也在快速迭代。OpenAI的Bel和Astra如果能够成功发布并展示出显著的能力提升,将进一步拉开与竞争对手的差距,巩固其在大模型领域的领先地位。但竞争对手也不会坐以待毙, likely会加速自己的模型研发和发布,整个行业的迭代速度将进一步加快。

尽管OpenAI两款新模型的曝光令人兴奋,但仍存在不少不确定性和风险。

一是模型发布时间的不确定性。Astra被曝下周四可能发布,但"可能"意味着时间可能推迟。OpenAI此前多次推迟模型发布时间,比如GPT-4的发布就比预期晚了几个月。模型的发布需要经过严格的安全评估、性能测试和产品化准备,任何环节出现问题都可能导致发布推迟。Bel的预训练完成只是第一步,后续的微调、对齐、评估、产品化等环节还需要大量时间。

二是模型实际能力的不确定性。Astra破解数学难题的能力令人印象深刻,但这些是在特定条件下取得的成果,模型在实际应用中的表现可能与实验室结果存在差距。多智能体协同在理论上很有吸引力,但在实际应用中可能面临智能体之间沟通不畅、任务分配不合理、结果汇总困难等问题。10万亿参数的Bel在理论上能力更强,但超大规模模型的训练和推理效率、稳定性、成本等问题还需要实际验证。

三是安全和对齐的风险。能力越强的模型,安全和对齐的挑战越大。Astra的多智能体协同能力,如果被滥用或出现不可控行为,可能带来更大的风险。比如,多个智能体协同进行网络攻击、生成虚假信息、操纵市场等,其破坏力可能远超单模型。OpenAI需要在模型发布前进行充分的安全评估和对齐训练,确保模型的行为安全可控。奥尔特曼向国会议员演示Astra,也表明OpenAI在积极与监管机构沟通,试图在创新和安全之间取得平衡。

四是商业化和成本的挑战。10万亿参数的模型训练和推理成本极高,如何实现商业化盈利是一个挑战。如果模型能力的提升不能带来相应的收入增长,大规模投入可能难以持续。多智能体协同的应用场景还在探索中,如何找到有付费意愿的用户和场景,是Astra商业化需要解决的问题。OpenAI的收入主要来自API调用和ChatGPT订阅,新模型需要证明其能力提升能够带来更多的用户和收入。

总体来看,OpenAI新模型Bel预训练完成和Astra即将发布的消息,是AI行业的一个重要事件。它表明大模型技术仍在快速进步,模型的参数规模、能力形态、应用场景都在不断拓展。多智能体协同和超大规模参数代表了大模型发展的两个重要方向,可能在未来几年深刻影响AI技术和应用的发展。对于行业从业者来说,需要密切关注OpenAI新模型的发布和表现,评估其对自身业务和技术路线的影响。对于普通用户来说,可以期待在不久的将来体验到更强大、更智能的AI服务。AI的发展远未到达终点,Bel和Astra可能只是下一波技术突破的开始。