7月22日,一份被标记为“OpenAI内部测试文档”的文件在技术社区流传。文件显示,GPT-6在多项复杂推理基准测试中取得了显著进展,在部分任务中首次触及通用人工智能的门槛。
测试文档泄露了什么?
据披露的测试文档,GPT-6是GPT-5.6的下一代模型,在架构设计、训练规模与推理能力上均有大幅跃升。
核心发现包括:在ARC-AGI(通用推理能力测试)中得分超过85%,这是AI领域公认的AGI关键基准之一,此前的最高纪录由闭源模型保持约78%;在多步骤数学推理和抽象符号推理任务中表现出接近人类专家的水平,其思考过程具备更清晰的逻辑链条与自我纠错机制;训练数据规模达到千万亿token级别,结合合成数据技术,覆盖范围显著超越已有公开数据集。
文件特别强调,GPT-6并非单一模型,而是一个“模型家族”——包含从轻量级到超大规模多个版本,分别适配不同场景。这也延续了OpenAI自GPT-5系列以来的多尺寸策略。
“达到通用人工智能水平”意味着什么?
测试文档中的表述尤为引人注目:“在某些受控测试条件下,GPT-6的表现已符合AGI的初步定义标准。”
这里的AGI定义参照了OpenAI内部五级AGI分类体系中的“Level 4”(创新者)。该等级要求AI能够自主提出新概念、设计实验验证并做出可被人类评价的创新贡献。
ARC-AGI测试的创建者François Chollet曾在公开评论中指出,AI在ARC-AGI上的表现从2023年的30%提升至2026年的78%,进步速度远超预期。若GPT-6的85%得分属实,意味着AI在抽象推理方面的能力正在加速接近人类水平。
市场反应:英伟达股价承压,AI芯片估值逻辑面临重估
消息传出后,英伟达股价在盘后交易中下跌约2.3%。
资本市场的担忧在于:如果GPT-6等下一代模型在推理效率上实现大幅跃升,同等算力可支撑的智能水平将显著提升,AI芯片的推理需求总量可能被压缩。
分析人士指出,如果更聪明的模型能用更少的算力完成同等任务,当前市场对AI芯片的估值逻辑就需要重新审视。
真实性与争议:OpenAI尚未官方确认
截至发稿,OpenAI尚未对测试文档的泄露发表官方确认或评论。有声音指出,测试文档可能是竞争对手或研究机构对GPT-6能力的推测性评估,而非官方发布的正式测试报告。AI行业对GPT-6的更多细节仍在等待官方正式披露。
但无论该文档的真实性如何,其所描述的AI能力进化路径与业内对下一代模型的预期方向基本一致:更强的推理能力、更高效的训练方式、以及向AGI的持续逼近。
如果GPT-6确实在ARC-AGI上达到85%以上的表现,AI将从一个“信息处理工具”进化为一个“自主推理系统”。这意味着不仅代码生成和数据分析会被AI接管,那些需要复杂决策和创造性思维的知识工作——从产品设计到法律分析——也将面临重新定义。



