通过保留推理链和启用压缩机制这两个 API 设置,GPT-5.6 在 ARC-AGI-3 基准上的得分提升了三倍,同时显著提高了推理效率和输出质量。
详细分析
这一突破性进展发生在 AI 领域对推理能力评估日趋严格的背景下。ARC-AGI-3 作为目前公认的抽象推理基准测试,旨在衡量模型在未见任务上的泛化能力,其难度远超传统语言理解测试,被视为通往通用人工智能(AGI)的关键门槛。此前,多数前沿模型在此基准上的表现始终徘徊在较低水平,而 GPT-5.6 此次通过两个简单的 API 设置——保留推理链和启用压缩——实现了分数的三倍跃升,这不仅是数值上的胜利,更折射出大模型在推理机制设计上的深层变革。从行业数据看,OpenAI 的竞争对手如 Google DeepMind 的 Gemini 系列和 Anthropic 的 Claude 系列,在同类基准测试中的成绩增长通常以百分之十到二十为单位渐进,而此次的倍数级提升无疑拉高了竞争水位。市场反应方面,该消息传出后,技术社区迅速展开讨论,许多开发者认为这暗示着“推理过程保留”(即不将中间思考步骤压缩为隐状态)与“压缩策略”(即对长 COT 进行 token 级缩减)的组合,可能是当前算力约束下最有效的性价比解。从更宏观的视角看,这一成果挑战了此前“模型规模决定智能上限”的普遍假设——GPT-5.6 并非通过增大参数或训练数据获得优势,而是依靠推理时的配置优化,这意味着提升智能的边际成本正在从训练端转向推理端,对云算力需求和 AI 应用商业模式将产生深远影响。同时,这也凸显了基准测试设计的敏感性:两个 API 开关即可引起如此显著的分差,使人们对现有评估体系的鲁棒性产生疑问,并可能推动下一代基准向更注重推理过程透明度的方向发展。尽管这一发现尚待第三方复现,但若属实,它将为中小型研究团队提供低成本提升模型推理能力的可行路径,并促进更多关于推理机制而非模型架构的研究转向,从而加速整个行业在 AGI 道路上的探索。
提示:这不仅是技术调参的胜利,更是对“推理外显化”价值的确认——在通往强智能的路上,过程的可控性可能比参数堆叠更具决定性。
原文:OpenAI Blog