通过启用保留推理路径和启用压缩两个API设置,GPT-5.6在ARC-AGI-3基准测试中的性能得分提升了三倍,同时效率也得到显著改善。
详细分析
近期,OpenAI在其最新模型GPT-5.6上通过调整两个关键的API设置——“保留推理路径”与“启用压缩”,在ARC-AGI-3基准测试中取得了令人瞩目的成绩提升。ARC-AGI-3是一个专注于抽象推理与通用智能的基准,旨在评估模型在未见过的模式识别与逻辑推理任务上的能力,而不仅仅是依赖大规模训练数据中的记忆。此前,多数大型语言模型在该基准上的表现一直不尽如人意,因为ARC任务要求模型具备类似人类的抽象思维和泛化能力,而非简单的模式匹配。此次发现表明,通过合理配置推理过程的透明性与输出压缩策略,可以在不改变模型参数规模的前提下实现性能的跃升。具体而言,“保留推理路径”让模型在生成答案时保持中间推理步骤的完整性,从而避免了因过早剪枝或简化导致的逻辑断层;“启用压缩”则在不牺牲关键信息的前提下减少输出的冗余噪音,使模型更加聚焦于核心推理链。这一组合不仅使GPT-5.6在ARC-AGI-3上的得分翻了三倍,还降低了计算开销,提升了响应速度。从行业视角看,这一成果对AI研究社区具有多重意义。首先,它挑战了当前“更大模型、更多数据就等于更好性能”的主流叙事,提示开发者优化现有模型的推理策略可能比单纯扩大规模更具成本效益。其次,ARC-AGI-3的分数一直被视作衡量通向人工通用智能(AGI)的重要指标,此次突破可能引发业界对GPT-5.6真正推理能力的重新评估。然而,也有观点指出,这种提升可能尚未带来本质的泛化能力飞跃,因为调整API设置本质上是对现有架构的精细调优,而非新的算法突破。在市场反应方面,消息发布后,部分AI初创公司开始反思其模型推理管道的设计,而开源社区则迅速尝试复现类似设置。竞争格局上,这一进展或迫使Google DeepMind、Anthropic等对手加快在推理效率与压缩技术上的部署,以防止在关键基准上落后。长远来看,如果这种“设置优化”能被系统化并推广至其他任务,将可能催生新一代的模型配置标准,降低使用先进AI的经济门槛,从而加速AI在科学模拟、自动化决策等领域的商业化落地。
这一发现揭示了模型推理效率与配置精细度之间的深度关联,提示业界在追逐更大参数量的同时,不要忽视“如何更好地利用现有能力”这一金矿。
原文:OpenAI Blog