通过启用两个API设置——保留推理能力和启用压缩——GPT-5.6在ARC-AGI-3基准测试中的得分提升至原来的三倍,同时效率显著提高。这一发现为优化大语言模型在复杂推理任务上的表现提供了新的思路。
详细分析
这一突破性进展源自OpenAI对GPT-5.6的测试优化,揭示了API设置对模型性能的深远影响。ARC-AGI-3被认为是衡量人工智能通用智能(AGI)的关键基准之一,它要求模型在未见过的抽象推理任务上展现出类似人类的归纳能力。此次发现的两个关键设置——‘保留推理’(retaining reasoning)和’压缩’(compaction)——分别作用于模型的计算图和时间步长管理,前者确保推理链在长任务中不丢失关键信息,后者则通过压缩内部状态来减少冗余计算,从而在不牺牲准确性的前提下提升效率。这一结果的意义不仅在于分数翻倍,更在于证明了模型架构之外的’超参数’层面对智能表现的巨大调节空间。从行业背景来看,当前AI竞赛正从单纯的模型规模和训练数据比拼,转向推理能力和效率的精细化打磨,各厂商(如Google DeepMind的Gemini系列、Anthropic的Claude)均在探索类似的技术手段。市场反应上,这一消息进一步加剧了投资者对OpenAI在AGI赛道上领先地位的信心,同时也引发了对模型透明度和可复现性的讨论——如果两个简单的API设置能带来如此大的差异,那么此前许多基准测试报告的有效性和可比性可能需要重新审视。这一发现还可能推动标准化的评测协议,促使社区在报告模型分数时明示推理配置。商业前景上,更高的推理效率直接转化为更低的运营成本,对于API服务商和下游应用开发者而言都是重大利好。长期来看,这种’软性优化’模式可能与模型架构演进形成互补,加速AGI的落地进程,但同时也要警惕过度依赖特定设置导致的泛化能力下降。
这个发现提示我们,在追逐更大模型和更多数据的同时,对推理过程的精细化控制可能才是解锁AGI潜能的关键钥匙。
原文:OpenAI Blog