OpenAI推出名为Ultrafast的新API服务层级,基于Cerebras硬件运行GPT-5.6 Sol模型,输出速度最高可达每秒750个tokens,较原版提升14倍。

详细分析

这一新服务层级的发布标志着AI推理速度竞赛进入新阶段。OpenAI选择与Cerebras合作,而非传统的NVIDIA GPU集群,凸显了在推理端对定制化芯片方案的重视。Cerebras以其巨大的晶圆级引擎(WSE)著称,在生成式AI推理中展现出极高的吞吐量优势,这可能是实现14倍速度提升的关键。从行业背景看,随着大模型应用日益普及,推理成本与延迟成为企业采用AI的核心瓶颈。OpenAI此举直接回应了市场对低延迟、高吞吐模型服务的迫切需求,尤其利好实时交互应用,如智能客服、代码辅助、实时翻译等场景。Ultrafast模式可能采用更激进的量化技术或精简模型架构,在保持一定质量的前提下换取速度,这也暗示GPT-5.6 Sol本身具备可配置的推理灵活性。竞争格局方面,Anthropic、Google DeepMind等对手也在优化推理效率,但OpenAI通过分层定价(可能将Ultrafast作为高溢价服务)可以进一步细分市场,满足不同成本敏感度的用户。此外,与Cerebras的合作也可能改变AI芯片市场的力量平衡,对NVIDIA形成一定挑战,尽管后者仍主导训练市场。从商业前景看,若Ultrafast模式在实际使用中能保持高准确率,将吸引大量对时延敏感的企业客户,并可能推动AI服务从异步批处理向实时同步交互转型。不过,高速推理可能带来更高的能耗成本,OpenAI需要在性能与可持续性之间取得平衡。总体而言,这一举措不仅是技术迭代,更是AI商业化进程中向“即时智能”迈进的重要一步。

速度是AI普及的下一个战场,OpenAI正押注硬件协同创新来解锁实时智能的潜力。

原文:OpenAI Blog