← 返回今日精选
重磅模型发布95

OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 推理速度最高提升 14 倍

OpenAI 推出全新 Ultrafast 服务层级,由 Cerebras 提供算力支持,将 GPT-5.6 Sol 的推理速度提升至标准模式的 14 倍,最高可生成每秒 750 个输出 token。该功能率先在 OpenAI API 中向部分客户开启限量预览,旨在将前沿 AI 模型引入对实时性要求极高的业务场景。

OpenAI 宣布推出 Ultrafast 服务层级,这是一种全新的 API 推理方案。该模式由 Cerebras 硬件提供支持,能够以最高 14 倍于标准处理的速度运行 GPT-5.6 Sol 模型,生成速度最高可达每秒 750 个输出 token。

过去,在 AI 推理中追求实时速度通常意味着只能妥协使用体积较小或高度专门化的模型。Ultrafast 模式打破了这一限制,使得在无需牺牲模型智能水平的前提下,将前沿大模型直接应用于对时间极其敏感的商业工作流成为可能。

在预览期间,OpenAI 正与首批企业客户共同测试该模式在编码、电商、金融研究、客户支持等交互式应用中的表现。官方列举了几个极具潜力的应用场景,包括在系统宕机期间实时分析日志的故障响应、实时评估交易的市场安全监控,以及无需打断对话即可解决复杂问题的语音客服。

OpenAI 内部的开发团队也已在实际工作中测试了 Ultrafast 模式。例如在故障响应中,工程师利用该模式快速读取日志、分析追踪记录并辅助准备修复方案,大幅缩短了从发现问题到采取行动的延迟。

在研究领域,该团队利用 Ultrafast 快速检索知识库和查询数据。以往需要整夜运行的批量实验流程,现在可以在工作时间内进行多次迭代和交互式测试,显著提升了研发效率。

目前,GPT-5.6 Sol 的 Ultrafast 模式仅向部分选定客户提供有限的预览访问。OpenAI 表示将随着算力容量的增长逐步扩大使用范围,有前沿智能和高速度需求的企业可以报名以获取后续访问通知。

编辑部解读

为什么值得关注

该功能打破了速度与模型智能之间的传统权衡,有望推动顶级大模型在实时故障响应、高频交易分析等对延迟极其敏感的核心业务中落地。