NVIDIA GPU 加速 OpenAI GPT-6 Astra Ultrafast,token 生成最高提速 8 倍
OpenAI 发布 GPT-6 Astra Ultrafast,运行于 NVIDIA Blackwell GPU,现已上线 OpenAI API 并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 新模型在 NVIDIA Blackwell 上通过推理优化实现最高 8 倍 token 生成加速,面向编码智能体等时延敏感场景。
OpenAI 发布 GPT-6 Astra Ultrafast,运行于 NVIDIA Blackwell GPU,现已上线 OpenAI API 并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 新模型在 NVIDIA Blackwell 上通过推理优化实现最高 8 倍 token 生成加速,面向编码智能体等时延敏感场景。
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件有效使用寿命与 token 需求广度。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
OpenAI 宣布为 GPT-6 改进提示词缓存机制,引入更高的缓存命中率、新的诊断能力、显式断点以及相关控制选项。官方称这些改动可减少请求延迟并降低调用成本。开发者可通过 OpenAI 官方页面了解该缓存机制的具体用法与接入方式。
推荐理由:GPT-6 的提示词缓存机制升级,通过显式断点与诊断工具提升缓存命中率,降低推理延迟与调用成本。