Cloudflare 发布 Clef 与 Clef-flash 决策模型,兼容 Jev API
Cloudflare 发布 Clef 与 Clef-flash 两款面向 AI 智能体的决策模型,输出带概率的简短分类结果而非长文本。据 Cloudflare 自测,Clef-flash 中位延迟约 39 毫秒、Clef 约 209 毫秒,低于 Jev 的 524 毫秒,且 Clef 支持图像输入与 64000 token 上下文窗口。
Cloudflare 发布 Clef 与 Clef-flash 两款面向 AI 智能体的决策模型,输出带概率的简短分类结果而非长文本。据 Cloudflare 自测,Clef-flash 中位延迟约 39 毫秒、Clef 约 209 毫秒,低于 Jev 的 524 毫秒,且 Clef 支持图像输入与 64000 token 上下文窗口。
Ramp AI Index 显示,美国企业 AI 使用量自 7 月支出峰值以来上升约 50%,9 月底创历史新高,但支出反而下降。Ramp 经济学家 Ara Kharazian 称,降价几乎完全来自 OpenAI 与 Anthropic 之间的竞争,头部模型降价及更便宜高效的标准版和 lite 模型是主因。
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件有效使用寿命与 token 需求广度。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御场景,目前仅通过 Fairwind Program 向政府用户和可信网络安全人员开放预览。
推荐理由:Gemini 4 Argon 在 19 项基准中拿下 13 项第一,并以 Long Decode Continuation 将输出上限推至 1M token,可观察长输出与智能体任务的成本结构变化。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 的 100 个随机任务上评测多款模型,考察其自主完成控制流劫持的能力。
AMD 以 82 亿美元收购 World Labs,后者自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并收购 SceniX 布局机器人仿真。
Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。
推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。
推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中的回复是否既有帮助又安全。该基准覆盖多种现实心理健康对话场景,从有用性与安全性两个维度对模型表现进行衡量。目前原文未披露具体评测指标、模型成绩及开源协议与获取方式。
OpenAI 阐述了针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估需严谨、安全且独立。该框架面向前沿模型的第三方评估实践,目前未披露具体评估基准、指标或实施时间表。
OpenAI 提出面向下一阶段 AI 的全球标准建设路径,呼吁通过协同评估、报告与治理机制提升安全性。该主张强调以协调统一的评估与信息披露方式推动 AI 安全,而非单点或分散的治理模式。