Cloudflare 发布 Clef 与 Clef-flash 决策模型,兼容 Jev API
Cloudflare 发布 Clef 与 Clef-flash 两款面向 AI 智能体的决策模型,输出带概率的简短分类结果而非长文本。据 Cloudflare 自测,Clef-flash 中位延迟约 39 毫秒、Clef 约 209 毫秒,低于 Jev 的 524 毫秒,且 Clef 支持图像输入与 64000 token 上下文窗口。
Cloudflare 发布 Clef 与 Clef-flash 两款面向 AI 智能体的决策模型,输出带概率的简短分类结果而非长文本。据 Cloudflare 自测,Clef-flash 中位延迟约 39 毫秒、Clef 约 209 毫秒,低于 Jev 的 524 毫秒,且 Clef 支持图像输入与 64000 token 上下文窗口。
Mercor 让 12 名平均从业五年半的持证 CPA 与 AI 模型完成 APEX Accounting Benchmark 的简化任务,18 个月前最好的模型得分还低于会计师约 37% 的平均水平,如今已近乎全对。
Ramp AI Index 显示,美国企业 AI 使用量自 7 月支出峰值以来上升约 50%,9 月底创历史新高,但支出反而下降。Ramp 经济学家 Ara Kharazian 称,降价几乎完全来自 OpenAI 与 Anthropic 之间的竞争,头部模型降价及更便宜高效的标准版和 lite 模型是主因。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其从 GPU kernel、KernelBench 到递归语言模型(RLM)的研究路径,RLM 驱动的 harness 曾率先接近解决 ARC-AGI-3。
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件有效使用寿命与 token 需求广度。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御场景,目前仅通过 Fairwind Program 向政府用户和可信网络安全人员开放预览。
推荐理由:Gemini 4 Argon 在 19 项基准中拿下 13 项第一,并以 Long Decode Continuation 将输出上限推至 1M token,可观察长输出与智能体任务的成本结构变化。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 的 100 个随机任务上评测多款模型,考察其自主完成控制流劫持的能力。
AMD 以 82 亿美元收购 World Labs,后者自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并收购 SceniX 布局机器人仿真。
Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。
推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。
推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。
推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。
BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。
UC Berkeley EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出智能体时代数据系统面临面向智能体、承载智能体、由智能体构建三类新挑战。
推荐理由:从推理成本骤降出发,系统梳理智能体作为数据系统新负载带来的三类研究议题与工程改造方向。
BAIR 发布 SPEX 与 ProxySPEX 算法,利用稀疏性与低阶性将交互发现重构为稀疏恢复问题,用于特征、数据与模型组件归因。ProxySPEX 借助层级结构以约 10 倍更少的消融次数达到 SPEX 同等效果,在 MMLU 高中美国历史任务上其剪枝策略还能提升目标任务表现。
推荐理由:SPEX 与 ProxySPEX 将交互归因从数十个组件扩展到数千个,ProxySPEX 以约 10 倍更少消融达到同等效果,代码已并入 SHAP-IQ。