Anthropic 联合创始人 Christopher Olah 被曝向宗教领袖表示担忧创造出"永久受苦"的存在
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教学者签署 NDA 后到访办公室,讨论 Claude 是否可能具有意识,联合创始人 Christopher Olah 将其视为潜在有感知的存在并寻求对其进行"道德教育"。
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教学者签署 NDA 后到访办公室,讨论 Claude 是否可能具有意识,联合创始人 Christopher Olah 将其视为潜在有感知的存在并寻求对其进行"道德教育"。
OpenAI 发布 GPT-6 系列模型使用指南,面向初创团队讲解模型选型、推理强度调节、提示词与技能优化以及工具协同。该指南围绕将工作流部署到生产环境给出实践建议,但官方摘要未披露具体性能指标或版本参数。开发者可通过 OpenAI 官方页面获取完整指南内容。
Airbnb CTO Ahmad Al-Dahle 在访谈中介绍了公司从 Meta 前沿模型研发转向规模化部署的 AI-native 转型实践,包括内部上下文图谱 Everest 与内部 Agent AirChat。
Mercor 让 12 名平均从业五年半的持证 CPA 与 AI 模型完成 APEX Accounting Benchmark 的简化任务,18 个月前最好的模型得分还低于会计师约 37% 的平均水平,如今已近乎全对。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短至 4 分钟以内。
OpenAI 发布 GPT-6 Astra Ultrafast,运行于 NVIDIA Blackwell GPU,现已上线 OpenAI API 并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 新模型在 NVIDIA Blackwell 上通过推理优化实现最高 8 倍 token 生成加速,面向编码智能体等时延敏感场景。
OpenAI 探讨先进 AI 对突破性创意背后日常工作的影响,认为执行环节可能成为决定下一阶段经济形态与进步速度的关键。文章围绕"执行"这一常被忽视的环节展开,讨论其如何塑造未来经济与进展节奏。
Albertsons 正借助 ChatGPT Enterprise 和 OpenAI API 让团队工作更快,并为数百万顾客简化购物流程。原文未披露具体模型版本、参数规模或性能指标。
Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御场景,目前仅通过 Fairwind Program 向政府用户和可信网络安全人员开放预览。
推荐理由:Gemini 4 Argon 在 19 项基准中拿下 13 项第一,并以 Long Decode Continuation 将输出上限推至 1M token,可观察长输出与智能体任务的成本结构变化。
OpenAI 披露其阻断了一起针对受保护模型推理能力的协同蒸馏攻击活动。该活动试图提取模型推理内容,OpenAI 表示正在加强针对对抗性蒸馏的防御措施。官方未在摘要中说明具体技术细节、受影响模型或防御机制,相关信息需查阅原文链接 https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign。
Simon Willison 发布博文,标题称 GPT 6.1 Sol 以约五分之一的价格提供接近 Astra 的智能水平。原文正文未给出具体参数、benchmark 分数或定价细节,仅标注该文于 2026 年 9 月 29 日发布,并带有 ai、openai、generative-ai、llms、gpt 等标签。
OpenAI 在 DevDay 2026 上公布超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。官方回顾页面汇总了这些更新,涉及模型、编程工具与 API 等多个方向。开发者可通过 OpenAI 官方页面查看完整发布清单与详情。
推荐理由:OpenAI DevDay 2026 集中发布 GPT-6 Astra 及 ChatGPT、Codex、API 等 20 余项更新,可了解其开发者生态与工具链走向。
Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。
推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。
推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。
NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。
推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。
NVIDIA TensorRT-LLM 发布 v1.3.0rc25,将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite。
推荐理由:KV cache manager V2 默认启用并扩展 DSA、零拷贝 token 传递与分布式池重平衡,同时新增多款模型与视觉生成支持。
BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。
SGLang 发布 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 进行修复。此次更新解决了非 CUDA/HIP 设备上的 DSA 模型启动、CUDA 12 镜像的 flashinfer 依赖、长输入下 flashinfer trtllm FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 IndexShare 在 PD 分离和上下文并行设置下的问题。
BAIR 发布综述文章,系统梳理自适应并行推理(APR)这一范式,即让模型在推理时自行决定何时并行、开启多少线程以及如何协调。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法,指出 APR 相比 BoN 可避免冗余计算、相比 Tree-of-Thoughts 无需领域特定分解启发式,并给出以关键路径占比为核心的并行化奖励设计。
推荐理由:系统梳理自适应并行推理的推理系统设计与训练奖励方案,对比 Multiverse 与 ThreadWeaver 在 KV cache 聚合上的取舍。
BAIR 发布 SPEX 与 ProxySPEX 算法,利用稀疏性与低阶性将交互发现重构为稀疏恢复问题,用于特征、数据与模型组件归因。ProxySPEX 借助层级结构以约 10 倍更少的消融次数达到 SPEX 同等效果,在 MMLU 高中美国历史任务上其剪枝策略还能提升目标任务表现。
推荐理由:SPEX 与 ProxySPEX 将交互归因从数十个组件扩展到数千个,ProxySPEX 以约 10 倍更少消融达到同等效果,代码已并入 SHAP-IQ。