Anthropic 红队评测:GLM-5.3 与 Claude Mythos Preview 的二进制漏洞利用能力
Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 的 100 个随机任务上评测多款模型,考察其自主完成控制流劫持的能力。
Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 的 100 个随机任务上评测多款模型,考察其自主完成控制流劫持的能力。
Simon Willison 发布博文,标题称 GPT 6.1 Sol 以约五分之一的价格提供接近 Astra 的智能水平。原文正文未给出具体参数、benchmark 分数或定价细节,仅标注该文于 2026 年 9 月 29 日发布,并带有 ai、openai、generative-ai、llms、gpt 等标签。
Ollama 发布 v0.35.1-rc0,为 Modelfile 新增 CAPABILITY 声明,并在 create 请求中加入可叠加的 capabilities 字段,该声明可在 GGUF 与 safetensors 的创建、继承及 Modelfile 导出过程中保留。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别并模糊照片中的人脸。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全部处理在本地完成。
OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。
NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。
推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。
OpenAI 在 DevDay 2026 上公布超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。官方回顾页面汇总了这些更新,涉及模型、编程工具与 API 等多个方向。开发者可通过 OpenAI 官方页面查看完整发布清单与详情。
推荐理由:OpenAI DevDay 2026 集中发布 GPT-6 Astra 及 ChatGPT、Codex、API 等 20 余项更新,可了解其开发者生态与工具链走向。
AMD 以 82 亿美元收购 World Labs,后者自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并收购 SceniX 布局机器人仿真。
Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。
推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。
推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。
Ollama 发布 v0.35.0-rc1。该版本为 mlx 的拉取停滞重试设置上限,并允许看门狗中断这些重试(#1…)。版本已在 GitHub 打标签,提交 cc40693 通过签名验证。
Ollama 发布 v0.35.0-rc0,新增 System One 评分 API(#18606)。该版本为候选发布版,提交 ffb6f22 已通过 GitHub 签名验证。
OpenAI 智能体安全(Agent Security)负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上出现的能力突跳令其团队感到意外,且这种跳变速度极快,构成了极难应对的问题。他强调安全态势需要时间积累,不只是加固系统,还要把安全文化植入公司,让人员、流程与事件响应机制本身具备应对意外的韧性。
GitHub Copilot 应用推出 canvas(画布扩展)功能,这是一种由用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘。
Ollama 发布 v0.40.0-rc0 预发布版本,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 执行。该版本通过 ollama pull qwen3.8 与 ollama run qwen3.8 即可拉取并运行对应模型,预发布期间还将测试并启用更多模型。
推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,为本地模型推理提供新的执行后端路径。
GitHub 博文提出,聊天框并非与 LLM 交互的最佳界面,多数任务更适合可定制 UI。GitHub Copilot app 中的 canvas 是运行在应用内的全栈小程序,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免把 agent 本身当工具而浪费 token。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。
推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。
Remedy Entertainment 的 CONTROL Resonant 在发售当日加入 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR,无需 100GB 本地安装。
Ollama 发布 v0.34.4,思考模型的结构化输出改为单次处理,速度更快、更可靠。该版本修复了本地模型库较大时偶发的“model not found”错误。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论对话带来的渲染压力。其测试的最大开源 PR 包含 2,200 个文件、超 100 万行改动和 400 多条行内评论,方案将文档高度拆分为确定性的代码几何与按需测量的动态块几何,避免滚动跳变。
vLLM 发布 v0.30.1rc0,在 ROCm 平台新增 MI355 密集 NVFP4 支持及 MoRI kernel 镜像。该版本由 Andreas Karatzas 提交,OpenAI Codex 参与共同署名,相关改动已合入 CI 流程。
NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。
推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。
推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。
SGLang 发布 v0.5.20,合并 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next 等模型支持,并引入统一基数树分支点缓存、采样掩码与 CPU 模拟器。
推荐理由:该版本通过统一基数树分支点缓存与采样掩码重叠调度,在长上下文与RL rollout场景下显著降低TTFT并提升解码吞吐。
GitHub 播客最新一期拆解了五个 AI 热门观点:AI 生成代码仍需审查、Skills 并未取代 MCP、RAG 也未消亡、企业招聘更看重 AI 使用判断力、微调需求未必说明代码质量差。节目指出 MCP 提供工具与数据的标准接入方式,Skills 则以 Markdown 封装团队流程与最佳实践,二者可组合使用;RAG 通过检索外部信息减少 token 消耗并降低答案不完整的概率。
NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。
推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。
GitHub 官方披露将 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,横跨 128 个 PR 并增量上线。
推荐理由:GitHub 官方复盘将 Copilot agent runtime 从 TypeScript 迁移到 80 万行 Rust 的工程路径,含跨语言 FFI 与多智能体协作细节。
GitHub 日本和韩国区营销负责人把活动运营流程写成 runbook 交给 GitHub Copilot,用对话方式生成自动化,让活动从单个 GitHub Issue 自动完成搭建、每日筛选报名者并在结束后清理。
NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。
推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。
SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。
推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。
NVIDIA TensorRT-LLM 发布 v1.3.0rc25,将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite。
推荐理由:KV cache manager V2 默认启用并扩展 DSA、零拷贝 token 传递与分布式池重平衡,同时新增多款模型与视觉生成支持。
SGLang 发布 v0.5.18,包含 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3 等模型支持。
推荐理由:该版本通过启动阶段权重加载与 CUDA graph 捕获重叠、TP LMHead all-to-all 等改动,缩短了服务冷启动与解码延迟。
SGLang 发布 v0.5.17,包含 194 位贡献者的 582 个 PR,新增 Kimi K3 与 MiniMax-H3 的 day-0 支持,并引入 Rust 前端与 DCP 通信后端。
推荐理由:该版本为 Kimi K3 与 MiniMax-H3 提供 day-0 推理支持,并新增 DWDP MoE 预填充并行与权重加载优化,可显著降低大模型部署的显存与加载开销。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。
推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。
BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。
SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。
推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。
SGLang 发布 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 进行修复。此次更新解决了非 CUDA/HIP 设备上的 DSA 模型启动、CUDA 12 镜像的 flashinfer 依赖、长输入下 flashinfer trtllm FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 IndexShare 在 PD 分离和上下文并行设置下的问题。
SGLang 发布 v0.5.15,针对 Blackwell 平台调优 GLM-5.2 NVFP4 生产推理,并默认启用 Spec V2 零开销调度与 Breakable CUDA Graph 捕获路径。
推荐理由:该版本针对 GLM-5.2 NVFP4 与 DeepSeek-V4 优化生产推理,并默认启用 Spec V2 与 Breakable CUDA Graph,降低调度与内核启动开销。
UC Berkeley EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出智能体时代数据系统面临面向智能体、承载智能体、由智能体构建三类新挑战。
推荐理由:从推理成本骤降出发,系统梳理智能体作为数据系统新负载带来的三类研究议题与工程改造方向。