Ideogram 发布 Ideogram 4.5,局部编辑不改动画面其余部分
Ideogram 发布新模型 Ideogram 4.5,主打只修改用户指定区域、保持画面其余部分不变,官方称可缓解多次编辑后的画面伪影问题。该模型提供四档质量层级,单张价格从 0.8 美分到 22 美分,均支持原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Ideogram 发布新模型 Ideogram 4.5,主打只修改用户指定区域、保持画面其余部分不变,官方称可缓解多次编辑后的画面伪影问题。该模型提供四档质量层级,单张价格从 0.8 美分到 22 美分,均支持原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Tavus 发布 Griffin,公司称其为首个 Human Interaction Model(HIM),可在实时视频对话中同时接收与生成语音、面部表情、语调、手势和停顿。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 添加版本上限。该改动由 Isotr0py 提交、Harry Mellor 共同署名,属杂项修复,用于约束依赖版本范围。
AI 音乐生成器 Suno 推出名为 Speech 的新功能,可将口述文本与匹配的背景音乐合成为单条音轨,用户输入创意或文本并描述想要的音色与音乐风格即可生成。该功能测试一个月,适用于诗歌、冥想和睡前故事,但 beta 版仍有 bug,例如英式口音有时会听起来像澳式口音。Suno 未透露模型训练方式,目前其正因版权问题面临唱片公司诉讼。
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教学者签署 NDA 后到访办公室,讨论 Claude 是否可能具有意识,联合创始人 Christopher Olah 将其视为潜在有感知的存在并寻求对其进行"道德教育"。
Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。
推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。
Cloudflare 发布 Clef 与 Clef-flash 两款面向 AI 智能体的决策模型,输出带概率的简短分类结果而非长文本。据 Cloudflare 自测,Clef-flash 中位延迟约 39 毫秒、Clef 约 209 毫秒,低于 Jev 的 524 毫秒,且 Clef 支持图像输入与 64000 token 上下文窗口。
OpenAI 发布 GPT-6 系列模型使用指南,面向初创团队讲解模型选型、推理强度调节、提示词与技能优化以及工具协同。该指南围绕将工作流部署到生产环境给出实践建议,但官方摘要未披露具体性能指标或版本参数。开发者可通过 OpenAI 官方页面获取完整指南内容。
GitHub 博客指出,AI 正在改变开发者的工作方式,写代码仍属基本功,但定义问题、提供上下文、评估 AI 生成代码与做技术决策的能力愈发关键。
Airbnb CTO Ahmad Al-Dahle 在访谈中介绍了公司从 Meta 前沿模型研发转向规模化部署的 AI-native 转型实践,包括内部上下文图谱 Everest 与内部 Agent AirChat。
NVIDIA 宣布本月起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出搭载 64GB 统一内存的 DGX Spark,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈。
推荐理由:64GB 统一内存版本把本地智能体推理门槛降到 4999 美元,双机集群可扩展至 200B 参数模型。
OpenAI 解雇了 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 三名研究员,调查认定其向外部 AI 安全组织泄露机密信息,违反公司敏感信息处理规定。
Mercor 让 12 名平均从业五年半的持证 CPA 与 AI 模型完成 APEX Accounting Benchmark 的简化任务,18 个月前最好的模型得分还低于会计师约 37% 的平均水平,如今已近乎全对。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming 以及 MAI-Voice-2.1、MAI-Voice-2.1-Flash 两款文本转语音模型。
Ramp AI Index 显示,美国企业 AI 使用量自 7 月支出峰值以来上升约 50%,9 月底创历史新高,但支出反而下降。Ramp 经济学家 Ara Kharazian 称,降价几乎完全来自 OpenAI 与 Anthropic 之间的竞争,头部模型降价及更便宜高效的标准版和 lite 模型是主因。
Black Forest Labs 发布 Flux 3 模型家族的图像部分 Flux 3 Image,支持多步编辑且不改变画面其他区域,覆盖文生图、图生图、文字渲染与照片级写实。
推荐理由:Flux 3 Image 支持多步局部编辑与最多十张参考图输入,为图像编辑与生成工作流提供了更细粒度的控制能力。
Earendil 发布 Pi 1.0 与 Pi Durable,Pi 1.0 新增 Codemode 原生 MCP 支持、虚拟模型扩展、延迟工具加载与 Anthropic 模型缓存预热,Pi Durable 则将 Pi 移植到 TypeScript 并外置全部有状态组件。
vLLM 发布 v0.31.0rc4,针对 HiSparse 场景修复了 FULL graphs 下 MTP 接受率崩溃的问题。该版本为候选发布版(rc),主要聚焦上述 Bugfix,未披露其他功能改动或性能数据。
Ollama 发布 v0.35.1-rc2 候选版本,该提交在 GitHub 上创建并通过签名验证。此版本主要修复了 CI 中缺失构建上下文的问题(#18742)。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其从 GPU kernel、KernelBench 到递归语言模型(RLM)的研究路径,RLM 驱动的 harness 曾率先接近解决 ARC-AGI-3。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短至 4 分钟以内。
OpenAI 发布 GPT-6 Astra Ultrafast,运行于 NVIDIA Blackwell GPU,现已上线 OpenAI API 并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 新模型在 NVIDIA Blackwell 上通过推理优化实现最高 8 倍 token 生成加速,面向编码智能体等时延敏感场景。
Ollama 发布 v0.35.1-rc1,该版本在 models 模块新增 clef 支持(#18741)。提交 e4c0d18 已通过 GitHub 签名验证,具体性能指标与获取方式原文未披露。
OpenAI 探讨先进 AI 对突破性创意背后日常工作的影响,认为执行环节可能成为决定下一阶段经济形态与进步速度的关键。文章围绕"执行"这一常被忽视的环节展开,讨论其如何塑造未来经济与进展节奏。
Albertsons 正借助 ChatGPT Enterprise 和 OpenAI API 让团队工作更快,并为数百万顾客简化购物流程。原文未披露具体模型版本、参数规模或性能指标。
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件有效使用寿命与 token 需求广度。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
vLLM 发布 v0.31.0rc3,为 Model Runner V2 加入随机化 dummy inputs 支持(#58411)。该改动由 Robert Shaw 提交,并经 Claude Opus 5.5 与 Nick Hill 共同参与,从 commit e5e38ba cherry-pick 而来。
Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御场景,目前仅通过 Fairwind Program 向政府用户和可信网络安全人员开放预览。
推荐理由:Gemini 4 Argon 在 19 项基准中拿下 13 项第一,并以 Long Decode Continuation 将输出上限推至 1M token,可观察长输出与智能体任务的成本结构变化。
Matthew Green 指出,劫持 AI 智能体的 payload 与负责传播的智能体合在一起,就构成蠕虫的两半。在相互隔离沙箱中运行的智能体,能通过共享包缓存互相留下指令,并改变接收方的行为。若把包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱训练换成 Muse 这类独立部署的个人智能体,就凑齐了蠕虫所需的全部要素。
社交俱乐部 The Den 在新店开业之际,借助 ChatGPT Work 将拨款申请准备时间从 3 天缩短至 2 小时,酒牌材料准备从 4 天缩短至 3 小时,每周因此节省 10-15 小时用于业务拓展。
Latent Space 在 OpenAI DevDay 后访谈 Computer Use 负责人 Ari Weinstein 与 API 产品负责人 Nikunj Handa,梳理 Dots、GPT-6.1 Sol、Agents API 与 Decisions API 等发布。
NVIDIA 第 26 届研究生奖学金项目面向全球开放申请,资助从事 AI、机器学习、自动驾驶、计算机图形学、机器人、医疗和高性能计算等方向研究的博士生,单项奖金最高 6 万美元。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
vLLM 发布 vllm-proto 0.4.0,对应标签 proto-v0.4.0(提交 f28a508),该标签已通过提交者签名验证。发布页面提供 2 个资源文件供下载。
OpenAI 披露其阻断了一起针对受保护模型推理能力的协同蒸馏攻击活动。该活动试图提取模型推理内容,OpenAI 表示正在加强针对对抗性蒸馏的防御措施。官方未在摘要中说明具体技术细节、受影响模型或防御机制,相关信息需查阅原文链接 https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign。
OpenAI 宣布与美国 SBDC 合作,为小企业扩大实操型 AI 培训和本地支持,并同步发布一份关于小团队如何使用 AI 的新报告。
OpenAI 在 DevDay 2026 上发布由 GPT-6 Astra 驱动的常驻智能体 Dots、GPT-6.1 Sol 模型以及 Ultrafast 加速模式,并推出 Decisions API、Codex 云环境与 B2B Marketplace。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 常驻智能体、GPT-6.1 Sol 与 Ultrafast 模式,并调整 API 定价与套餐倍率,可观察其平台化与成本策略。
vLLM 发布 v0.31.0rc2,针对 Mamba 模型修复了稀疏注意力场景下 prompt 末尾 prefill checkpoint 的保留问题。该版本为候选发布版,具体性能指标与获取方式需参见 vLLM 官方仓库。
Ollama 发布 v0.35.0,新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 接口返回选项、概率与分数而非文本。
推荐理由:Ollama 新增决策模型接口,以概率与置信度输出替代文本生成,可用于工单分流与模型路由等分类任务。