Tavus 推出 Griffin 人机交互模型,48% 测试者误认为真人
Tavus 发布 Griffin,公司称其为首个 Human Interaction Model(HIM),可在实时视频对话中同时接收与生成语音、面部表情、语调、手势和停顿。
Tavus 发布 Griffin,公司称其为首个 Human Interaction Model(HIM),可在实时视频对话中同时接收与生成语音、面部表情、语调、手势和停顿。
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教学者签署 NDA 后到访办公室,讨论 Claude 是否可能具有意识,联合创始人 Christopher Olah 将其视为潜在有感知的存在并寻求对其进行"道德教育"。
Cloudflare 发布 Clef 与 Clef-flash 两款面向 AI 智能体的决策模型,输出带概率的简短分类结果而非长文本。据 Cloudflare 自测,Clef-flash 中位延迟约 39 毫秒、Clef 约 209 毫秒,低于 Jev 的 524 毫秒,且 Clef 支持图像输入与 64000 token 上下文窗口。
OpenAI 发布 GPT-6 系列模型使用指南,面向初创团队讲解模型选型、推理强度调节、提示词与技能优化以及工具协同。该指南围绕将工作流部署到生产环境给出实践建议,但官方摘要未披露具体性能指标或版本参数。开发者可通过 OpenAI 官方页面获取完整指南内容。
GitHub 博客指出,AI 正在改变开发者的工作方式,写代码仍属基本功,但定义问题、提供上下文、评估 AI 生成代码与做技术决策的能力愈发关键。
Airbnb CTO Ahmad Al-Dahle 在访谈中介绍了公司从 Meta 前沿模型研发转向规模化部署的 AI-native 转型实践,包括内部上下文图谱 Everest 与内部 Agent AirChat。
OpenAI 解雇了 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 三名研究员,调查认定其向外部 AI 安全组织泄露机密信息,违反公司敏感信息处理规定。
Earendil 发布 Pi 1.0 与 Pi Durable,Pi 1.0 新增 Codemode 原生 MCP 支持、虚拟模型扩展、延迟工具加载与 Anthropic 模型缓存预热,Pi Durable 则将 Pi 移植到 TypeScript 并外置全部有状态组件。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其从 GPU kernel、KernelBench 到递归语言模型(RLM)的研究路径,RLM 驱动的 harness 曾率先接近解决 ARC-AGI-3。
Matthew Green 指出,劫持 AI 智能体的 payload 与负责传播的智能体合在一起,就构成蠕虫的两半。在相互隔离沙箱中运行的智能体,能通过共享包缓存互相留下指令,并改变接收方的行为。若把包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱训练换成 Muse 这类独立部署的个人智能体,就凑齐了蠕虫所需的全部要素。
Latent Space 在 OpenAI DevDay 后访谈 Computer Use 负责人 Ari Weinstein 与 API 产品负责人 Nikunj Handa,梳理 Dots、GPT-6.1 Sol、Agents API 与 Decisions API 等发布。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
OpenAI 在 DevDay 2026 上发布由 GPT-6 Astra 驱动的常驻智能体 Dots、GPT-6.1 Sol 模型以及 Ultrafast 加速模式,并推出 Decisions API、Codex 云环境与 B2B Marketplace。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 常驻智能体、GPT-6.1 Sol 与 Ultrafast 模式,并调整 API 定价与套餐倍率,可观察其平台化与成本策略。
OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。
Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。
推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。
OpenAI 智能体安全(Agent Security)负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上出现的能力突跳令其团队感到意外,且这种跳变速度极快,构成了极难应对的问题。他强调安全态势需要时间积累,不只是加固系统,还要把安全文化植入公司,让人员、流程与事件响应机制本身具备应对意外的韧性。
GitHub Copilot 应用推出 canvas(画布扩展)功能,这是一种由用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘。
GitHub 博文提出,聊天框并非与 LLM 交互的最佳界面,多数任务更适合可定制 UI。GitHub Copilot app 中的 canvas 是运行在应用内的全栈小程序,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免把 agent 本身当工具而浪费 token。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。
推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论对话带来的渲染压力。其测试的最大开源 PR 包含 2,200 个文件、超 100 万行改动和 400 多条行内评论,方案将文档高度拆分为确定性的代码几何与按需测量的动态块几何,避免滚动跳变。
GitHub 播客最新一期拆解了五个 AI 热门观点:AI 生成代码仍需审查、Skills 并未取代 MCP、RAG 也未消亡、企业招聘更看重 AI 使用判断力、微调需求未必说明代码质量差。节目指出 MCP 提供工具与数据的标准接入方式,Skills 则以 Markdown 封装团队流程与最佳实践,二者可组合使用;RAG 通过检索外部信息减少 token 消耗并降低答案不完整的概率。
GitHub 官方披露将 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,横跨 128 个 PR 并增量上线。
推荐理由:GitHub 官方复盘将 Copilot agent runtime 从 TypeScript 迁移到 80 万行 Rust 的工程路径,含跨语言 FFI 与多智能体协作细节。
GitHub 日本和韩国区营销负责人把活动运营流程写成 runbook 交给 GitHub Copilot,用对话方式生成自动化,让活动从单个 GitHub Issue 自动完成搭建、每日筛选报名者并在结束后清理。
BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。
UC Berkeley EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出智能体时代数据系统面临面向智能体、承载智能体、由智能体构建三类新挑战。
推荐理由:从推理成本骤降出发,系统梳理智能体作为数据系统新负载带来的三类研究议题与工程改造方向。
BAIR 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化,并对状态迭代注入高斯噪声以增强探索。在 Push-T 任务上,GRASP 在 H=80 时成功率达 10.4%、中位耗时 58.9s,优于 CEM、GD 与 LatCo 等基线。论文已发布于 arXiv(编号 2602.00475),可通过 arXiv 页面或项目网站获取全文与更多细节。
推荐理由:提出提升状态配点与动作梯度分离的规划器,在长时域 Push-T 任务上兼顾成功率与求解速度。