跳到正文

#Agent

今日 4 条
今天10月3日周六
10月2日周五
10月1日周四
  1. Simon Willison · AI Weblog42

    Matthew Green:沙箱隔离足以遏制失控 AI 智能体吗?

    Matthew Green 指出,劫持 AI 智能体的 payload 与负责传播的智能体合在一起,就构成蠕虫的两半。在相互隔离沙箱中运行的智能体,能通过共享包缓存互相留下指令,并改变接收方的行为。若把包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱训练换成 Muse 这类独立部署的个人智能体,就凑齐了蠕虫所需的全部要素。

9月30日周三
  1. NVIDIA Technical Blog62

    CoreWeave 上线 NVIDIA Vera Rubin NVL72 与 Vera CPU,并推出 CoreWeave Forge

    CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。

  2. Latent Space88

    OpenAI DevDay 2026 发布 Dots 智能体、GPT-6.1 Sol 与 Ultrafast 模式

    OpenAI 在 DevDay 2026 上发布由 GPT-6 Astra 驱动的常驻智能体 Dots、GPT-6.1 Sol 模型以及 Ultrafast 加速模式,并推出 Decisions API、Codex 云环境与 B2B Marketplace。

    推荐理由:OpenAI DevDay 2026 集中发布 Dots 常驻智能体、GPT-6.1 Sol 与 Ultrafast 模式,并调整 API 定价与套餐倍率,可观察其平台化与成本策略。

9月29日周二
  1. Simon Willison · AI Weblog88

    OpenAI DevDay 2026 实录:发布 Dots 智能体、GPT-6.1 Sol 与 Ultrafast 推理

    OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。

    推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。

  2. Latent Space82

    AINews 汇总:Claude Opus 5.5 领跑 SimpleBench,GPT-6 与 Gemini 3.8 Flash 同期发布

    Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。

    推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。

  3. Simon Willison · AI Weblog22

    OpenAI 智能体安全负责人谈 AI 能力突跳带来的安全挑战

    OpenAI 智能体安全(Agent Security)负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上出现的能力突跳令其团队感到意外,且这种跳变速度极快,构成了极难应对的问题。他强调安全态势需要时间积累,不只是加固系统,还要把安全文化植入公司,让人员、流程与事件响应机制本身具备应对意外的韧性。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML38

    GitHub 博文:当聊天是错误 UI 时,用 GitHub Copilot canvas 替代对话框

    GitHub 博文提出,聊天框并非与 LLM 交互的最佳界面,多数任务更适合可定制 UI。GitHub Copilot app 中的 canvas 是运行在应用内的全栈小程序,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免把 agent 本身当工具而浪费 token。

  2. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试流程

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。

    推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。

9月24日周四
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub 播客拆解五大 AI 热门观点:代码审查、RAG、Skills 与 MCP

    GitHub 播客最新一期拆解了五个 AI 热门观点:AI 生成代码仍需审查、Skills 并未取代 MCP、RAG 也未消亡、企业招聘更看重 AI 使用判断力、微调需求未必说明代码质量差。节目指出 MCP 提供工具与数据的标准接入方式,Skills 则以 Markdown 封装团队流程与最佳实践,二者可组合使用;RAG 通过检索外部信息减少 token 消耗并降低答案不完整的概率。

9月17日周四
9月12日周六
7月26日周日
  1. Berkeley AI Research (BAIR)62

    BAIR 提出 ABBEL:用自然语言信念状态实现高效长程交互

    BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。

    推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。

7月7日周二
4月20日周一
  1. Berkeley AI Research (BAIR)71

    BAIR 提出 GRASP:面向世界模型的并行随机梯度规划器

    BAIR 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化,并对状态迭代注入高斯噪声以增强探索。在 Push-T 任务上,GRASP 在 H=80 时成功率达 10.4%、中位耗时 58.9s,优于 CEM、GD 与 LatCo 等基线。论文已发布于 arXiv(编号 2602.00475),可通过 arXiv 页面或项目网站获取全文与更多细节。

    推荐理由:提出提升状态配点与动作梯度分离的规划器,在长时域 Push-T 任务上兼顾成功率与求解速度。