跳到正文

Anthropic / Claude

Anthropic 官方动态:Claude 系列模型发布、技术报告与前沿安全对齐研究。

最新精选

第 1–4 条 · 共 4 条
10月1日周四
  1. Latent Space88

    Google DeepMind 发布 Gemini 4 Argon,输出上限提升至 1M token

    Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御场景,目前仅通过 Fairwind Program 向政府用户和可信网络安全人员开放预览。

    推荐理由:Gemini 4 Argon 在 19 项基准中拿下 13 项第一,并以 Long Decode Continuation 将输出上限推至 1M token,可观察长输出与智能体任务的成本结构变化。

9月29日周二
  1. Latent Space82

    AINews 汇总:Claude Opus 5.5 领跑 SimpleBench,GPT-6 与 Gemini 3.8 Flash 同期发布

    Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。

    推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。

  2. Simon Willison · AI Weblog82

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。

    推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。

9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试流程

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。

    推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。