跳到正文

#基准评测

今日 1 条
今天10月3日周六
10月2日周五
10月1日周四
  1. Latent Space88

    Google DeepMind 发布 Gemini 4 Argon,输出上限提升至 1M token

    Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御场景,目前仅通过 Fairwind Program 向政府用户和可信网络安全人员开放预览。

    推荐理由:Gemini 4 Argon 在 19 项基准中拿下 13 项第一,并以 Long Decode Continuation 将输出上限推至 1M token,可观察长输出与智能体任务的成本结构变化。

9月30日周三
  1. NVIDIA Technical Blog62

    CoreWeave 上线 NVIDIA Vera Rubin NVL72 与 Vera CPU,并推出 CoreWeave Forge

    CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。

9月29日周二
  1. Latent Space82

    AINews 汇总:Claude Opus 5.5 领跑 SimpleBench,GPT-6 与 Gemini 3.8 Flash 同期发布

    Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。

    推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。

  2. Simon Willison · AI Weblog82

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。

    推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。

9月24日周四
  1. NVIDIA Technical Blog62

    NVIDIA 联合 Google DeepMind 开源 2800 余种病毒蛋白复合物预测结构

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。

    推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。

9月23日周三
  1. OpenAI News42

    OpenAI 发布 MentalHealthBench:面向心理健康对话的 AI 评测基准

    OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中的回复是否既有帮助又安全。该基准覆盖多种现实心理健康对话场景,从有用性与安全性两个维度对模型表现进行衡量。目前原文未披露具体评测指标、模型成绩及开源协议与获取方式。

9月22日周二
9月21日周一