Ollama v0.35.1 发布,支持 Cloudflare Clef 决策模型与多模态输入
Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。
推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。
视觉理解、视频生成、语音全双工交互等多模态对齐新范式与突破。
Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。
推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。
Black Forest Labs 发布 Flux 3 模型家族的图像部分 Flux 3 Image,支持多步编辑且不改变画面其他区域,覆盖文生图、图生图、文字渲染与照片级写实。
推荐理由:Flux 3 Image 支持多步局部编辑与最多十张参考图输入,为图像编辑与生成工作流提供了更细粒度的控制能力。
OpenAI 在 DevDay 2026 上发布由 GPT-6 Astra 驱动的常驻智能体 Dots、GPT-6.1 Sol 模型以及 Ultrafast 加速模式,并推出 Decisions API、Codex 云环境与 B2B Marketplace。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 常驻智能体、GPT-6.1 Sol 与 Ultrafast 模式,并调整 API 定价与套餐倍率,可观察其平台化与成本策略。
OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。
NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。
推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。
NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。
推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。
SGLang 发布 v0.5.18,包含 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3 等模型支持。
推荐理由:该版本通过启动阶段权重加载与 CUDA graph 捕获重叠、TP LMHead all-to-all 等改动,缩短了服务冷启动与解码延迟。
SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。
推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。
BAIR 在 NeurIPS 2025 论文中提出基于互信息的成像系统评估与优化框架 IDEAL,仅用带噪测量和噪声模型即可量化测量对物体的区分能力。该方法在彩色摄影、射电天文、无透镜成像与显微成像四个领域验证了信息估计对解码性能的预测能力,IDEAL 优化出的滤色片设计在信息量与重建质量上匹配端到端优化,同时减少内存与算力开销且无需任务专用解码器。
推荐理由:该框架以互信息直接评估成像系统信息量,无需解码器即可预测下游任务表现并优化硬件参数。