跳到正文

#多模态

今日 4 条
今天10月3日周六
  1. The Decoder65

    Ideogram 发布 Ideogram 4.5,局部编辑不改动画面其余部分

    Ideogram 发布新模型 Ideogram 4.5,主打只修改用户指定区域、保持画面其余部分不变,官方称可缓解多次编辑后的画面伪影问题。该模型提供四档质量层级,单张价格从 0.8 美分到 22 美分,均支持原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。

  2. The Decoder40

    Suno 新增 Speech 功能,可生成带背景音乐的语音

    AI 音乐生成器 Suno 推出名为 Speech 的新功能,可将口述文本与匹配的背景音乐合成为单条音轨,用户输入创意或文本并描述想要的音色与音乐风格即可生成。该功能测试一个月,适用于诗歌、冥想和睡前故事,但 beta 版仍有 bug,例如英式口音有时会听起来像澳式口音。Suno 未透露模型训练方式,目前其正因版权问题面临唱片公司诉讼。

  3. Ollama Releases62

    Ollama v0.35.1 发布,支持 Cloudflare Clef 决策模型与多模态输入

    Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。

    推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。

10月2日周五
9月30日周三
  1. Latent Space88

    OpenAI DevDay 2026 发布 Dots 智能体、GPT-6.1 Sol 与 Ultrafast 模式

    OpenAI 在 DevDay 2026 上发布由 GPT-6 Astra 驱动的常驻智能体 Dots、GPT-6.1 Sol 模型以及 Ultrafast 加速模式,并推出 Decisions API、Codex 云环境与 B2B Marketplace。

    推荐理由:OpenAI DevDay 2026 集中发布 Dots 常驻智能体、GPT-6.1 Sol 与 Ultrafast 模式,并调整 API 定价与套餐倍率,可观察其平台化与成本策略。

9月29日周二
  1. Simon Willison · AI Weblog88

    OpenAI DevDay 2026 实录:发布 Dots 智能体、GPT-6.1 Sol 与 Ultrafast 推理

    OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。

    推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。

9月24日周四
  1. NVIDIA Technical Blog62

    NVIDIA 联合 Google DeepMind 开源 2800 余种病毒蛋白复合物预测结构

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。

    推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。

9月18日周五
  1. TensorRT-LLM Releases62

    TensorRT-LLM v1.3.0rc27 发布,新增 MiniMax-H3 与 Nemotron 3.5 Super VL 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。

    推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。

9月9日周三
  1. TensorRT-LLM Releases62

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 与 NVFP4 KV cache 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。

    推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。

8月25日周二
7月25日周六
  1. SGLang Releases78

    SGLang v0.5.16 发布,新增 DSpark 投机解码与 Inkling 模型支持

    SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。

    推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。

1月10日周六
  1. Berkeley AI Research (BAIR)66

    BAIR 提出 IDEAL:以互信息驱动成像系统设计

    BAIR 在 NeurIPS 2025 论文中提出基于互信息的成像系统评估与优化框架 IDEAL,仅用带噪测量和噪声模型即可量化测量对物体的区分能力。该方法在彩色摄影、射电天文、无透镜成像与显微成像四个领域验证了信息估计对解码性能的预测能力,IDEAL 优化出的滤色片设计在信息量与重建质量上匹配端到端优化,同时减少内存与算力开销且无需任务专用解码器。

    推荐理由:该框架以互信息直接评估成像系统信息量,无需解码器即可预测下游任务表现并优化硬件参数。