Ideogram 发布 Ideogram 4.5,局部编辑不改动画面其余部分
Ideogram 发布新模型 Ideogram 4.5,主打只修改用户指定区域、保持画面其余部分不变,官方称可缓解多次编辑后的画面伪影问题。该模型提供四档质量层级,单张价格从 0.8 美分到 22 美分,均支持原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Ideogram 发布新模型 Ideogram 4.5,主打只修改用户指定区域、保持画面其余部分不变,官方称可缓解多次编辑后的画面伪影问题。该模型提供四档质量层级,单张价格从 0.8 美分到 22 美分,均支持原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Tavus 发布 Griffin,公司称其为首个 Human Interaction Model(HIM),可在实时视频对话中同时接收与生成语音、面部表情、语调、手势和停顿。
AI 音乐生成器 Suno 推出名为 Speech 的新功能,可将口述文本与匹配的背景音乐合成为单条音轨,用户输入创意或文本并描述想要的音色与音乐风格即可生成。该功能测试一个月,适用于诗歌、冥想和睡前故事,但 beta 版仍有 bug,例如英式口音有时会听起来像澳式口音。Suno 未透露模型训练方式,目前其正因版权问题面临唱片公司诉讼。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming 以及 MAI-Voice-2.1、MAI-Voice-2.1-Flash 两款文本转语音模型。
Black Forest Labs 发布 Flux 3 模型家族的图像部分 Flux 3 Image,支持多步编辑且不改变画面其他区域,覆盖文生图、图生图、文字渲染与照片级写实。
推荐理由:Flux 3 Image 支持多步局部编辑与最多十张参考图输入,为图像编辑与生成工作流提供了更细粒度的控制能力。
OpenAI 在 DevDay 2026 上发布由 GPT-6 Astra 驱动的常驻智能体 Dots、GPT-6.1 Sol 模型以及 Ultrafast 加速模式,并推出 Decisions API、Codex 云环境与 B2B Marketplace。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 常驻智能体、GPT-6.1 Sol 与 Ultrafast 模式,并调整 API 定价与套餐倍率,可观察其平台化与成本策略。
OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。
AMD 以 82 亿美元收购 World Labs,后者自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并收购 SceniX 布局机器人仿真。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。
invideo 利用 GPT-6 Astra 以更高精度规划剪辑,将色彩校正与调色效率提升 3 倍,并在一天内生成 50 个自定义特效。
Higgsfield AI 借助 GPT-6 Astra,一天内完成新视频功能的上线,让小型企业更轻松地制作视频广告,并更快将新创意工具推向市场。
OpenAI 发布 ChatGPT Images 2.5,可将创意、草图与参考照片转化为更个性化、更精致的图像。该版本在图像生成上更贴合用户原始构想,官方称其输出更能反映用户的想法。目前官方仅提供简要说明,开发者与用户可通过 OpenAI 官网页面了解详情。
推荐理由:OpenAI 更新 ChatGPT 图像生成能力,支持从草图与参考照片生成更贴合个人意图的成品图像。