Microsoft 发布 MAI-Image-2.6 及 MAI-Image-2.6-Flash 图像模型
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,并面向 Microsoft Foundry 开发者推出低延迟版本 MAI-Image-2.6-Flash。
推荐理由:原文来自官方发布,给出排名、速度和价格效率数据,读者可据此评估两个版本在生产场景中的取舍。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
当前仅显示精选新闻Microsoft 于 9 月 4 日发布 MAI-Image-2.6,并面向 Microsoft Foundry 开发者推出低延迟版本 MAI-Image-2.6-Flash。
推荐理由:原文来自官方发布,给出排名、速度和价格效率数据,读者可据此评估两个版本在生产场景中的取舍。
inclusionAI 发布 LLaDA-Image 系列统一图像生成与编辑模型,包含 50 步 Base 版和 4 步蒸馏 Turbo 版,均为 6B 参数,并同步开放权重与 Diffusers 推理代码。
推荐理由:开源了 6B 参数统一图像生成与编辑模型,Base 与 4 步蒸馏 Turbo 两个版本都放出了权重和推理代码。
inclusionAI 发布 LLaDA-Image,一个 6B 参数的开源统一图像生成与编辑模型家族,包含 50 步的 Base 版和 4 步蒸馏的 Turbo 版。
推荐理由:官方放出 6B 统一生成与编辑模型的权重与推理代码,并公开了从纯图像预训练到联合训练的开源路线。
inclusionAI 开源 LLaDA-Image 图像生成与编辑模型家族,包含 50 步 Base 与 4 步 Turbo 两个 6B 参数版本,并发布检查点和基于 Diffusers 的推理代码。
推荐理由:开源模型同时提供 50 步 Base 与 4 步 Turbo 版本,读者可据此判断快速生成与高保真生成之间的取舍。
inclusionAI 发布并开源 LLaDA-Image 系列统一图像生成与编辑模型,包含 50 步的 Base 与 4 步蒸馏的 Turbo 两个变体,均为 6B 参数,同时提供 BF16 与 FP8 权重。
推荐理由:6B 参数单权重同时支持文生图与指令编辑,训练配方与推理代码一并开源,便于复现和二次开发。
Meta 的 Muse Image 在 Artificial Analysis 图像编辑榜首次入榜排第 4,文生图榜排第 5,并进入质量与价格 Pareto 前沿。
推荐理由:榜单给出 Muse Image 与 GPT Image 2、Nano Banana 2 的同场排名对照,读者可了解其图像编辑与文生图位置。
OpenRouter 发布 Visual Image Benchmarks,帮助用户评估其平台上的 39 个图像模型(截至 2026 年 8 月)。挑战提示词分七类:不太可能的场景、计数、文字、空间关系、否定、编辑和一致性,结果以网格展示并支持按价格和生成时间排序。视频和音频等更多模态的评估即将推出,用户也可通过 OpenRouter API 或 Chat 试用模型。
推荐理由:原文给出七类挑战提示词和按价格与生成时间排序的结果网格,读者可直接用它对比 39 个图像模型的真实能力。
推荐理由:榜单给出了 Qwen 新一代与自家前代及其他头部图像模型的 Elo 对比,可据此判断这次升级的幅度。
a16z 作者 Olivia Moore 用 ChatGPT 生成形象、Minimax 3 与 Grok Imagine 1.5 等模型制作虚拟网红 Janie,让她参加阿拉巴马大学 Bama Rush,成本为每天30分钟和100美元额度。
推荐理由:作者用每天30分钟和100美元额度造出AI网红跑完Bama Rush,读者能看到观众识破AI与披露争议的完整过程。
xAI 宣布 Grok Imagine Video 1.5 已在 Imagine API 全面开放,同时在 grok.com/imagine 及 iOS、Android 应用上线 Video 1.5 Fast。
推荐理由:官方逐项对比了音频、运动物理与生成速度的变化,可据此判断图生视频在实际创作中的可用程度。
xAI 发布代号 Aurora 的图像生成模型,随 Grok Imagine API 一同上线,覆盖图像生成、图像编辑以及视频生成与视频编辑。Aurora 是自回归 MoE 网络,通过预测交错文本与图像数据中的下一个 token 训练,使用数十亿互联网样本,原生支持多模态输入并可直接编辑用户提供的图片。新能力已在 𝕏 平台面向部分国家开放,并将在约一周内推送给全部用户。
推荐理由:官方给出 Aurora 的架构思路与多模态输入能力,可据此判断 Grok 图像生成在文本渲染与图像编辑上的定位。
xAI 将 Imagine Image 2.0 作为 grok.com/imagine 以及 iOS、Android 应用的新 Quality Mode 正式开放,并在 API 中以 grok-imagine-image-2.0 提供。
推荐理由:官方给出图像生成与编辑榜单排名及局部编辑、多参考图等能力,读者可判断它能否接入现有设计流程。
xAI 宣布开始向 X 平台所有用户免费推送新版 Grok-2,该版本速度提升三倍,在准确率、指令遵循和多语言能力上有所改进,Premium 与 Premium+ 用户仍享有更高使用额度。
推荐理由:官方给出新版 Grok-2 的速度、能力改进与 API 定价,可对照此前 Grok-2 的开放范围与使用成本。
Mistral 发布全新版 le Chat AI 助手,同时推出 Pro 和 Team 付费档位,Enterprise 版进入私有预览,并登陆 iOS 与 Android。
推荐理由:原文给出 Flash Answers 的响应速度、Code interpreter 能力和三档定价,可据此判断这套助手的定位与使用门槛。
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
Runway 推出面向专业开发者和企业团队的 AI 媒体平台 Runway Dev,现已可用,入口为 dev.runwayml.com。
推荐理由:原文列出了四大能力和企业级安全条款,开发者可以据此评估是否用单一平台替代多个媒体 API 的拼装方案。
Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access,基于 Self-Flow 方法在统一架构下同时学习图像、视频和音频。
推荐理由:官方公布了 FLUX 3 的多模态架构、早期评测胜率和分阶段开放计划,读者可以据此评估它在视频与物理 AI 方向的路径。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,通过 from_pretrained() 直接加载 Nunchaku(SVDQuant)W4A4 量化检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:官方介绍 Diffusers 原生加载 Nunchaku Lite 4-bit 检查点,附基准数据与自行量化发布流程,可迁移到消费级 GPU 部署。
NVIDIA 和 Hugging Face 推出 NeMo Automodel 与 Diffusers 的集成,为 Hub 上任意 Diffusers 格式模型提供生产级分布式扩散训练,无需转换 checkpoint 或重写模型。
推荐理由:NVIDIA 与 Hugging Face 把分布式扩散训练接入 Diffusers,无需转换 checkpoint 或重写模型,可直接微调现有开源扩散模型。
字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,主打复杂信息可视化、交互式精准编辑、真实影像质感与原生多语种生成四大能力。模型已上线火山方舟体验中心,并将陆续在豆包、即梦上线,项目主页见 https://seed.bytedance.com/seedream5_0_pro。
推荐理由:官方介绍给出四大能力方向和具体生成案例,读者可以判断它在专业设计场景中的可用性。