Generating high-quality images is cheaper and faster than ever. Muse Image, MAI-Image-2.6 and GPT Images 2.5 have substantially shifted the Text to Image Pareto frontiers for both price and speed in recent weeks.
#图像生成
#图像生成
今日 10 条
Mustafa Suleyman@mustafasuleymanAI 评分4545引用Artificial Analysis@ArtificialAnlys
OpenRouter Announcements精选AI 评分8080 OpenRouter 实测20个图像生成模型的真实成本、编辑与质量差异
OpenRouter 用同一提示词实测20个图像生成模型的真实计费,1024x1024 单张图价格在 $0.006(openai/gpt-image-2)到 $0.1344(google/gemini-3-pro-image)之间,相差22倍。
推荐理由:原文用统一提示词实测20个图像模型的实际计费,给出按任务选模型的结论,比照牌价更可靠。
Kling AI@Kling_aiAI 评分1111

Hugging Face Blog精选AI 评分6262 Gradio Workflow 重建 AUTOMATIC1111 大部分功能为 Workflow1111
Hugging Face 团队用 gr.Workflow 将 AUTOMATIC1111 的主要功能重建为 Workflow1111,画布包含 11 条媒体管线。
推荐理由:原文拆解了 11 条媒体管线和 73 个节点的具体构成,展示了 Gradio Workflow 混搭多模型并自动生成 REST 与 MCP 端点的做法。
Google Blog: AIAI 评分5555 Google DeepMind 与电影人用 AI 逐帧重建 70 年爱情往事
Google DeepMind 与 Primordial Soup 合作制作纪录短片《Love, Rendered》,用 AI 重建 Burt 和 Ethelle Shatz 结婚 70 多年来未被拍摄记录的初遇记忆。
OpenRouter AnnouncementsAI 评分5555 OpenRouter 教程:用代码调用 Nano Banana 2 编辑图片
OpenRouter 发布教程,演示如何通过 API 向 google/gemini-3.1-flash-image(Nano Banana 2)发送源图和编辑指令,在代码中完成图片编辑。
Runway News精选AI 评分6363 Runway 发布 Adobe 插件,可在 Premiere Pro 与 After Effects 内直接生成和编辑
Runway 发布 Runway Plugins,推出面向 Premiere Pro 和 After Effects 的 Adobe 插件,在时间线内直接生成图像和视频、重绘素材并放置结果,无需导出再导入。
推荐理由:官方说明插件如何消除剪辑中反复导出导入的流程,生成结果直接落入时间线并沿用现有套餐额度。
OpenAI NewsAI 评分4747 OpenAI 推出 ChatGPT Images 2.5
OpenAI 推出 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,更贴合用户的原始创意。
Microsoft AI News精选AI 评分6262 Microsoft 发布 MAI-Image-2.6 及 MAI-Image-2.6-Flash 图像模型
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,并面向 Microsoft Foundry 开发者推出低延迟版本 MAI-Image-2.6-Flash。
推荐理由:原文来自官方发布,给出排名、速度和价格效率数据,读者可据此评估两个版本在生产场景中的取舍。
Fei-Fei Li@drfeifeiAI 评分5757引用World Labs@theworldlabsIntroducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.
Google Blog: AIAI 评分5555 Google Workspace 推出图像创建与编辑工具 Google Pics
Google 发布 Workspace 旗下图像创建与编辑工具 Google Pics,基于 Nano Banana 模型,将在未来几周内向 Google AI Pro 和 Ultra 订阅者及大部分 Workspace 商业客户推出。
OpenRouter Announcements精选AI 评分6262 OpenRouter 上线 Visual Image Benchmarks 覆盖 39 个图像模型
OpenRouter 发布 Visual Image Benchmarks,帮助用户评估其平台上的 39 个图像模型(截至 2026 年 8 月)。挑战提示词分七类:不太可能的场景、计数、文字、空间关系、否定、编辑和一致性,结果以网格展示并支持按价格和生成时间排序。视频和音频等更多模态的评估即将推出,用户也可通过 OpenRouter API 或 Chat 试用模型。
推荐理由:原文给出七类挑战提示词和按价格与生成时间排序的结果网格,读者可直接用它对比 39 个图像模型的真实能力。
Google AI Developers@googleaidevsAI 评分3030
@trq212@trq212AI 评分2727
OpenRouter AnnouncementsAI 评分5555 OpenRouter 发布图像生成 API 教程:一个接口和一个 key 调用多家图像模型
OpenRouter 发布 Image Generation API 代码教程,通过 POST /api/v1/images 用统一请求格式和一个 key 调用多家支持的图像模型。
Microsoft AI NewsAI 评分5959 Microsoft 发布 MAI-Image-2.6,Arena 文生图榜位列第二
Microsoft 发布 MAI-Image-2.6,在 Arena 文生图排行榜上排名第二,领先 Meta、Google 和 xAI 的模型。该模型总体 Elo 比 MAI-Image-2.5 提升 +79,文本渲染单项提升 +91 Elo,各评测类别均有进步。目前可在 Arena 上试用,本周晚些时候上线 MAI Playground,并将很快登陆 Microsoft Foundry 等产品。
Runway NewsAI 评分4242 Skyscanner 如何用 Runway 消除广告拍摄前的猜测
Skyscanner 品牌团队在美加品牌广告拍摄中引入 Runway,用于锁定构图、布光和演员走位,并在片场实时验证拍摄效果。团队用 Runway 生成酒吧、水疗、海滩和酒店阳台等场景环境,还借助 AI 生成临时背景检查服装与道具,使预可视化与实际成片的差距很小。
OpenRouter AnnouncementsAI 评分5757 OpenRouter 图像生成教程:如何选模型并排查报错
OpenRouter 发布图像生成教程,讲解如何为 POST /api/v1/images 选择模型并修复常见 API 报错。选型建议按任务(文生图、参考图编辑、矢量输出、可读文字)、参数支持、价格依次决定;GET /api/v1/images/models 列出各模型的 supported_parameters。
Microsoft AI News精选AI 评分6262 Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 公开预览版
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
Google ResearchAI 评分4242 Google Research 揭示扩散模型创造力来源:分数平滑如何带来泛化
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的分数函数被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Hugging Face BlogAI 评分4343 PRX Part 4:我们的数据策略
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),图像统一以 JPEG quality 92 编码。
Google DeepMind精选AI 评分7676 Google DeepMind 发布 Nano Banana 2 Lite 图像模型并向开发者开放 Gemini Omni Flash
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),文生图延迟 4 秒。
推荐理由:官方公告给出了两款模型的定位、价格、延迟和已知限制,开发者可直接据此选型和接入。
Microsoft AI News精选AI 评分6565 Microsoft MAI-Image-2.5 发布,登 Arena 图像编辑榜第 2
Microsoft MAI 团队发布图像模型 MAI-Image-2.5 及更快更便宜的 MAI-Image-2.5-Flash,MAI-Image-2.5 在 Arena 图像编辑榜排名第 2(超过 Nano Banana 2),文生图榜排名第 3,较 MAI-Image-2 总分提升 75 分。
推荐理由:官方公布了 Arena 图像编辑第 2 的排名、与 Flash 双版本定价和 Foundry 入口,读者可据此评估生产图像工作流的选型。
Microsoft AI News精选AI 评分7979 Microsoft Build 2026 发布 MAI 系列七款新模型,含首个推理模型 MAI-Thinking-1
Microsoft MAI 在 Build 2026 主题演讲中发布七款新模型,覆盖图像、语音、转录、推理和编码。
推荐理由:作者以当事方身份逐一公布七个新模型的定位、基准数字和开放渠道,读者可以对照竞品评估各自适用场景。
Runway News精选AI 评分6060 Runway 发布 Runway MCP 服务器,可在 Agent 中直接生成图像和视频
Runway 发布 Runway MCP(Model Context Protocol)服务器,把 Runway 接入用户已有的 Agent 和编码工具,在对话中直接生成图像和视频而无需切换上下文。
推荐理由:原文给出了接入方式和可用模型清单,读者可据此判断在自己的 Agent 工作流中调用 Runway 生成是否顺手。
Runway News精选AI 评分6262 Runway 发布 Aleph 2.0 视频编辑模型及 Edit Studio 应用
Runway 发布视频编辑模型 Aleph 2.0,并同步推出围绕其构建的 Edit Studio 应用。新模型支持编辑最长 30 秒的 1080p 视频,可做仅改动目标区域的局部编辑,用一帧编辑后的图像预览并控制最终效果,还能一次把改动应用到多个镜头。Edit Studio 面向营销团队、影视后期等场景,现已在所有 Runway 付费计划的桌面网页端开放。
推荐理由:原文给出了模型能力细节和开放范围,读者可以据此判断对现有视频素材二次加工工作流的影响。
Google Research精选AI 评分6161 Google Photos Auto frame 上线 3D 视角重构成像功能
Google 宣布在 Google Photos 的 Auto frame 功能中推出新的拍照后视角调整方法,通过 ML 模型理解场景空间布局并用生成式 AI 从新视角重构成像。
推荐理由:原文解释了两阶段 3D 场景重建加生成补全的技术路线,读者可以了解它与传统裁剪编辑的本质差别。
Microsoft AI NewsAI 评分5555 微软发布 MAI-Image-2-Efficient 图像模型,成本降低 41%
微软发布 MAI-Image-2-Efficient 图像模型,定位量产场景,成本比旗舰低 41%,适用于产品图、营销素材、UI 原型和批量管线,支持短文本和实时交互工作流。
Microsoft AI News精选AI 评分6363 Microsoft 发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型并上线 Foundry
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Microsoft AI News精选AI 评分6262 Microsoft MAI 发布图像生成模型 MAI-Image-2
Microsoft AI 团队发布图像生成模型 MAI-Image-2,称其使 MAI 进入 Arena.ai 榜单前三的文生图实验室行列。
推荐理由:原文给出榜单排名、可用入口和面向创意工作的三大能力重点,读者可据此判断是否试用或接入。
LMSYS Blog精选AI 评分6363 SGLang-Diffusion 两个月迭代:推理速度最高提升 2.5 倍并集成 ComfyUI
SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。
推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。
Microsoft AI News精选AI 评分6161 Microsoft AI 发布首个完全自研图像生成模型 MAI-Image 1,登上 LMArena 文生图前十
Microsoft AI 于 2025 年 10 月 13 日宣布 MAI-Image 1,这是其首个完全在内部开发的图像生成模型,首日进入 LMArena 文生图模型前十。
推荐理由:微软首次完全自研的图像生成模型,官方说明了训练重点、擅长场景和后续落地产品,可了解其定位与可用入口。
Suno BlogAI 评分5757 Suno 推出 Covers 功能,可将任意音频转为新风格并保留原旋律
Suno 推出早期测试版新功能 Covers,可将语音备忘录或完整曲目转换成不同风格,同时保留原旋律。功能目前面向 Pro 和 Premier 订阅用户开放,每人有 200 次免费额度,之后每次生成消耗 10 credits;beta 阶段可能出现返回原片段未换风格等问题,官方征集用户反馈。