跳到正文

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

当前仅显示精选新闻
60条精选相关主题AI 视频多模态产品更新

最新精选

第 41–60 条 · 共 60 条
7月1日周三
6月10日周三
  1. 量子位 · 微信公众号79

    Anthropic 发布 Claude Fable 5,首日实测对比 GPT-5.5

    Anthropic 发布 Claude Fable 5,称其进入 Mythos 新段位,模型开放首日开发者集中实测其编码、设计与网页搭建能力。网友将其与 GPT-5.5 同台对比,在《我的世界》复刻推特中 Fable 5 还原度更高,另有开发者称其在 FC Diamond 榜单成功率从 Opus 4.8 的约14%升到30%以上。

    推荐理由:汇总模型开放首日开发者在编码、设计与网页搭建上的实测反馈,可与前代及竞品表现对照。

6月6日周六
  1. @GeminiApp66

    Gemini 官方应用宣布,Gemini Live 现在可以直接创建和编辑图像,并支持实时完成。用户打开 Gemini App、点击 Live 按钮并共享摄像头后,用语音告诉 Gemini 想看到的内容,可用于房间装饰测试、数学题辅助和制作表情包等场景。

    推荐理由:官方给出了提问方式和操作路径,读者可以据此了解 Gemini Live 实时图像生成与编辑的使用门槛。

6月4日周四
  1. @AYi_AInotes72

    Ideogram 发布 Ideogram 4.0,官方称其为世界最好的开源图像模型,权重开放下载,可基于自有数据微调并在自有硬件上运行,现已在各 Ideogram 套餐和 API 上线。转发该消息的作者补充称,其表现仅次于 GPT-image-2 和 Nanobanana2。

    引用Ideogram (@ideogram_ai)@ideogram_ai

    Introducing Ideogram 4.0: the best open image model in the world. Think it. Make it. Own it. Download the weights, fine-tune on your own data, and run it on your hardware. Live on every Ideogram plan and the API today. Video

    推荐理由:原文给出开源权重下载与自有数据微调的路径,可用于判断自建图像模型的门槛。

6月2日周二
  1. Microsoft AI News65

    Microsoft MAI-Image-2.5 发布,登 Arena 图像编辑榜第 2

    Microsoft MAI 团队发布图像模型 MAI-Image-2.5 及更快更便宜的 MAI-Image-2.5-Flash,MAI-Image-2.5 在 Arena 图像编辑榜排名第 2(超过 Nano Banana 2),文生图榜排名第 3,较 MAI-Image-2 总分提升 75 分。

    推荐理由:官方公布了 Arena 图像编辑第 2 的排名、与 Flash 双版本定价和 Foundry 入口,读者可据此评估生产图像工作流的选型。

6月1日周一
  1. @kimmonismus70

    Cosmos 3 在多个公开榜单登顶,成为 Artificial Analysis 文本生成图像和图像生成视频的开源模型第一名。它在 Physics-IQ 的物理准确性上超过 Sora 2,在 PAI-Bench 整体领先 Veo 3.1,并在 RoboArena 位列机器人策略第一。作者称其以开放权重在物理表现上超过闭源前沿视频模型。

    推荐理由:原文列出 Cosmos 3 在文本生成图像、图像生成视频等多个榜单的开源排名,可据此比较开源模型与闭源前沿模型的差距。

5月30日周六
5月29日周五
5月27日周三
  1. inclusionAI Hugging Face models68

    inclusionAI 发布 LLaDA2.0-Uni,统一多模态理解与生成的扩散 MoE 大模型

    inclusionAI 发布基于 MoE 的扩散大语言模型 LLaDA2.0-Uni,在单一模型中统一多模态理解与生成,支持文生图、图像理解、图像编辑以及交错生成与推理。

    推荐理由:模型把多模态理解与生成统一进扩散 LLM 框架,并公开 8 步解码与加速方案,读者可据此判断部署门槛。

5月21日周四
  1. Runway News62

    Runway 发布 Aleph 2.0 视频编辑模型及 Edit Studio 应用

    Runway 发布视频编辑模型 Aleph 2.0,并同步推出围绕其构建的 Edit Studio 应用。新模型支持编辑最长 30 秒的 1080p 视频,可做仅改动目标区域的局部编辑,用一帧编辑后的图像预览并控制最终效果,还能一次把改动应用到多个镜头。Edit Studio 面向营销团队、影视后期等场景,现已在所有 Runway 付费计划的桌面网页端开放。

    推荐理由:原文给出了模型能力细节和开放范围,读者可以据此判断对现有视频素材二次加工工作流的影响。

5月20日周三
5月1日周五
  1. @CalmPromptsHQ69

    SenseTime 将 SenseNova U1 Lite 系列开源,该系列基于 NEO-unify 架构,原生统一多模态理解与生成,提供 8B 和 A3B 两个紧凑版本。官方称其在开源模型中效率领先,并用单一模型单流生成交错的文本与图像,面向指南、知识插图、海报、PPT、漫画等信息密集版式。模型权重已在 Hugging Face 和 GitHub 发布,并可自托管。

    引用SenseTime (@SenseTime_AI)@SenseTime_AI

    𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1 𝗟𝗶𝘁𝗲 𝗦𝗲𝗿𝗶𝗲𝘀 𝗶𝘀 𝗻𝗼𝘄 𝗼𝗽𝗲𝗻 𝘀𝗼𝘂𝗿𝗰𝗲! Built on the 𝗡𝗘𝗢-𝘂𝗻𝗶𝗳𝘆 𝗮𝗿𝗰𝗵𝗶𝘁𝗲𝗰𝘁𝘂𝗿𝗲, it natively unifies multimodal understanding and generation, delivering: •𝗦𝗢𝗧𝗔 𝗘𝗳𝗳𝗶𝗰𝗶𝗲𝗻𝗰𝘆 𝗔𝗺𝗼𝗻𝗴 𝗢𝗽𝗲𝗻-𝗦𝗼𝘂𝗿𝗰𝗲 𝗠𝗼𝗱𝗲𝗹𝘀: Compact models (8B & A3B) delivering commercial-grade performance and exceptional cost efficiency. Leading performance among open-source models across a wide range of understanding, reasoning, and generation benchmarks. •𝗡𝗮𝘁𝗶𝘃𝗲 𝗜𝗺𝗮𝗴𝗲–𝗧𝗲𝘅𝘁 𝗜𝗻𝘁𝗲𝗿𝗹𝗲𝗮𝘃𝗲𝗱 𝗚𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻: Generate coherent interleaved text and images in a single flow using one model; ideal for practical applications like guides, where visuals turn complex information into intuitive insights. •𝗛𝗶𝗴𝗵-𝗗𝗲𝗻𝘀𝗶𝘁𝘆 𝗜𝗻𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻 𝗥𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴: Strong capabilities in dense visual communication, generating richly structured layouts for knowledge illustrations, posters, PPTs, comics and other information-rich formats. 𝗛𝘂𝗴𝗴𝗶𝗻𝗴 𝗙𝗮𝗰𝗲: huggingface.co/collections/s… 𝗚𝗶𝘁𝗛𝘂𝗯: github.com/OpenSenseNova/Sen… 𝗗𝗶𝘀𝗰𝗼𝗿𝗱: discord.gg/cxkwXWjp  @huggingface @github

    推荐理由:SenseNova U1 Lite 以 8B、A3B 紧凑规模开源权重,读者可据此衡量自托管图文版式生成的成本门槛。

4月23日周四
4月2日周四
3月20日周五
1月16日周五
  1. LMSYS Blog63

    SGLang-Diffusion 两个月迭代:推理速度最高提升 2.5 倍并集成 ComfyUI

    SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。

    推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。

10月14日周二
  1. Microsoft AI News61

    Microsoft AI 发布首个完全自研图像生成模型 MAI-Image 1,登上 LMArena 文生图前十

    Microsoft AI 于 2025 年 10 月 13 日宣布 MAI-Image 1,这是其首个完全在内部开发的图像生成模型,首日进入 LMArena 文生图模型前十。

    推荐理由:微软首次完全自研的图像生成模型,官方说明了训练重点、擅长场景和后续落地产品,可了解其定位与可用入口。