千问开源 Qwen-Image-2.1 图像模型,统一生成与编辑
千问(Qwen)团队开源 Qwen-Image-2.1 图像模型,在单一模型中统一文生图与图像编辑,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。官方称该模型平衡生成质量、推理效率与成本,此次更新包含四项关键改进。
推荐理由:原文给出参数规模与透明图像支持等具体能力,读者可以判断这款开源图像模型在生成和编辑上的取舍。
qwen.ai · 网站与博客
千问(Qwen)团队开源 Qwen-Image-2.1 图像模型,在单一模型中统一文生图与图像编辑,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。官方称该模型平衡生成质量、推理效率与成本,此次更新包含四项关键改进。
推荐理由:原文给出参数规模与透明图像支持等具体能力,读者可以判断这款开源图像模型在生成和编辑上的取舍。
Qwen 团队发布 Qwen3.8-LiveTranslate,以 Interleave 架构重构实时同声传译,忠实度、流畅度和简洁度全面提升。平均延迟(LAAL)从 2.8 秒降至 2.3 秒。
千问(Qwen)团队发布 Qwen3.8-Omni-Flash,定位为新一代原生全模态模型。其核心目标是强化真实生产力场景中的智能体能力,推动全模态模型从理解全模态内容走向规划任务、调用工具和完成创意工作,并建立在编码、文本知识工作和 GUI 等通用智能体能力之上。原文链接:https://qwen.ai/blog?id=qwen3.8-omni-flash
推荐理由:官方说明新一代全模态模型从内容理解转向任务规划与工具调用的定位,读者可据此判断其对生产力场景的意义。
千问推出 E-Commerce Bench,用于评估 AI 智能体在电商场景中的长周期运营能力,并采用多维度评价方式。现有智能体基准多是在有限轮次内让模型完成单一目标,再按交付质量或任务完成度打分。
千问推出 Qwen-Drive-1.0,称其为首个在预训练阶段统一 3D 感知与视觉问答、并可扩展至运动规划的自动驾驶视觉语言基础模型,且完全不改动预训练 VLM 架构。该模型基于原生多模态的 Qwen3.5-4B,外挂 BEV 感知头等两个外部模块。
千问团队开源 Qwen3.8-Flash-Next 权重,这是一个多模态 MoE 模型,也是 Qwen4 所用架构的早期预览。文中称其角色类似 Qwen3-Next 之于 Qwen3.5,当时的混合 Gated DeltaNet + Gated Attention 设计已用于 Qwen3.5 至 Qwen3.8 系列。
推荐理由:官方开源权重并定位为 Qwen4 架构预览,读者可据此追踪千问后续系列的架构走向。
Qwen 官方发布 Qwen3.8-Max,称为 Qwen 家族迄今最强模型,参数规模达 2.4 万亿,基于 Qwen3.5 架构,在编码、办公和研究等方面全面提升。官方还将首次开源 Qwen-Max 级模型权重,开放权重定于下周发布。
推荐理由:Qwen 官方宣布新旗舰模型并开源 Max 级权重,读者可据此关注其编码与协作能力变化。
Qwen 团队发布 Qwen-Image 系列第三代基础图像生成模型 Qwen-Image-3.0。