Black Forest Labs 发布多模态基础模型 FLUX 3,开启 Early Access
Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access,基于 Self-Flow 方法在统一架构下同时学习图像、视频和音频。
推荐理由:官方公布了 FLUX 3 的多模态架构、早期评测胜率和分阶段开放计划,读者可以据此评估它在视频与物理 AI 方向的路径。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
当前仅显示精选新闻Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access,基于 Self-Flow 方法在统一架构下同时学习图像、视频和音频。
推荐理由:官方公布了 FLUX 3 的多模态架构、早期评测胜率和分阶段开放计划,读者可以据此评估它在视频与物理 AI 方向的路径。
Black Forest Labs 发布早期版 FLUX 3 多模态基础模型,联合训练图像、视频和音频,并在其上与 mimic 合作构建视频-动作模型 FLUX-mimic。
推荐理由:原文给出训练细节和工厂实测数据,读者可以判断世界模型路线对机器人任务的实际收益。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%。
推荐理由:官方博客给出三款 Flash 模型的 token 效率、价格和多项基准数据,可帮助开发者评估选型与 agent 成本。
NVIDIA 在 Hugging Face 的 Cosmos 3 仓库发布 Cosmos 3 Edge,一个 40 亿参数的开源世界模型,帮助机器人和视觉 AI 智能体理解环境、实时推理并生成机器人动作。
推荐理由:40 亿参数模型在边缘设备上实现实时推理与机器人控制,为端侧物理 AI 提供了可直接部署的开源世界模型。
字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景。模型支持 100ms 间隔的时间控制、零样本音色生成、单次约 2 分钟的延展生成,覆盖 20+ 语种;评测显示多数场景音频可用率达 90% 以上,多语种自然度 MOS 大部分超过 4 分。模型已在火山方舟体验中心上线。
推荐理由:官方介绍统一框架下联合建模多种音频要素的思路,并给出时间控制精度、语种覆盖和评测数字,可用于了解音频创作模型的能力边界。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于更快地发现、验证和修补漏洞。
推荐理由:原文给出基准对比、内部落地和受限开放方式,读者可以据此评估轻量安全模型在漏洞发现中的取舍。
Kimi K3 发布,成为全球第一个开源的3T级别大模型,在 Frontend Code Arena 排名第一并大幅领先 Fable 5。其编程能力在 DeepSWE 拿到 67.5 分,SWE Marathon 42.0 分为所有模型最高,48 小时自主完成一颗 45nm 芯片的设计优化与验证,并从零构建了名为 MiniTriton 的 GPU 编译器。
推荐理由:原文给出前端、编程与芯片设计等多维实测对比,读者可据此判断这款开源大模型的性价比与能力边界。
月之暗面发布旗舰模型 Kimi K3,在 Arena 前端代码/Web Dev 榜单以 1679 分登顶,领先 Fable 5 48 分、高于 GPT-5.6 Sol 61 分。
推荐理由:Kimi K3 登顶 Arena 前端榜单并提价近 4 倍,读者可对照其稀疏 MoE 架构与真实任务成本的差异。
月之暗面发布 Kimi K3,这是一个总参数 2.8T 的 MoE 开源模型,官方称其整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但稳定超过其他所有模型。
推荐理由:官方给出了与 Fable 5、GPT-5.6 Sol 的评测对比和定价,读者可据此判断开源模型当前的位置与使用成本。
月之暗面于 7 月 16 日晚上线 Kimi K3,为 2.8 万亿参数 MoE 模型,原生支持视觉理解和 100 万 token 上下文,官方称整体扩展效率较 K2 提升约 2.5 倍。
推荐理由:作者以四项自测呈现 K3 的能力与短板,并对照定价与上下文分层的变化说明开源旗舰模型的使用门槛。
Kimi K3 正式发布,上下文窗口 1M、总参数 2.8T,官方在基准测试中于 14 项里的 11 项击败 GPT-5.6 Sol,全部 14 项击败 Opus 4.8,并在 Frontend Code Arena 以 1679 分位列第一,超越 Claude Fable 5。
推荐理由:官方跑分与第三方评测同时给出对比数据,读者可据此判断 K3 在前端能力和成本上相对同级模型的位置。
Kimi K3 发布并已在网页端上线,参数量达2.8万亿,是目前公开的开源模型中规模最大的一个。它基于Kimi Delta Attention(KDA)混合线性注意力机制,并引入Attention Residuals结构,原生支持视觉理解,上下文窗口达100万token。
推荐理由:原文列出Kimi K3的参数规模、KDA与AttnRes架构改动及多项榜单跑分,可据此判断当前开源模型的能力位置。
蚂蚁集团 SingGuard 团队在 Hugging Face 发布 SingGuard-NSFA 系列智能体护栏模型,本次为基于 Qwen3.5 的 4B GGUF 版本,采用生成式推理与实时分类双模式。
推荐理由:模型卡给出双模式护栏的部署方式与四档参数规模,读者可据此判断智能体实时安全拦截的落地条件。
inclusionAI 发布 SingGuard-NSFA 智能体安全护栏模型,覆盖 0.8B、2B、4B、9B 四个尺寸,基于 Qwen3.5 微调并采用 Apache 2.0 许可。
推荐理由:模型卡列出四个尺寸的 F1 表现与约 50 ms 实时检测延迟,读者可据此比较它在智能体安全拦截上的部署取舍。
Thinking Machines 开源首款自研大模型 Inkling,总参数 9750 亿,架构大体沿用 DeepSeek-V3 的 MoE 设计。
推荐理由:原文给出可控思考深度参数与多项基准对比,读者可据此判断定制化开源基座在成本与性能间的取舍。
Inkling 是 thinkingmachines.ai 推出的开放权重大语言模型,参数规模为 975B。该条目发布在 Hacker News 上,获得 118 点讨论。
Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 当天在 Serverless 平台提供推理服务,支持 1M 上下文窗口和 OpenAI 兼容 API。
推荐理由:原文给出 Inkling 的架构细节、参数规模和评测数据,读者可以据此评估这个新推理模型是否适合接入自己的生产工作流。
Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。
OpenAI 推出 GPT-5.6 系列模型,分为旗舰 Sol、均衡 Terra 和轻量 Luna 三款,主推更高性价比。旗舰 Sol 定价为每百万 token 输入 5 美元、输出 30 美元,Terra 为 2.50/15 美元,Luna 为 1/6 美元,即日起在 ChatGPT、Codex 和 OpenAI API 上线。
推荐理由:OpenAI 一次推出三档定位的 GPT-5.6 模型,文中给出了跑分与定价层层递进的对比数字。
OpenAI 发布 GPT-5.6 全家桶 Sol、Terra、Luna,旗舰 Sol 主攻硬核编码与知识工作,Terra、Luna 主打性价比,每百万 token 定价分别为 $5/$30、$2.5/$15、$1/$6。
推荐理由:原文列出 GPT-5.6 三档模型与 Fable 5 的编码成绩、token 定价对比,并提到最小的 Luna 由 Sol 完成后训练。