inclusionAI 发布开源全模态模型 Ming-flash-omni 2.0
inclusionAI 在 Hugging Face 发布开源全模态模型 Ming-flash-omni 2.0,基于 Ling-2.0 MoE 架构,总参数 100B、激活 6B,称在开源全模态 MLLM 中达到 SOTA。
huggingface.co · 开发者平台
inclusionAI 在 Hugging Face 发布开源全模态模型 Ming-flash-omni 2.0,基于 Ling-2.0 MoE 架构,总参数 100B、激活 6B,称在开源全模态 MLLM 中达到 SOTA。
inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。
推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。
inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。
推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。
inclusionAI 发布 Ling 2.0 系列首款旗舰非思考模型 Ling-1T,总参数 1T、每 token 激活约 50B,支持 128K 上下文。
推荐理由:官方模型卡给出架构、训练规模和基准对比细节,读者可据此评估这款万亿参数非思考模型的推理效率与部署方式。
inclusionAI 在 Hugging Face 开源 Ming-UniVision-16B-A3B,基于 MingTok 连续视觉 token,在单一自回归 NTP 框架内统一图像理解与生成,官方称联合训练收敛速度提升 3.5 倍。
inclusionAI 基于 Ling 2.0 架构正式发布 Ring-mini-2.0,总参数 16.8B、激活参数仅 1.4B,经 Long-CoT SFT。
inclusionAI 正式开源思考模型 Ring-flash-2.0,总参数 100B、每次推理仅激活 6.1B,基于 Ling-flash-2.0-base 深度优化。
推荐理由:官方发布完整披露了 icepop 算法、多阶段 RL 训练流程和部署参数,读者可以评估其推理性价比与可复现性。
inclusionAI 正式发布开源思考模型 Ring-1T,总参数 1 万亿、激活 50B,基于 Ling 2.0 架构和 Ling-1T-base,上下文经 YaRN 扩展至 128K,权重可在 Hugging Face 与 ModelScope 下载,并支持 Ling Chat 和 ZenMux 体验与 API 调用。
推荐理由:官方发布开源万亿参数思考模型,给出 IMO 与 ICPC 实测结果和 Icepop、ASystem 训练细节,便于评估其推理与部署价值。
inclusionAI 发布开源万亿参数思考模型 Ring-2.5-1T,采用 1:7 MLA + Lightning Linear Attention 混合线性注意力架构,激活参数从 51B 增至 63B。
推荐理由:原文给出了混合线性注意力的具体效率数字和多项基准成绩,读者可以据此评估它在长程智能体场景中的实际取舍。
inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。
推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。
inclusionAI 开源 Ling 家族旗舰模型 Ling-2.6-1T,参数量达 1T,面向复杂推理、编码和 Agent 工作流。
推荐理由:官方发布万亿参数旗舰开源模型,给出架构设计、benchmark 结果和 SGLang/vLLM 部署细节,便于评估其实际可用性。
inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。
推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。
inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。
推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。
inclusionAI 发布 Ling-3.0-flash-VL,基于 Ling-3.0-flash 扩展原生图像与视频理解,总参数 124B,每 token 激活 5.5B,上下文窗口最高 256K tokens。
inclusionAI 在 Hugging Face 发布 Ling-3.0-flash,为原生混合线性注意力 MoE 模型,总参数 124B、每 token 激活 5.1B,约为此前 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,官方称在关键基准上持平或超越前代。
inclusionAI 发布轻量混合推理 MoE 模型 Ling-3.0-tiny,总参数 7.9B,每 token 仅激活 1.3B,采用 3:1 KDA-MLA 混合线性架构加 128 专家稀疏 MoE FFN。
蚂蚁集团联合多家金融机构与领域专家推出 Ling-3.0-flash-Fin,这是 Ling 系列首个金融增强模型,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,总参数 124B、激活参数 5.1B、上下文窗口 256K。
inclusionAI 在 Hugging Face 发布 AI-Transparency 仓库,按欧盟法规 Article 53(1)(d) 模板公开 Ling、Ring、Ming 系列模型的训练内容摘要。
inclusionAI 发布 Ming-UniAudio-16B-A3B-Edit,统一语音理解、生成与编辑,核心是基于 VAE 和因果 Transformer 的连续语音分词器 MingTok-Audio,整合语义与声学特征。
inclusionAI 发布 Ming-UniAudio 框架及 Ming-UniAudio-16B-A3B 模型,统一语音理解、生成和编辑,核心是基于 VAE 与因果 Transformer 的连续语音 tokenizer MingTok-Audio。
inclusionAI 在 Hugging Face 发布 Ming-flash-omni Preview,基于 Ling-Flash-2.0 稀疏 MoE 架构,总参数 100B、每 token 激活 6B。
推荐理由:原文给出稀疏 MoE 架构、生成式分割和方言语音识别等具体改进与评测数字,读者可对比其多模态能力变化。
inclusionAI 发布 Ming-Image-0.1-Design-Layer,可将一张平面设计图按指定层数拆解为多个 RGBA 图层,采用 MIT 许可证。模型推荐 1024 分辨率、12 步采样、CFG 2.0、BF16 精度,需单张 80 GiB 显存 CUDA GPU,可用 vLLM-Omni 部署,提示词增强支持 Ling-3.0-flash-VL 或 qwen3.8-27B。
inclusionAI 发布 Ming-Image-0.1-Design,一个面向 UI、信息图、海报等文字密集视觉设计的 6B 文生图模型,支持 RGBA 透明背景输出。
inclusionAI(Venus Team,蚂蚁集团与清华大学)在 Hugging Face 开源 Realtime-Venus,包含基于 MiniCPM-o 4.5 的 9B 视听交互模型 Realtime-Venus-Omni 和纯音频模型 Realtime-Venus-Audio。
inclusionAI 在 Hugging Face 开源 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI Agent,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
inclusionAI 推出 SingProbe,一个基于 meta-llama/Llama-3.2-1B-Instruct 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,仅增加不到 0.5% 解码开销。
inclusionAI 发布 SingProbe,一个基于 google/gemma-4-26B-A4B-it 的流式安全探针,复用基座模型隐藏状态逐 token 打分,仅增加不到 0.5% 解码开销。
inclusionAI 在 Hugging Face 发布 SingProbe,一个复用 Qwen3.6-35B-A3B 隐层状态的轻量流式安全探测,逐 token 输出 8 类查询意图、不安全与幻觉风险分数,探测参数仅 4.2M。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.5-122B-A10B 上的内在流式安全护栏探针,复用基座模型隐藏状态,在每个 token 上输出 8 类查询意图、回复不安全度和幻觉风险分数,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-0.8B-singprobe,一个基于 Qwen/Qwen3.5-0.8B 隐藏状态的流式安全探针,可在生成过程中逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
inclusionAI 发布基于 Qwen/Qwen3.5-397B-A17B 的流式安全探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.8-27B-singprobe,这是一个构建在 Qwen/Qwen3.8-27B 上的内在流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 推出 SingProbe,一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复安全性和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-2B-singprobe,这是一个构建在 Qwen/Qwen3.5-2B 上的内在流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-4B-Instruct-2507 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 GLM-5.3 的流式安全探针 GLM-5.3-singprobe,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-4B-singprobe,这是一个构建在 Qwen/Qwen3.5-4B 上的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-9B-singprobe,这是一个构建在 Qwen/Qwen3.5-9B 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个基于 google/gemma-4-31B-it 的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。