inclusionAI 发布 gpt-oss-120b-singprobe:基于 gpt-oss-120b 的流式安全探针
inclusionAI 发布 gpt-oss-120b-singprobe,这是构建在 openai/gpt-oss-120b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
huggingface.co · 开发者平台
inclusionAI 发布 gpt-oss-120b-singprobe,这是构建在 openai/gpt-oss-120b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 stepfun-ai/Step-3.7-Flash 上的内在流式护栏,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 DeepSeek-V4-Flash-0731 的流式安全探针 singprobe,仅 8.13M 参数,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的流式安全探针,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布基于 zai-org/GLM-5.2 的流式护栏探针 GLM-5.2-singprobe,仅 12.06M 参数,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Llama-3.1-8B-Instruct-singprobe,一个基于 meta-llama/Llama-3.1-8B-Instruct 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 Qwen/Qwen3.5-27B 的流式护栏探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3-8B-singprobe,这是构建在 Qwen/Qwen3-8B 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 gpt-oss-20b-singprobe,这是构建在 openai/gpt-oss-20b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 MiniMaxAI/MiniMax-M2.7 之上的流式护栏探针,在生成过程中复用基座模型隐藏状态,对每个 token 输出查询意图、回复不安全度和幻觉风险评分。
蚂蚁集团推出 Ling 家族首个金融增强模型 Ling-3.0-flash-Fin,总参数 124B、激活参数 5.1B,支持 256K 上下文窗口。该模型基于 Ling-3.0-flash 用高质量金融数据继续训练,覆盖端到端金融研究、多文档推理与估值建模,并同步开源 FinFIRST 评测集。当前以 BF16 发布,兼容 SGLang 与 vLLM,默认开启思考模式。
蚂蚁 inclusionAI 发布 Ling-3.0-flash-Fin,这是蚂蚁 Ling 家族首个金融增强模型,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,具备 124B 总参数、5.1B 激活参数和 256K 上下文窗口,并同步开源评测集 FinFIRST。
蚂蚁集团 Ling 家族发布首个金融增强模型 Ling-3.0-flash-Fin,总参数量 124B、激活参数 5.1B、上下文窗口 256K,基于 Ling-3.0-flash 在高质量金融数据上继续训练。
inclusionAI 发布下一代原生多模态模型 Ling-3.0-flash-VL,总参数 124B、每个 token 仅激活 5.5B,支持图像和视频输入,上下文窗口最高 256K tokens。
推荐理由:模型卡给出 124B 总参数、5.5B 激活与 256K 上下文,并附 SGLang、vLLM 部署命令,便于评估落地成本。
inclusionAI 发布新一代原生多模态模型 Ling-3.0-flash-VL,总参数 124B、每 token 仅激活 5.5B,支持图像和视频输入,上下文窗口最长 256K token。
inclusionAI 发布 Ling-3.0-flash-VL 原生多模态模型,总参数 124B,每 token 仅激活 5.5B,支持图像和视频输入,上下文窗口最高 256K tokens。
推荐理由:模型卡给出 124B 总参数、5.5B 激活的稀疏 MoE 设计与多模态基准表现,可据此判断其效率取向。
inclusionAI 发布 LLaDA2.2-mini,这是 LLaDA2 系列智能体扩散语言模型的轻量版本,总参数 16B,推理时仅激活 1.4B。它基于 LLaDA2.0-mini 架构,沿用 Levenshtein Editing(新增 DELETE 与 INSERT 控制 token),将上下文扩展到 128K,面向长上下文工具调用和多轮交互。
inclusionAI 发布 LLaDA-Image 系列统一图像生成与编辑模型,包含 50 步 Base 版和 4 步蒸馏 Turbo 版,均为 6B 参数,并同步开放权重与 Diffusers 推理代码。
推荐理由:开源了 6B 参数统一图像生成与编辑模型,Base 与 4 步蒸馏 Turbo 两个版本都放出了权重和推理代码。
inclusionAI 发布 LLaDA-Image,一个 6B 参数的开源统一图像生成与编辑模型家族,包含 50 步的 Base 版和 4 步蒸馏的 Turbo 版。
推荐理由:官方放出 6B 统一生成与编辑模型的权重与推理代码,并公开了从纯图像预训练到联合训练的开源路线。
inclusionAI 开源 LLaDA-Image 图像生成与编辑模型家族,包含 50 步 Base 与 4 步 Turbo 两个 6B 参数版本,并发布检查点和基于 Diffusers 的推理代码。
推荐理由:开源模型同时提供 50 步 Base 与 4 步 Turbo 版本,读者可据此判断快速生成与高保真生成之间的取舍。
inclusionAI 发布并开源 LLaDA-Image 系列统一图像生成与编辑模型,包含 50 步的 Base 与 4 步蒸馏的 Turbo 两个变体,均为 6B 参数,同时提供 BF16 与 FP8 权重。
推荐理由:6B 参数单权重同时支持文生图与指令编辑,训练配方与推理代码一并开源,便于复现和二次开发。
inclusionAI 推出 Ling-3.0-tiny-singprobe,一个基于 Ling-3.0-tiny 的流式安全探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
inclusionAI 发布 Ling-3.0-flash-singprobe,这是一个基于 Ling-3.0-flash 隐藏状态的流式安全探针,仅 5.18M 参数,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 在 Hugging Face 发布 ArmorOCR-GGUF,这是基于 Qwen3-VL-8B-Instruct 的两阶段对抗 OCR 感知框架的 GGUF 量化版本,提供 Q8_0 与 Q4_K_M 两档量化,主模型与视觉投影器 mmproj 均覆盖,配合 llama.cpp 部署。
inclusionAI 发布 Ling-3.0-flash-GGUF 量化模型,提供 Q4_K_M 版本,可通过 llama.cpp、vLLM、Ollama、Docker Model Runner、LM Studio 等工具在本地运行。
inclusionAI 发布 Ling-3.0-tiny-GGUF 量化模型,提供 Q4_K_M 版本,可通过 llama.cpp、vLLM、Ollama、Docker Model Runner、LM Studio、Jan 等工具本地运行。
inclusionAI 在 Hugging Face 发布 UI-Venus-2-9B,公开由其 Qwen3.5-9B 初始化的全参数权重,这是一个面向移动、网页与桌面的通用 GUI 智能体模型。
推荐理由:权重与逐项评测表格同时放出,可对照基座模型判断 9B GUI 智能体在同规模基准上的位置。
inclusionAI 发布 Ling-3.0-flash 的 DSpark 推测解码草稿模型,1.36B 参数、BF16 精度、5 层全注意力,用 SpecForge 训练并支持 SGLang 与 llama.cpp 部署。该草稿模型采用 8 个 draft token 的块大小(验证宽度 9),在 GSM8K、HumanEval 等九项负载上的接受长度宏均为 5.29。
inclusionAI 发布 ArmorOCR,一个基于 Qwen3-VL-8B-Instruct 的两阶段对抗性 OCR 感知框架,可在原图上单次推理,无需推理时的视觉变换或工具辅助。
inclusionAI 在 Hugging Face 开源 Ling-3.0 系列,并放出预训练、中间训练与 WSM 合并三个阶段的 checkpoint,其中 Ling-3.0-tiny-base 总参数 7.9B、每 token 激活 1.3B,采用 MoE 与 KDA 结合 Gated MLA 的混合线性注意力架构。
inclusionAI 开源 Ling-3.0 系列语言基础模型,并放出训练过程中的多组 checkpoints,涵盖预训练、中训以及完成 WSM 合并但未做后训练的版本。
inclusionAI 开源 Ling-3.0 语言基础模型系列,并按预训练、中训、WSM 合并三个阶段放出检查点,覆盖 Ling-3.0-tiny 与 Ling-3.0-flash 两条规模。
inclusionAI 开源 Ling-3.0 系列基础模型,并放出 pretrained、mid-trained 与 WSM 合并三个训练阶段的 checkpoint,供继续预训练、微调和蒸馏研究使用。
inclusionAI 开源 Ling-3.0 系列语言基础模型,并按预训练、中训和 WSM 融合三个阶段放出多个检查点,供继续预训练、微调与蒸馏研究使用。
推荐理由:Ling-3.0 系列按预训练、中训、融合三个阶段放出中间检查点,便于研究者做继续预训练与蒸馏对比。
inclusionAI 在 Hugging Face 开源 Ling-3.0 系列基础模型检查点,包含 tiny 与 flash 两条线,分别提供预训练、中期训练和 WSM 合并三个阶段共 8 个 checkpoint。
inclusionAI 发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,在关键基准上追平或超过上一代 1T 级旗舰 Ring-2.6-1T。
推荐理由:模型卡给出混合线性注意力架构与多精度量化对比,读者可据此评估长上下文智能体任务的部署成本。
inclusionAI 发布 Ling-3.0-flash 原生混合线性推理模型,总参数 124B、激活 5.1B,官方称其关键基准上追平或超过前代 1T 级旗舰 Ring-2.6-1T。
推荐理由:官方给出 124B 总参数、5.1B 激活的架构与量化评测数据,可供判断长上下文推理的部署成本。
inclusionAI 发布原生混合推理模型 Ling-3.0-flash,总参数 124B、每 token 激活 5.1B,约为前代 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%。
推荐理由:模型卡给出混合线性注意力架构与 5.1B 激活参数占比,并附 SGLang、vLLM 部署命令,便于对照前代旗舰评估效率取舍。
inclusionAI 发布 Ling-3.0-tiny,一个轻量混合推理 MoE 模型,总参数 7.9B、每 token 仅激活 1.3B,提供 BF16、FP8 和 INT4 权重。
inclusionAI 发布 Ling-3.0-tiny,这是一个总参数 7.9B、每 token 仅激活 1.3B 的轻量混合推理 MoE 模型,提供 BF16、FP8 和 INT4 三种权重。