inclusionAI 发布基于 Qwen3-0.6B 的 SingProbe 流式安全探针
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.5-122B-A10B 上的内在流式安全护栏探针,复用基座模型隐藏状态,在每个 token 上输出 8 类查询意图、回复不安全度和幻觉风险分数,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-0.8B-singprobe,一个基于 Qwen/Qwen3.5-0.8B 隐藏状态的流式安全探针,可在生成过程中逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
inclusionAI 发布基于 Qwen/Qwen3.5-397B-A17B 的流式安全探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.8-27B-singprobe,这是一个构建在 Qwen/Qwen3.8-27B 上的内在流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 推出 SingProbe,一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复安全性和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-4B-singprobe,这是一个构建在 Qwen/Qwen3.5-4B 上的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-9B-singprobe,这是一个构建在 Qwen/Qwen3.5-9B 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 stepfun-ai/Step-3.7-Flash 上的内在流式护栏,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3-8B-singprobe,这是构建在 Qwen/Qwen3-8B 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
Sakana AI 发布 Fugu Max 和 Fugu Ultra v2,用多智能体编排同时优化成本与性能。
推荐理由:原文给出具体基准成绩、定价对比和 API 升级方式,读者可据此评估编排架构在成本与性能上的实际位置。
Hugging Face 团队用 gr.Workflow 将 AUTOMATIC1111 的主要功能重建为 Workflow1111,画布包含 11 条媒体管线。
推荐理由:原文拆解了 11 条媒体管线和 73 个节点的具体构成,展示了 Gradio Workflow 混搭多模型并自动生成 REST 与 MCP 端点的做法。
SGLang 与 Miles 团队宣布为 DeepSeek-V4.1 提供 Day-0 支持,讲解其 SWA、mHC、Engram 记忆等架构及推理与 RL 训练优化。
推荐理由:原文详解 SGLang 与 Miles 对 DeepSeek-V4.1 的 Day-0 支持,给出 Engram offload、bounded replay 等实测数字和可复现配置。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组约 90 亿个单核苷酸变异的分子效应预测,数据规模 1 petabyte,超过 AlphaFold Database 30 倍以上。
推荐理由:官方平台发布,覆盖 90 亿个单核苷酸变异预测并附应用案例,可用于了解基因组变异数据资源的最新规模与获取方式。
Mistral 宣布完成 €3B Series D 融资,投后估值超过 €21B,为欧洲科技公司迄今最大规模股权融资,由三星电子领投,EQT 旗下 Scaleup Europe Fund 和 PSG Equity 联合领投。
推荐理由:原文是官方融资公告,给出了金额、估值、领投方和资金用途,读者可以据此了解 Mistral 下一阶段的扩张方向。
H Company 发布 NeoMME 系列多语言多模态编码器,有 260M 和 800M 两种规格,用单个双向 Transformer 从头训练处理文本 token 和 32×32 图像 patch,不依赖预训练视觉塔或因果语言模型。
Hugging Face 发布开源工具 funes,把机器上已有的 Agent 会话记录变成可检索的记忆层,一条 funes add 命令即可接入 Claude Code、Codex、pi 和 Hermes。
推荐理由:原文给出 funes 的本地检索管线、跨机器同步与 token 成本对比数据,读者可以据此判断它能否改善多机多 Agent 的工作流。
Hugging Face 博客用 TRL 和 OpenEnv 开放复现 Surya Narreddi 让语言模型写 p5.brush JavaScript 画水彩的方法,训练 Qwen/Qwen3.5-35B-A3B,参考池、RL 环境、训练脚本和模型全部公开,一条命令即可在 HF 上端到端运行。
Hugging Face WebAI 团队发布 @huggingface/kernels 库,可从 Hub 加载和运行优化的 WebGPU 内核,首批提供 207 个内核,Apache-2.0 许可。
推荐理由:官方给出了与 ORT WebGPU 的对比数字和浏览器端众测入口,读者可据此评估浏览器本地推理的可用性。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,均以 Apache 2.0 许可开源。
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。
Hugging Face 发布 Sentence Transformers v6.0 教程,介绍第四种模型类型 MultiVectorEncoder 的完整训练方法,支持 ColBERT 风格的 late interaction 检索微调与从零训练。
推荐理由:作者用实测对比给出多向量模型微调的完整配方,包括起点选择、损失函数和索引压缩的量化取舍。
SGLang 团队与 Qwen、NVIDIA、AMD 合作,为 Qwen 团队开源的多模态 MoE 模型 Qwen3.8-Flash-Next 提供 day-0 支持。
推荐理由:原文详解了 SGLang 对 Qwen3.8-Flash-Next 的 day-0 支持与架构实现细节,含量化检查点和实测吞吐数据,对部署选型有参考价值。
IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。
推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。
Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。
推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与解决方案部署,规模达数亿欧元。双方将本地化先进模型,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型;Mistral 将探索使用 HUMAIN 数据中心支持当地算力需求,还计划在沙特针对受监管行业制定联合市场进入策略。
SGLang 团队联合蚂蚁 Ling Infra 团队发布 Weight Cache Daemon,通过常驻 GPU 进程和 CUDA IPC 零拷贝映射缓存量化后权重,使 Ling-2.6-1T FP8 的权重加载从约 495 秒降至 0.63 秒,端到端启动时间从 8.8 分钟降至 0.528 分钟。
LMSYS 与生态伙伴发布 Miles v0.1,一个基于 slime 设计的全栈生产级后训练系统,目标是让前沿规模 RL 训练更易用。
推荐理由:官方完整走读 Miles 的 RL 训练环路与关键数字,读者可据此评估它是否适合承担自己的前沿规模后训练任务。
Google 发布开源 C++ 库 Credentio,用于处理 C2PA Content Credentials,先支持规范 2.2 和 2.4 版本。该库支持完全本地验证,无需将媒体文件传到云端,零带宽开销、即时返回结果并保持数据隐私;验证大文件时内存占用较小,可配置官方或自定义 C2PA 信任列表,深入解析清单、断言、数字签名和声明结构,并给出详细的验证报告。
SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。
推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键工作负载提供自定义速率限制和 uptime SLA。
Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。
推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
SpecForge v0.3.0 将目标模型推理与草稿模型训练解耦,在线训练完全分离,在 8xH20 测试平台上以 3 台 SGLang 服务器加 5 个训练 worker 的拓扑,端到端训练吞吐较此前同置实现提升约 10%。
RadixArk 与 Google Cloud 合作,把开源推理框架 SGLang 带到 TPU。SGL-JAX 现已可用,支持 Gemma、Qwen、DeepSeek。
IBM Research 与 UC Berkeley Sky Lab 基于进化式内核搜索框架 K-Search 构建 MLX 后端和结构化 CUDA 到 MLX 翻译层,把既有 NVIDIA 内核经验转化为 Apple Silicon 可用的优化指导。
Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。
SGLang 与 Miles 团队同 Thinking Machines Lab 合作,为 975B 参数、上下文最长 1M tokens 的多模态模型 Inkling 提供 Day-0 支持。
推荐理由:原文给出 Inkling 架构细节、SGLang 各项优化后的具体吞吐数字,以及 Miles 侧完整 RL 训练方案,工程参考价值具体。
Runway 开源 AVTensor,一个直接调用 FFmpeg C API 的 Rust 媒体解码器,单次 demux 同时解码音频与视频并共享时间原点,解决了 torchcodec 与 torchaudio 在负 PTS 资产上时间零点不一致导致的音画失步问题。