inclusionAI 发布 SingGuard-NSFA 智能体安全护栏模型
inclusionAI 发布 SingGuard-NSFA 智能体安全护栏模型,覆盖 0.8B、2B、4B、9B 四个尺寸,基于 Qwen3.5 微调并采用 Apache 2.0 许可。
推荐理由:模型卡列出四个尺寸的 F1 表现与约 50 ms 实时检测延迟,读者可据此比较它在智能体安全拦截上的部署取舍。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
当前仅显示精选新闻inclusionAI 发布 SingGuard-NSFA 智能体安全护栏模型,覆盖 0.8B、2B、4B、9B 四个尺寸,基于 Qwen3.5 微调并采用 Apache 2.0 许可。
推荐理由:模型卡列出四个尺寸的 F1 表现与约 50 ms 实时检测延迟,读者可据此比较它在智能体安全拦截上的部署取舍。
Thinking Machines 开源首款自研大模型 Inkling,总参数 9750 亿,架构大体沿用 DeepSeek-V3 的 MoE 设计。
推荐理由:原文给出可控思考深度参数与多项基准对比,读者可据此判断定制化开源基座在成本与性能间的取舍。
Hugging Face 披露其生产基础设施遭入侵,攻击由一个自主 AI 智能体系统端到端驱动,攻击者利用数据集处理的两个代码执行路径获得初始访问,窃取部分内部数据集和服务凭证。
推荐理由:官方披露由自主 AI 智能体发起的基础设施入侵与处置细节,读者可以看到防御方如何用自有模型完成取证并应对护栏限制。
Inkling 是 thinkingmachines.ai 推出的开放权重大语言模型,参数规模为 975B。该条目发布在 Hacker News 上,获得 118 点讨论。
Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。
SGLang 与 Miles 团队同 Thinking Machines Lab 合作,为 975B 参数、上下文最长 1M tokens 的多模态模型 Inkling 提供 Day-0 支持。
推荐理由:原文给出 Inkling 架构细节、SGLang 各项优化后的具体吞吐数字,以及 Miles 侧完整 RL 训练方案,工程参考价值具体。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在在多种 LLM 架构上达到甚至超过 vLLM 手写原生实现的速度,模型作者无需移植即可获得原生推理性能。
推荐理由:官方给出三种 Qwen3 规模下的对比数据和方法,读者可以据此评估是否直接用 transformers 后端替代手写 vLLM 实现。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集,精选开源权重模型每周更新,可一键部署到 Azure 预置的 GPU 托管平台。
推荐理由:官方详解 Hugging Face 模型进入 Foundry Managed Compute 的策展流程、支持运行时和部署方式,读者可以据此评估企业侧部署开源模型的实际路径。
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。
推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。
Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用一个 hf:// URL 和现有 HF_TOKEN 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,任务可调度到 20+ 云、Kubernetes 和本地集群。
推荐理由:原文给出具体价格对比和三云基准数字,读者可以据此评估零出流存储对跨云训练成本的实际影响。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。
推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为 in-context learning 问题,无需手动训练、超参数调优和特征工程。
推荐理由:官方一手发布,把表格预测重构为上下文学习问题,读者可以了解其混合注意力架构、合成数据训练与基准结果。
OpenRouter 认为 2026 年 6 月最值得关注的四款开放权重模型是 DeepSeek V4 Flash、GLM 5.2、MiniMax M3 和 NVIDIA Nemotron 3 Ultra,并指出开放权重模型与美国前沿实验室的能力差距已连续 18 个月保持在 3-6 个月且未在扩大。
推荐理由:OpenRouter 用自家价格与吞吐数据逐一点评四款开放权重模型的适用场景,读者可以按成本、质量和模态对号入座选型。
NVIDIA 发布 NeMo AutoModel 开源库,基于 Transformers v5,在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B A3B 微调中实现 3.4 至 3.7 倍训练吞吐提升与 29% 至 32% 显存下降,只需改动一行 import。
推荐理由:只需改动一行 import,MoE 微调吞吐即可提升 3.4 至 3.7 倍、显存降低 29% 至 32%,读者可据此判断迁移成本。
AI 研究者 Nathan Lambert 撰文认为,GLM-5.2 是首个在编程框架中作为通用智能体使用时手感极佳的开放权重模型,官方于 6 月 16 日以 MIT 协议开放权重。
推荐理由:Nathan Lambert 结合实测与多个基准讨论 GLM-5.2 在编程智能体中的表现,读者可据此观察开源与闭源模型的能力时差。
IBM 开源了 CUGA(Configurable Generalist Agent)智能体框架,并发布 cuga-apps 项目,内含 24 个单文件 FastAPI 智能体应用示例。
推荐理由:原文给出可直接克隆的 24 个单文件智能体应用模板,并拆解工具与提示词的复用写法。
Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。
推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。
inclusionAI 发布 Ling-2.6-1T-base,一个总参数约 1T、激活约 63B 的细粒度 MoE 基座模型,由 Ling-2.0-1T-base 通过混合线性注意力改造而来,并作为 Ling-2.6 与 Ring-2.6 的共同基座。
推荐理由:模型卡给出了从 Ling-2.0 改造的迁移流程与长上下文训练安排,读者可据此评估万亿级 MoE 基座的微调与部署成本。
AllenAI 发布 MolmoMotion,一个语言引导的 3D 运动预测模型:给定视频帧、物体上的 3D 点和动作指令,预测这些点未来几秒在 3D 空间中的轨迹。
推荐理由:原文给出3D点轨迹的预测表示与机器人和视频生成两类下游验证,可据此理解动作预测的落地路径。
企查查数据显示,杭州深度求索于 2026 年 6 月 16 日完成首轮外部融资,规模约 510 亿元,估值近 4000 亿元,投资方包括创始人梁文锋、腾讯、宁德时代、网易、京东、Monolith 砺思资本、IDG 资本、正心谷投资、拾象科技及国家人工智能产业投资基金合伙企业。
推荐理由:融资规模、估值和投资方名单披露较完整,可据此观察开源模型公司引入产业资本后的资金结构。