inclusionAI 发布 SingProbe:基于 gemma-4-E4B-it 的流式安全探针
inclusionAI 推出 SingProbe,一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复安全性和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 推出 SingProbe,一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复安全性和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-4B-Instruct-2507 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 GLM-5.3 的流式安全探针 GLM-5.3-singprobe,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-4B-singprobe,这是一个构建在 Qwen/Qwen3.5-4B 上的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-9B-singprobe,这是一个构建在 Qwen/Qwen3.5-9B 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个基于 google/gemma-4-31B-it 的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 gpt-oss-120b-singprobe,这是构建在 openai/gpt-oss-120b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 stepfun-ai/Step-3.7-Flash 上的内在流式护栏,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的流式安全探针,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Llama-3.1-8B-Instruct-singprobe,一个基于 meta-llama/Llama-3.1-8B-Instruct 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3-8B-singprobe,这是构建在 Qwen/Qwen3-8B 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 gpt-oss-20b-singprobe,这是构建在 openai/gpt-oss-20b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 MiniMaxAI/MiniMax-M2.7 之上的流式护栏探针,在生成过程中复用基座模型隐藏状态,对每个 token 输出查询意图、回复不安全度和幻觉风险评分。
Ling-3.0-flash-VL 两项更新: - 现已在 OpenRouter 上线,提供两周免费访问 - FP4 和 INT4 量化版本现已开源 可通过 API 试用或自行部署——由你选择。


哦,原来这就是我们绘制出雄性果蝇全部166,000个神经元的原因。来看看这项大型社区合作成果,展示这些微小果蝇大脑究竟有多大能力 🪰🧵
推荐理由:原文给出 DeepSeek-V4.1-Flash 的参数结构、上下文长度和开源协议,读者可据此评估其部署与成本价值。
🤗 Novita now supports Ling-3.0-flash-VL on @huggingface. 🎁 Free for 14 days. • 124B total parameters · 5.5B active parameters per token • Native image and video understanding • Built for multimodal reasoning and agentic workflows
在 DeepInfra 上体验最新的 Ling-3.0-flash-VL,我们的 day0 合作伙伴 @DeepInfra
Ling-3.0-flash-VL is live on DeepInfra — day 0 with @AntLingAGI. https://deepinfra.com/inclusionAI/Ling-3.0-flash-VL
DeepSeek 正式发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸模型,具备原生多模态视觉理解能力,设计目标是能力上限更高、推理更快、吞吐更大。
推荐理由:官方公布了新结构系列最小模型的多项基准成绩和 API 迁移方式,开发者可据此评估切换成本与价格变化。
OpenAI 发布 GPT-6 Astra,称其为面向商务的最强模型,具备高级推理、电脑使用能力,以及更强的写作和设计判断。
推荐理由:官方宣布新模型并点出推理、电脑操作与写作设计判断等方向,可据此了解其在商务场景的定位。
智谱 GLM-5.3 从 MIT 转为自定义许可证,要求年收入超 100 亿美元的模型服务商通过 Z.AI 安全审查,但许可证未定义"关联方"。本期还收录 Motif-3(MIT 许可)、腾讯 Hy4-preview、Qwen3.8-Flash-Next(125B-A6B)等新模型。
OpenAI 宣布分享针对 Navier–Stokes 千禧年大奖难题的 AI 生成解答,包含一份完整 writeup 和 Lean 形式化证明。
推荐理由:官方称以 AI 生成 Navier–Stokes 千禧年难题的解答并附 Lean 形式化证明,值得数学与 AI 交叉方向读者跟进。
Muse Spark 1.3 现已支持 max reasoning,可在 Muse Code 和 Meta Model API 上使用 👇
1/ we just publicly released Muse Spark 1.3 max! we see significantly stronger coding and agentic performance on muse spark 1.3 max, so would strongly recommend trying it out even if you've already tried muse spark 1.3 high or muse spark 1.3 xhigh.
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,并面向 Microsoft Foundry 开发者推出低延迟版本 MAI-Image-2.6-Flash。
推荐理由:原文来自官方发布,给出排名、速度和价格效率数据,读者可据此评估两个版本在生产场景中的取舍。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为最先进准确的全球 AI 天气模型。模型直接学习实时卫星数据和气象站观测,逐小时产出最高 5 公里分辨率预报,精度约为 WeatherNext 2 的五倍;中期降水预报 CRPS 相对 IMERG 提升最高 60%。
推荐理由:官方介绍了新模型的分辨率、逐小时更新和降水精度提升,并说明其在 Google 各产品中的落地方式,读者可评估对天气相关业务的应用价值。
Microsoft MAI 发布转写模型 MAI-Transcribe-2,在 FLEURS 基准 60 种语言上以平均词错率 5.2% 排名第一,定价每小时音频 $0.10(年底前限时)。
H Company 发布 NeoMME 系列多语言多模态编码器,有 260M 和 800M 两种规格,用单个双向 Transformer 从头训练处理文本 token 和 32×32 图像 patch,不依赖预训练视觉塔或因果语言模型。


Introducing Gemini 3.8 Flash, another jump in Gemini's agentic + coding capabilities, and our 3rd updated Flash model in only 6 weeks... This model has been a ton of fun to work with, excited to see what you all think!
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。
推荐理由:官方给出具体基准数据和定价,可用于对比 3.7 Flash 判断升级性价比,Cyber 版的开放范围也值得安全团队留意。
Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.
Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。
推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。
Google 发布 TimesFM-3,一个 330M 参数、在超过 1 万亿时间点上预训练的时间序列基础模型,原生支持零样本多变量预测。模型可在单次前向传播中生成整个预测区间,支持多目标、过去协变量和过去-未来协变量,并在 Gift-Eval、FEV-Bench 和 Time 三个基准上于点预测和概率预测指标中均排名第一。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型、安全防护级别不同,Fable 5.1 全面开放,Mythos 5.1 限可信访问计划。
推荐理由:原文给出新旧模型基准对比、cache reads 降价幅度和访问政策变化,读者可据此评估升级成本与适用场景。
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时运行的智能体编码、知识工作和研究,并向 Project Glasswing 参与者提供 Claude Mythos 5.1。
推荐理由:官方发布说明列出了定价、上下文窗口和多项 API 变更,方便现有使用方评估迁移和缓存成本影响。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,均以 Apache 2.0 许可开源。