inclusionAI 发布 Ling-3.0-flash 混合推理模型,124B 总参数激活 5.1B
inclusionAI 在 Hugging Face 发布 Ling-3.0-flash,为原生混合线性注意力 MoE 模型,总参数 124B、每 token 激活 5.1B,约为此前 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,官方称在关键基准上持平或超越前代。
项目更新、模型与开源社区动态
inclusionAI 在 Hugging Face 发布 Ling-3.0-flash,为原生混合线性注意力 MoE 模型,总参数 124B、每 token 激活 5.1B,约为此前 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,官方称在关键基准上持平或超越前代。
inclusionAI 发布轻量混合推理 MoE 模型 Ling-3.0-tiny,总参数 7.9B,每 token 仅激活 1.3B,采用 3:1 KDA-MLA 混合线性架构加 128 专家稀疏 MoE FFN。
蚂蚁集团联合多家金融机构与领域专家推出 Ling-3.0-flash-Fin,这是 Ling 系列首个金融增强模型,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,总参数 124B、激活参数 5.1B、上下文窗口 256K。
inclusionAI 在 Hugging Face 发布 AI-Transparency 仓库,按欧盟法规 Article 53(1)(d) 模板公开 Ling、Ring、Ming 系列模型的训练内容摘要。
inclusionAI 发布 Ming-UniAudio-16B-A3B-Edit,统一语音理解、生成与编辑,核心是基于 VAE 和因果 Transformer 的连续语音分词器 MingTok-Audio,整合语义与声学特征。
inclusionAI 发布 Ming-UniAudio 框架及 Ming-UniAudio-16B-A3B 模型,统一语音理解、生成和编辑,核心是基于 VAE 与因果 Transformer 的连续语音 tokenizer MingTok-Audio。
inclusionAI 在 Hugging Face 发布 Ming-flash-omni Preview,基于 Ling-Flash-2.0 稀疏 MoE 架构,总参数 100B、每 token 激活 6B。
推荐理由:原文给出稀疏 MoE 架构、生成式分割和方言语音识别等具体改进与评测数字,读者可对比其多模态能力变化。
研究针对基于检索的医学事实性评估,基于 MedExpert 开放式数据集和 3 个封闭式数据集构建了两套分类体系,将失败拆解为检索阶段五个质量维度的错误与验证器推理的六个连续步骤。团队用 LLM-as-Judge 自动归纳模式,在 4 种检索方法和 6 个前沿验证模型上压力测试,发现扩大模型规模、增加推理投入、扩展权威网络来源和医学微调均无法消除这些失败模式。
Claude Code v2.1.281 为 Claude apps gateway 新增 Bedrock upstream 的 assume_role 与 guardrail 配置,并支持在 settings.json 中设置 "attribution": false 隐藏提交与 PR 署名。该版本还修复了会话恢复时重发历史、提示缓存丢失、代理中断流被误判为完成等多项问题。
inclusionAI 发布 Ming-Image-0.1-Design-Layer,可将一张平面设计图按指定层数拆解为多个 RGBA 图层,采用 MIT 许可证。模型推荐 1024 分辨率、12 步采样、CFG 2.0、BF16 精度,需单张 80 GiB 显存 CUDA GPU,可用 vLLM-Omni 部署,提示词增强支持 Ling-3.0-flash-VL 或 qwen3.8-27B。
inclusionAI 发布 Ming-Image-0.1-Design,一个面向 UI、信息图、海报等文字密集视觉设计的 6B 文生图模型,支持 RGBA 透明背景输出。
inclusionAI(Venus Team,蚂蚁集团与清华大学)在 Hugging Face 开源 Realtime-Venus,包含基于 MiniCPM-o 4.5 的 9B 视听交互模型 Realtime-Venus-Omni 和纯音频模型 Realtime-Venus-Audio。
研究提出 NowWAM,一种无需未来目标的协同训练方法,直接对当前观测去噪并从同一视觉流预测机器人动作,将生成式目标与动作表征耦合。在 LIBERO-Plus 上,NowWAM 搭配 FLUX2-Klein 达到 87.7%,较未来目标协同训练基线提升 6.1 分,训练视觉 token 从 784 减至 392,单步时间从 2.85 s 降至 1.63 s,提速 1.8 倍。
研究者提出 Gated Token Recurrence(GTR),一种无 softmax 的循环视觉骨干,结合门控线性注意力、交替空间扫描方向与空间增强 SwiGLU 模块,仅通过最终层 patch-token 对齐从检测专用 DINOv3 教师蒸馏。
Claude Code v2.1.280 加入 Claude Opus 5.5(claude-opus-5-5)作为默认 Opus 模型,1M 上下文,$4/$20 per Mtok,cache reads $0.20/Mtok;Pro 和 Team Standard 计划默认模型由 Sonnet 改为 Opus。
推荐理由:发布日志列出 Opus 5.5 成为默认模型及其定价上下文,并包含大量修复与 VSCode 新对话框,读者可对照更新自己的工作流。
OSWorld-Pro 是一个面向计算机使用智能体(CUA)的过程式评测基准,包含 300 多个任务、2800 多个子目标,基于 67000 多条人工标注,用人类对齐的 LLM-Judge 评估子目标完成情况。该基准对 SOTA 模型仍有挑战,Claude Opus 5 仅得 75.7%,低于其在 OSWorld 上的 83.4%。研究还识别出子目标无关操作、点击类错误等过程性失败模式。
Claude Code v2.1.278 将 Claude API、Enterprise 用户以及 Bedrock、Vertex、Foundry 和网关上的 Auto 模式默认切换为服务端分类器,该分类器不收取分类器开销费用。
Claude Code v2.1.277 新增 AGENTS.md 支持:项目中没有 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改,但 Bedrock、Vertex 和 Foundry 暂不支持。
Claude Code 发布 v2.1.276,修复了当 ANTHROPIC_BASE_URL 指向代理或网关时,所有请求因 `400 … Input tag 'advisor_20260301'` 报错而失败的问题。该问题为 2.1.275 版本引入的回归。
Claude Code v2.1.275 新增 send-now 快捷键(ctrl+enter 或 ctrl+x ctrl+s),可中断当前回合并一次性发送所有排队消息。
inclusionAI 发布开源 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型:Design 生成 UI、信息图、海报等富文本视觉设计,Design-Layer 将扁平设计图分解为可独立编辑的透明图层。
Venus 团队(蚂蚁集团)与清华大学开源 Realtime-Venus,一个支持全双工对话与异步任务委托的交互系统,代码采用 Apache License 2.0。
Claude Code v2.1.273 为 LLM 网关新增 `x-claude-code-request-class` 等请求头,需用 `CLAUDE_CODE_GATEWAY_HINT_HEADERS=1` 开启。
inclusionAI 在 Hugging Face 开源 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI Agent,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
Claude Code 发布 v2.1.272,本次更新以修复 bug 和提升可靠性为主,未引入新功能。
研究者推出 ReactHuman,首个面向具身多模态 LLM 类人反应式决策的物理基准,让模型充当仿真人形机器人的大脑应对突发家庭危险,覆盖 17 类事件、超 1000 个可逐位复现场景,真值来自 240 Hz 刚体仿真。评测 7 个代表性 MLLM 显示,模型约每 3 个危险就处理错 1 个,依赖固定倾向而非观察场景、轻信外观而非运动,且这些失败不随模型规模缩小。
研究提出"胜任力门控"方法,通过已解决结果估计领域级来源权重并收缩至全局权重,再校准池化预测,在 2,357 个已解决二元问题和五个语言模型上将外部基线 Brier 从 0.0771 降至 0.0732,显著优于全局预测组合。
研究者提出 TRACE,一个面向火灾后物体理解的变化感知基准,包含 21.4K 真实图像合成的场景,覆盖 189 类、499 个物体身份,并定义退化物体检测、原始状态恢复与检索、原始材质恢复、原始描述生成和功能推理五项任务。
Claude Code v2.1.271 为 Remote 会话(云端与自托管 runner)新增 fast mode,按组织策略应用宿主机设置或会话内 `/fast`。
研究提出 Program-Solve 接口,让模型不直接计算,而是编写针对具体病例的 Python 代码,由受限本地执行器作为确定性求解器运行。
Ambient 在 ECCV 2026 可穿戴 AI 挑战赛 EgoProactive 赛道获大模型组第一、总排名第二。该方法将主动干预判定改为对 yes/no 两个 token 的重归一化概率做决策,相比自由生成把 macro-F1 提升 0.249、G-mean 提升 0.30。
Ambient 在 ECCV 2026 Wearable-AI Challenge 的 EgoLongQA 赛道以 0.8279 的成绩拿下 <=2B 参数组第一,方案是把工具型智能体流水线中的初级感知模块蒸馏进单个 2B 视觉语言模型,一次贪心前向即可回答十分钟第一视角视频的选择题。
研究提出"任务无关的环境预处理"设定:LLM 智能体在测试前、不知下游任务分布的情况下,自主探索陌生环境并产出可复用产物供冻结的求解器使用。在六个异构基准上,配备归档的 meta-agent 变体在五个基准取得最高 Avg@3 奖励,固定语料处理在最大语料基准上仍最优;更大的研究预算并未稳定提升下游奖励,但研究产物可减少达到既定分数所需的测试时采样次数。
TRACE 是一个免训练的 GUI 智能体视觉 token 剪枝框架,通过布局交互先验、指令相关性与特征新颖度对视觉证据排序,并预留预算保留原生视觉 token 以修复空间覆盖。其嵌套 token 顺序与单调 KV 收缩机制让保留证据可随预算单调缩减并在整条轨迹中复用,避免重复视觉编码。在六个 GUI benchmark 和多种模型上验证了紧预算下的有效性,源码将开源。
ActionSplice 通过反事实状态传输(CST)在采样中途编辑动作,无需重放已完成计算,世界模型与采样器保持冻结。CST_R 重定向整个活跃 chunk,CST_T 保留干预步的时间前缀、只修正后缀。
DataFlex-RL 是用于在统一 GRPO 配方下比较 RLVR 数据策略的评估平台。基于 Qwen2.5-7B-Base 在 12 个数学、逻辑与科学基准上测试 13 种配置,Uniform GRPO 较未训练检查点提升 7.76 个百分点,但八种 rollout 选择或重加权方法均未显著优于均匀采样,三种自适应混合也未胜过固定等权混合。
研究者提出用大型语音克隆模型作为可编程数据源,将 15 秒语音参考转化为完全基于合成语音训练的紧凑固定音色学生模型,并开源 82M 参数的泰语 TTS 模型 Wayu-Paxa-TTS-Edge,支持无参考音频的端侧泰语合成。
研究拆解合成 OCR 数据中字体多样性、二维结构与真实手写字形对泰语文档迁移的影响,并据此将 0.9B 参数的 PaddleOCR-VL-1.6 适配为 Wayu-Paxa-OCR-Zero,全程仅用 45,723 页合成数据、无需真实 OCR 标注。
研究者提出 Diverse Skill Routing(DSR),一种基于 Determinantal Point Process 的多样性感知重排序框架,用于 LLM 智能体的技能路由,通过 query-residual diversity kernel 在相关性与非冗余之间取得平衡。
研究在反馈预算有限(m ≪ T)的在线场景下,将提示词自适应路由到多个 LLM 专家以最大化回答质量,并建模为含 K 个专家动作、d 维提示词特征的 bandit 问题。所提算法在全信息设定下达到 Õ(dT/√m) 的 regret,在 bandit 设定下达到 Õ(dT√(K/m))。实验表明其能从有限反馈中高效学到跨多种 LLM 的高质量路由策略。