FlexRouter:为灵活 LLM 路由学习互补模型集合
FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。
FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。
arXiv 论文 2609.38349 提出 MILO(Meta-evolutionary Island Orchestration),协同演化 agent harness 与发现 harness 的搜索策略,包含岛屿树层级谱系记忆、重写完整 harness 的 mutator agent 和自适应 orchestrator。
音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。
LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。
HeteroFold 是一种免预填充的跨模型族 KV Cache 传输方法,可在发送方与接收方均冻结的前提下对齐模型结构、映射并校准缓存。在六个传输方向上,它于四个长上下文基准上均取得最佳缓存传输表现,并在多智能体基准上追平文本通信。
研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的有效注意力集合大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小但其占上下文比例下降,对保留权重重新归一化可大幅缩小该集合。
Prompt2Skill 是一个仅凭自然语言任务描述即可构建技能的无监督框架,能从提示词中推导任务规范、发现或合成数据集,并通过反思式编辑闭环迭代优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架平均提升 10.8 分,持续优于直接提示基线。
CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。
Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。
Anthropic 发布对智谱 GLM-5.3 的网络安全能力分析,认为它是首个在无实质防护下开放权重的强网络攻击能力模型,与 NIST CAISI 评估结论大致一致。
推荐理由:Anthropic 以一手评测数据说明 GLM-5.3 的漏洞利用能力与防护绕过率,并解释攻击者可及性与 Claude 的访问限制差异。
一种名为 label-free bias-only TTRL 的方法仅优化约 100K 偏置参数、冻结预训练主干,在 MATH-500 上让 Qwen2.5-7B 达到 76.67% 准确率,略超其有标签偏置引导复现结果,且参数量比全参数 TTRL 少 76,000 倍。
SeLMRoute 是一种将候选模型无关的语义证据提取与候选性能学习、部署目标应用分离的 LLM 路由框架,先通过可解释问题生成概率语义状态,再由轻量监督路由器估计候选模型表现。
B200 GPU 租金九个月内从 $4.40 翻倍到 $8.08 每 GPU 小时,但 AI 价格仍在下降。作者归因于数据中心建设成本上升、需求爆发与推理效率提升并存:同一基准的完成成本从 $0.55 降到 $0.0015,Microsoft 称每 GPU 生成 token 数同比增长 90%。
针对潜空间视觉推理(LVR)中潜 token 对图像扰动响应微弱、缺乏显式监督的"潜证据信用缺口",研究者提出 ReaLVR,通过对比正确答案与模型生成的错误答案、匹配与不匹配的视觉证据,为模型自身的潜推理轨迹提供视觉证据监督。
Rubric Response Theory(RRT)用两参数项目反应模型把评分标准的判定模式转化为标量质量信号,替代传统的分数加总方式。其 Response Parameter Network(RPN)根据提示词和标准文本预测标准难度与区分度,并随训练用在线期望最大化更新。
arXiv 论文(arXiv:2609.35928)发现,多智能体 LLM 系统中当各智能体知晓彼此的模型家族时,群体会按标签分裂为派系,即任务本身并不奖励的 factionalism 现象。
Sakana AI 与东京大学合作提出 SAIL(Scaling In-Context Imitation Learning),通过测试时扩展让 VLM 更可靠地生成机器人轨迹,该工作将在 IROS2026 展示。
LANTERN 通过预训练模型激活上的分类器对候选关系排序,结合分阶段过滤、假设生成、可执行验证与分析检查,在 OEIS 的 10,000 个高频序列中排名 5000 万对,产出 62 条此前无交叉引用的已验证关系。
推荐理由:九圈散射振幅计算由 Dixon 独立验证,计算成本仅几千美元,为学界评估 AI 科研能力提供了一个可核验的案例。
物理学家 Matt von Hippel 发文复盘,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 驱动的 Claude Science 完成他提出的挑战。
推荐理由:物理学家亲历 Claude 用千元级预算独立完成九圈振幅计算,给出对 AI 科研能力和低垂果实的第一手判断。
inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。
推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。
inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。
推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。
inclusionAI 发布 Ling 2.0 系列首款旗舰非思考模型 Ling-1T,总参数 1T、每 token 激活约 50B,支持 128K 上下文。
推荐理由:官方模型卡给出架构、训练规模和基准对比细节,读者可据此评估这款万亿参数非思考模型的推理效率与部署方式。
inclusionAI 基于 Ling 2.0 架构正式发布 Ring-mini-2.0,总参数 16.8B、激活参数仅 1.4B,经 Long-CoT SFT。
inclusionAI 正式开源思考模型 Ring-flash-2.0,总参数 100B、每次推理仅激活 6.1B,基于 Ling-flash-2.0-base 深度优化。
推荐理由:官方发布完整披露了 icepop 算法、多阶段 RL 训练流程和部署参数,读者可以评估其推理性价比与可复现性。
inclusionAI 正式发布开源思考模型 Ring-1T,总参数 1 万亿、激活 50B,基于 Ling 2.0 架构和 Ling-1T-base,上下文经 YaRN 扩展至 128K,权重可在 Hugging Face 与 ModelScope 下载,并支持 Ling Chat 和 ZenMux 体验与 API 调用。
推荐理由:官方发布开源万亿参数思考模型,给出 IMO 与 ICPC 实测结果和 Icepop、ASystem 训练细节,便于评估其推理与部署价值。
inclusionAI 发布开源万亿参数思考模型 Ring-2.5-1T,采用 1:7 MLA + Lightning Linear Attention 混合线性注意力架构,激活参数从 51B 增至 63B。
推荐理由:原文给出了混合线性注意力的具体效率数字和多项基准成绩,读者可以据此评估它在长程智能体场景中的实际取舍。
inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。
推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。
inclusionAI 开源 Ling 家族旗舰模型 Ling-2.6-1T,参数量达 1T,面向复杂推理、编码和 Agent 工作流。
推荐理由:官方发布万亿参数旗舰开源模型,给出架构设计、benchmark 结果和 SGLang/vLLM 部署细节,便于评估其实际可用性。
inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。
推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。
inclusionAI 在 Hugging Face 发布 Ling-3.0-flash,为原生混合线性注意力 MoE 模型,总参数 124B、每 token 激活 5.1B,约为此前 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,官方称在关键基准上持平或超越前代。
inclusionAI 发布轻量混合推理 MoE 模型 Ling-3.0-tiny,总参数 7.9B,每 token 仅激活 1.3B,采用 3:1 KDA-MLA 混合线性架构加 128 专家稀疏 MoE FFN。
蚂蚁集团联合多家金融机构与领域专家推出 Ling-3.0-flash-Fin,这是 Ling 系列首个金融增强模型,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,总参数 124B、激活参数 5.1B、上下文窗口 256K。
文章以小米 9 月开源的 MiMo-V2.6 系列为切入点,分析大模型「斩杀线」概念,即在智能和成本两个维度都被超过的模型会失去被选择的理由。
推荐理由:文章借小米 MiMo-V2.6 梳理了智能与成本双维度的行业竞争框架,读者可以据此理解 Agent 时代效率为何成为模型竞争的新坐标。
Apple 研究团队提出 probe guidance,利用现有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,autoguidance 中的弱模型必须来自训练的低熵区域。
Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
推荐理由:原文由当事方宣布两款新模型及降价幅度,读者可以据此了解 GPT-6 系列的能力分工与成本变化。