跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

当前仅显示精选新闻

最新精选

第 21–40 条 · 共 207 条
9月29日周二
  1. AGI Hunt · 微信公众号87

    Anthropic 发布 Claude Sonnet 5.5,性能贴近 Opus 5.5 且快 30%

    Anthropic 发布 Claude Sonnet 5.5,定位为 Opus 5.5 更快更便宜的搭档。输出速度比 Sonnet 5 快 30% 以上,单任务成本最多低 30%;价格与 Sonnet 5 一致,输入 $2、输出 $10(每百万 token),为 Opus 5.5 的一半。

    推荐理由:原文汇总了官方跑分、effort 档位成本曲线和客户实测数字,读者可据此判断该在哪类任务中用 Sonnet 5.5 替换更高档模型。

  2. Anthropic Research82

    Anthropic 评测 GLM-5.3:可自主构建端到端漏洞利用且防护易被绕过

    Anthropic 发布对智谱 GLM-5.3 的网络安全能力分析,认为它是首个在无实质防护下开放权重的强网络攻击能力模型,与 NIST CAISI 评估结论大致一致。

    推荐理由:Anthropic 以一手评测数据说明 GLM-5.3 的漏洞利用能力与防护绕过率,并解释攻击者可及性与 Claude 的访问限制差异。

9月26日周六
  1. Anthropic65

    Anthropic 发文称,Claude 在收到单个九圈问题提示词后,在 Claude Science 中基本无人监督地运行数天,用 Dixon 等人的方法完成求解,总成本几千美元,突破了此前八圈的纪录(平面 N=4 超杨-米尔斯简化模型)。物理学家 Lance Dixon 独立验证了结果,von Hippel 为该博客撰写了经历回顾。

    推荐理由:九圈散射振幅计算由 Dixon 独立验证,计算成本仅几千美元,为学界评估 AI 科研能力提供了一个可核验的案例。

9月25日周五
9月24日周四
  1. inclusionAI Hugging Face models60

    inclusionAI 开源 Ling-mini-2.0:16B 总参数 MoE 模型,激活仅 1.4B

    inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。

    推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。

  2. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-flash-2.0:100B 总参数、6.1B 激活的 MoE 模型

    inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。

    推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。

  3. inclusionAI Hugging Face models68

    inclusionAI 开源发布万亿参数思考模型 Ring-1T

    inclusionAI 正式发布开源思考模型 Ring-1T,总参数 1 万亿、激活 50B,基于 Ling 2.0 架构和 Ling-1T-base,上下文经 YaRN 扩展至 128K,权重可在 Hugging Face 与 ModelScope 下载,并支持 Ling Chat 和 ZenMux 体验与 API 调用。

    推荐理由:官方发布开源万亿参数思考模型,给出 IMO 与 ICPC 实测结果和 Icepop、ASystem 训练细节,便于评估其推理与部署价值。

  4. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-2.5-1T:1T 总参数、63B 激活的即时模型,支持 1M 上下文

    inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。

    推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。

  5. inclusionAI Hugging Face models60

    inclusionAI 发布万亿参数推理模型 Ring-2.6-1T

    inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。

    推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。

9月23日周三
  1. elsewhere articles68

    从 MiMo-V2.6 看大模型「斩杀线」:斩的是中间层模型

    文章以小米 9 月开源的 MiMo-V2.6 系列为切入点,分析大模型「斩杀线」概念,即在智能和成本两个维度都被超过的模型会失去被选择的理由。

    推荐理由:文章借小米 MiMo-V2.6 梳理了智能与成本双维度的行业竞争框架,读者可以据此理解 Agent 时代效率为何成为模型竞争的新坐标。

  2. Greg Brockman79

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款更快、更实惠的模型,基于 GPT-6 Astra 的技术积累。两款模型在专业工作、事实性、编码、computer use 和对齐方面延续 Astra 的 SOTA 表现,同时缓存和推理效率提升使 API 价格比 GPT-5.6 促销价低 50%。

    引用OpenAI@OpenAI

    Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

    推荐理由:原文由当事方宣布两款新模型及降价幅度,读者可以据此了解 GPT-6 系列的能力分工与成本变化。

  3. Noam Brown82

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,性能优于 GPT-5.6 且 API 价格低 50%。Luna 现为 $0.10 输入 / $0.50 输出每 1M tokens,这是继 7 月底 Luna 降价 80% 之后的又一次下调,两个月内输出价格从 $6 降至 $0.50。

    引用OpenAI@OpenAI

    Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

    推荐理由:作者以当事方身份给出模型、降价幅度和具体价格,可据此比较 GPT-6 系列的成本变化。

9月22日周二
  1. Anthropic Newsroom90

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,官方称其表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 价格为 $4 和 $20 每百万,缓存读取 $0.20 每百万(降低 60%),输出速度快 30% 以上。

    推荐理由:官方给出完整基准、价格与安全评估细节,读者可据此比较 Opus 5.5 在成本与智能体编码上的实际变化。

9月21日周一
  1. OpenRouter Announcements68

    TypeSafe 决策模型 Jev 1.13 上线 OpenRouter,面向开发者解析用法

    TypeSafe 于 2026 年 9 月 15 日发布早期访问版决策模型 Jev(当前版本 1.13),现已可通过 OpenRouter 调用。Jev 是非生成式决策模型,只接受文本输入,返回 Choice、Score、Noul 三种类型化答案并附带校准概率,无自由文本输出。

    推荐理由:原文给出 Jev 三个返回原语、真实 API 响应和定价细节,开发者可据此判断是否用它替换现有 LLM 加正则的分类流程。

9月20日周日
  1. elsewhere articles65

    Sayash Kapoor 与 Arvind Narayanan 分析 AI 会不会让论文更快却让科学进步更慢

    Sayash Kapoor 和 Arvind Narayanan 在 2025 年发表的文章提出生产—进步悖论:全球论文数量约每 12 年翻一番,1900 至 2015 年间增长约 500 倍,但诺奖成果诞生于获奖前 20 年内的比例从 1970 年约 90% 降至 2015 年约 50%,科学进步相对投入明显放缓。

    推荐理由:文章把 AI 加速科研的讨论从模型能力转向注意力、激励、可复现性和人类理解等制度瓶颈,提供了评估 AI 科研工具的三个问题。