跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 21–40 条 · 共 64 条
9月23日周三
  1. Greg Brockman79

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款更快、更实惠的模型,基于 GPT-6 Astra 的技术积累。两款模型在专业工作、事实性、编码、computer use 和对齐方面延续 Astra 的 SOTA 表现,同时缓存和推理效率提升使 API 价格比 GPT-5.6 促销价低 50%。

    引用OpenAI@OpenAI

    Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

    推荐理由:原文由当事方宣布两款新模型及降价幅度,读者可以据此了解 GPT-6 系列的能力分工与成本变化。

  2. Noam Brown82

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,性能优于 GPT-5.6 且 API 价格低 50%。Luna 现为 $0.10 输入 / $0.50 输出每 1M tokens,这是继 7 月底 Luna 降价 80% 之后的又一次下调,两个月内输出价格从 $6 降至 $0.50。

    引用OpenAI@OpenAI

    Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

    推荐理由:作者以当事方身份给出模型、降价幅度和具体价格,可据此比较 GPT-6 系列的成本变化。

9月22日周二
  1. Anthropic Newsroom90

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,官方称其表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 价格为 $4 和 $20 每百万,缓存读取 $0.20 每百万(降低 60%),输出速度快 30% 以上。

    推荐理由:官方给出完整基准、价格与安全评估细节,读者可据此比较 Opus 5.5 在成本与智能体编码上的实际变化。

9月21日周一
  1. OpenRouter Announcements68

    TypeSafe 决策模型 Jev 1.13 上线 OpenRouter,面向开发者解析用法

    TypeSafe 于 2026 年 9 月 15 日发布早期访问版决策模型 Jev(当前版本 1.13),现已可通过 OpenRouter 调用。Jev 是非生成式决策模型,只接受文本输入,返回 Choice、Score、Noul 三种类型化答案并附带校准概率,无自由文本输出。

    推荐理由:原文给出 Jev 三个返回原语、真实 API 响应和定价细节,开发者可据此判断是否用它替换现有 LLM 加正则的分类流程。

9月20日周日
  1. elsewhere articles65

    Sayash Kapoor 与 Arvind Narayanan 分析 AI 会不会让论文更快却让科学进步更慢

    Sayash Kapoor 和 Arvind Narayanan 在 2025 年发表的文章提出生产—进步悖论:全球论文数量约每 12 年翻一番,1900 至 2015 年间增长约 500 倍,但诺奖成果诞生于获奖前 20 年内的比例从 1970 年约 90% 降至 2015 年约 50%,科学进步相对投入明显放缓。

    推荐理由:文章把 AI 加速科研的讨论从模型能力转向注意力、激励、可复现性和人类理解等制度瓶颈,提供了评估 AI 科研工具的三个问题。

9月17日周四
9月10日周四
9月9日周三
  1. Eric70

    OpenAI 宣布给出纳维-斯托克斯千禧年大奖难题的一个解,证明由一组智能体使用比 GPT-6 Astra 能力更强的 OpenAI 下一代模型产出。该问题关注纳维-斯托克斯方程描述的光滑三维流体运动是否会崩溃,约 90 年来未获解决。转发作者以在 OpenAI 工作的口吻感叹又是一个疯狂的日子。

    引用OpenAI@OpenAI

    We’re sharing a solution to the Navier-Stokes Millennium Prize Problem, one of the deepest problems at the frontier of mathematics. The proof was produced by a group of agents, using an OpenAI next-generation model significantly more capable than GPT-6 Astra. The problem concerns whether the description of smooth three-dimensional fluid motion modeled by the Navier-Stokes equations can break down. It has remained unresolved for roughly 90 years.

    推荐理由:OpenAI 官方宣布用下一代模型的智能体群产出纳维-斯托克斯千年问题证明,读者可以关注智能体做数学研究的这一路径。

9月3日周四
8月26日周三
  1. Z.ai72

    智谱(Z.ai)发布 GLM-5.3-Flash,称具备有竞争力的价格与原生多模态能力,上下文窗口为 1M token,为 320B-A18B 模型并以 MIT License 开源权重。该模型此前曾以 Ox Alpha 名义预览,完全运行于中国 AI 芯片;现已在官方平台提供权重、API、Coding Plan、ZCode、Chat 和 AutoClaw 入口。

    推荐理由:官方公告同时给出价格定位、开源权重和芯片适配信息,读者可以据此评估它在现有工作流中的替换可能。

8月25日周二
  1. Hugging Face Blog63

    IBM 发布 Granite 4.2 推理模型家族并详解构建过程

    IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。

    推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。

8月21日周五
  1. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。

8月13日周四
  1. Microsoft AI News66

    Microsoft AI 发布推理模型 MAI-Thinking-1

    Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。

    推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。

8月12日周三
  1. Google Research62

    Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。

    推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。

8月5日周三
  1. AI as Normal Technology67

    Princeton 团队用 shadow evaluations 测试前沿 Agent 的开放式 AI 研究能力,专家否决了两篇 Agent 论文

    Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。

    推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。

7月27日周一
  1. LMSYS Blog78

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 支持

    SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。

    推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。

7月14日周二
  1. AI as Normal Technology72

    Arvind Narayanan 在 ICML 演讲谈 AI 时代还剩什么工作

    Princeton 的 Arvind Narayanan 在 ICML Seoul 发表题为“还有什么工作留给我们做”的主题演讲,主张用 AI as Normal Technology 框架看待AI影响,并称实验室里程碑不会突然让人失业。他提出方法、产品、早期采用、适应四阶段,指出可靠性指标两年内仅提升五到十个百分点、适应阶段需要数十年;未来工作将从构建转向评估,人类应与AI形成“共同超级智能”。

    推荐理由:作者结合能力与可靠性的测量数据,把AI经济影响拆为四个阶段,给出职业适应与评估优先的判断框架。