跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

当前仅显示精选新闻

最新精选

第 121–140 条 · 共 212 条
8月16日周日
  1. 机器之心 · 微信公众号76

    AI 辅助证明 70 年森多夫猜想,陶哲轩简化后得出更强结果

    初创科技公司 CEO Lech Mazur 借助 GPT-5.6 Pro 完成森多夫猜想的证明,论文配有约 9 万行 Lean 4 形式化代码。陶哲轩用数天时间在大量 AI 辅助下消化、简化并重新形式化该证明,Lean 代码缩减到约 1.5 万行,并发现整理后的论证实际上证明了更强的 Phelps-Rodriguez 猜想,该猜想已于 1972 年提出。

    推荐理由:一篇非职业数学家借助 AI 完成的证明经陶哲轩简化后得出更强结果,可看到 AI 参与数学研究的具体分工。

8月13日周四
  1. DeepSeek68

    DeepSeek 发布 DeepSeek-V4-Pro,重点升级 Agent 能力并已在 app/web 的 Expert Mode 和 API 上线,模型名不变。V4-Pro 与 V4-Flash 支持灵活推理档位,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。同时原生支持 OpenAI Responses API,针对 Codex 优化并提供一键设置,详情见 API 文档。

    推荐理由:发布方直接给出 Agent 能力升级、可调推理档位和 OpenAI Responses API 兼容,读者可对照判断是否切换日常模型。

  2. Simon Willison76

    DeepSeek V4 Pro 0813 上线 OpenRouter,权重随后在 Hugging Face 开放

    DeepSeek 最新 Pro 模型 DeepSeek V4 Pro 0813 已通过 API 上线,作者因找不到官方发布页面而链接到 OpenRouter;随后更新称权重已在 Hugging Face 开放,1.7T 参数、893 GB。

    推荐理由:记录了新模型仅以 API 形式上线、权重随后开放至 Hugging Face,以及作者自测不同推理档位的输出差异。

  3. 量子位 · 微信公众号78

    DeepSeek V4 Pro 正式版发布,多项基准对标 Fable 5

    DeepSeek V4 Pro 正式版发布,API 平台已上线 DeepSeek-V4-Pro-0813,官方博客尚未发布。在 HLE、Terminal Bench、Cybergym、DeepSWE 等 Agent 基准上,它几乎全面超过 Opus 4.8,逼近 Fable 5,部分榜单反超;百万 tokens 输入 3 元、缓存命中 0.025 元、输出 6 元。

    推荐理由:素材给出多项 Agent 基准对比与 API 定价,可据此判断国产开源模型与闭源前沿的差距及调用成本。

  4. Microsoft AI News66

    Microsoft AI 发布推理模型 MAI-Thinking-1

    Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。

    推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。

8月12日周三
  1. Google Research62

    Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。

    推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。

  2. 机器之心 · 微信公众号76

    论文揭示前沿模型 API 漏洞:可用弱模型提取 Claude、GPT-5.6 的隐藏思维链

    一篇论文指出 OpenAI、Anthropic、Google 的前沿模型 API 存在设计缺陷,加密返回的完整思维链可以被转移到同系列较弱模型中复述为明文。研究者拿不到服务器端明文,只能用 API 计费的思考 Token 数做长度校验,在 120 道 Codeforces 题目上提取文本的 Token 数与源模型报告高度接近。

    推荐理由:论文给出了跨模型提取隐藏思维链的完整攻击链,读者可据此了解推理模型 API 的设计缺陷与修复方向。

  3. AGI Hunt · 微信公众号77

    116 页论文曝光前沿模型漏洞:加密思维链两次 API 调用即可提取,GPT、Claude、Gemini 均受影响

    一篇 116 页论文披露 Anthropic、OpenAI、Google 的 API 存在架构级漏洞,同一厂商不同会话与模型之间的加密思维链块可互换,只需两次 API 调用就能提取。

    推荐理由:论文披露专有模型 API 的加密思维链可跨模型提取,并给出蒸馏、隐私泄露与隐藏推理行为的多组实测证据。

  4. Cursor Blog68

    Cursor 与 SpaceXAI 发布 Grok 4.6,面向长时间运行的智能体

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,该模型基于 Grok 4.5 打造,重点面向长时间运行的智能体以及更复杂的交互与视觉工作。它在由九项基准测试构成的 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。

    推荐理由:Grok 4.6 与 GPT-5.6 Sol 在综合智能指数上持平,文中给出了与 Grok 4.5 及 GPT-5.6 Sol 的多项基准对比。

8月11日周二
  1. AI寒武纪 · 微信公众号82

    Anthropic 内部研究版 Claude 将黎曼ζ函数零点已知下界从41.6%推到67.2%

    Anthropic 一个内部未公开的研究版 Claude 在黎曼猜想的关联问题上取得进展,将黎曼ζ函数零点中满足黎曼猜想的已知下界从41.6%提升到67.2%,即提高25.6个百分点,而此前37年里数学家仅将其推进0.8个百分点,黎曼猜想本身仍未获证明。

    推荐理由:相比数学家37年仅推进0.8个百分点,这次提升展示了大模型子智能体协作推进数学问题的一种路径。

8月6日周四
  1. InfoQ · 微信公众号76

    Jeff Dean 离职 Google 创办 Discovery Loop,访谈中承认低估了 AI 进展速度

    Jeff Dean 宣布明天是他在 Google 的最后一天,将与 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创立聚焦机器学习、科学和工程前沿研究的公益性公司 Discovery Loop,Google 将作为创始投资方和云计算合作伙伴继续合作。

    推荐理由:Jeff Dean 在离职前夕的访谈中复盘了自己对 AI 进展速度的误判,并给出推理硬件与创业领域选择的具体判断依据。

8月5日周三
  1. AI as Normal Technology67

    Princeton 团队用 shadow evaluations 测试前沿 Agent 的开放式 AI 研究能力,专家否决了两篇 Agent 论文

    Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。

    推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。

8月2日周日
  1. 量子位 · 微信公众号81

    OpenAI 新模型 Astra 连解 10 道数学难题,成本不到 2000 美元

    OpenAI 公开下一代主力模型 Astra 内部测试版本的研究成果,一次性解决 10 项长期悬而未决的数学与理论计算机科学公开难题,全部证明通过 Lean 形式化工具机器验证,总成本不到 2000 美元。

    推荐理由:文章列出 Astra 攻克的 10 道数学难题与完整推理过程,可观察长链推演中的自我纠错。

8月1日周六
  1. AI寒武纪 · 微信公众号86

    OpenAI 确认下一代模型 Astra 存在,约 2000 美元算力解出十项数学前沿难题

    OpenAI 官宣下一代模型 Astra 的存在,并公布其在数学与理论计算机科学领域完成的十项突破,这些问题此前至少十年未有解法,在 Sol API 费率下总算力成本约 2000 美元。

    推荐理由:OpenAI 公开下一代模型 Astra 攻克的十项数学难题,并给出 Lean 形式化验证与解题过程,可观察模型参与前沿研究的实际方式。

7月31日周五
7月27日周一
  1. LMSYS Blog78

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 支持

    SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。

    推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。