跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

当前仅显示精选新闻

最新精选

第 101–120 条 · 共 212 条
8月21日周五
  1. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。

8月20日周四
  1. @omarsar071

    推文称,围绕 dots3-note Preview 一个分支搭建的内部 harness 让系统递归生成、评估并改进证明,最终获得官方认证的 42/42 成绩,并在 IMO 2026 摘得金牌。作者据此说明,自评审在训练循环之外同样有效。配图显示 harness 界面中 P1 至 P6 均为 7/7。

    原始视频预览图;未保存可播放视频URL

    推荐理由:推文展示自评审在训练循环之外同样奏效,并给出 IMO 2026 官方认证的 42/42 成绩作为依据。

8月17日周一
  1. xAI News77

    xAI 发布 Grok 4 Fast,统一推理与非推理模式并支持 2M token 上下文

    xAI 发布 Grok 4 Fast,称其用平均少 40% 的思考 token 在基准上达到与 Grok 4 相当的表现,同一前沿基准性能的价格降低 98%。该模型采用统一架构,由系统提示词切换长链推理与快速响应,具备 2M token 上下文窗口和端到端训练的工具调用与网络、X 搜索能力,在 LMArena Search Arena 以 1163 Elo 排名第一。

    推荐理由:原文给出与 Grok 4 的基准对比、token 消耗和 API 定价,读者可据此判断推理模型的成本效率走向。

  2. xAI News62

    xAI 发布 Grok 及底层模型 Grok-1

    xAI 发布 AI 助手 Grok,其底层是自研前沿 LLM Grok-1,Grok 通过 𝕏 平台具备对世界的实时知识。Grok-1 在 HumanEval 上取得 63.2%、MMLU 73%、GSM8k 62.9%、MATH 23.9%,xAI 称其在该算力级别中超过 ChatGPT-3.5 和 Inflection-1,仅落后于训练数据和算力大得多的 GPT-4。

    推荐理由:原文给出 Grok-1 在 HumanEval、MMLU 等基准上的分数与同算力级别的横向对比,可据此判断其能力定位。

  3. xAI News74

    xAI 发布 Grok-2 与 Grok-2 mini 测试版

    xAI 发布 Grok-2 与 Grok-2 mini 的早期预览版,称它们在聊天、编码和推理上较 Grok-1.5 有显著提升。早期版本以 sus-column-r 名义在 LMSYS 榜单测试,xAI 称其整体 Elo 超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。

    推荐理由:原文给出 Grok-2 与 Grok-2 mini 的完整基准表和竞技场排名,可与 Claude、GPT-4o 等模型直接对照。

  4. xAI News70

    xAI 发布 Grok-1.5,上下文窗口扩至 128K tokens

    xAI 发布 Grok-1.5 模型,具备长上下文理解与高级推理能力,将在未来几天面向早期测试者和 𝕏 平台现有 Grok 用户开放。Grok-1.5 在 MATH 得 50.6%、GSM8K 得 90%、HumanEval 得 74.1%,相比 Grok-1 的 23.9%、62.9% 和 63.2% 均有提升。

    推荐理由:原文给出 Grok-1.5 的数学、编码基准成绩与 128K 上下文窗口,读者可据此对比同期模型的推理能力。

  5. xAI News64

    xAI 发布语音模型 Grok Voice Think Fast 2.0

    xAI 发布新一代语音模型 Grok Voice Think Fast 2.0,称其在语音推理、转录准确率和对话能力上较 1.0 有明显提升。该模型在 Artificial Analysis 语音到语音质量指数上为 82.9%,首字延迟 0.70s,转录准确率相对 Deepgram Nova 3 与 ElevenLabs Scribe v2 提升 1.5–2.0 倍。

    推荐理由:相比 1.0 与 GPT-Realtime-2.1,原文给出了语音质量、推理效率与首字延迟的对比数据,可供语音智能体选型参考。

  6. Mistral AI67

    Mistral 发布 Mistral Small v24.09,并推出免费层与全线降价

    Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。

    推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。

  7. Mistral AI68

    Mistral AI 发布 Mistral Large 2,128k 上下文与 123B 参数

    Mistral AI 发布 Mistral Large 2,具备 128k 上下文窗口和 1230 亿参数,针对长上下文应用设计,可在单节点上实现大吞吐推理。官方称其预训练版本在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 处于同一水平。

    推荐理由:原文给出 128k 上下文、123B 参数与单节点部署的设定,读者可据此判断这一代模型在性能与成本之间的取舍。

  8. Mistral AI84

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在全部评测上超过 Llama 2 13B,多项基准接近 Llama 1 34B。该模型采用分组查询注意力(GQA)和滑动窗口注意力(SWA),在 16k 序列长度、4k 窗口下推理提速 2x,并能在 8192 序列长度下节省一半缓存。

    推荐理由:官方给出与 Llama 2 系列同评估管线的对比和 Apache 2.0 授权,便于判断同尺寸模型的选型空间。

8月16日周日
  1. Anthropic Newsroom85

    Anthropic 发布 Claude Sonnet 5,智能体性能接近 Opus 4.8

    Anthropic 发布 Claude Sonnet 5,称其为最具智能体能力的 Sonnet 模型,即日起成为 Free 和 Pro 套餐默认模型,Max、Team、Enterprise 用户也可使用,定价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Anthropic 官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比数据,读者可据此判断同级模型的智能体能力与成本差距。

  2. Anthropic Newsroom86

    Anthropic 发布 Claude Opus 5,编码与知识工作基准领先且定价与 Opus 4.8 持平

    Anthropic 发布 Claude Opus 5,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到领先水平,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 25 美元。

    推荐理由:官方给出 Opus 5 在编码与知识工作基准上的位置和定价,可对照前代 Opus 4.8 判断性能与成本的取舍。