跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

当前仅显示精选新闻

最新精选

第 181–200 条 · 共 211 条
5月25日周一
5月23日周六
5月22日周五
  1. Mistral AI69

    Mistral 发布 Mistral Medium 3.5 并在 Vibe 和 Le Chat 推出云端远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型(modified MIT 许可),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,自托管最少只需四块 GPU,API 定价每百万输入 token $1.5、输出 token $7.5。

    推荐理由:官方同步发布模型与云端异步智能体,给出基准分数、定价和开源权重,可对照评估其编码与长程任务能力。

5月21日周四
  1. @kimmonismus86

    OpenAI 称其内部推理模型自主推翻了数学家 Paul Erdős 在 1946 年提出的平面单位距离问题猜想,找到了比正方形网格更优的新点构型,性能提升为固定多项式因子。

    引用OpenAI (@OpenAI)@OpenAI

    Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video

    推荐理由:OpenAI 称推理模型自主推翻 Erdős 猜想,作者补充了选题由 OpenAI 决定这一前提,便于读者评估结论边界。

  2. @AYi_AInotes69

    AI 处理数学问题的思维链长达125页,大部分时间用于构造反例,而非死磕证明,OpenAI 目前已公开精简版。数学家 Gowers 在审稿中表示,评估 AI 生成证明的重要性时他会问它是否教给我们关于这个问题的新东西,他认为答案是肯定的,这显示代数数论在离散几何里还有大量我们从未发现的连接。

    推荐理由:材料点出 AI 解题的思维链长达125页且多在构造反例,并附上数学家 Gowers 的审稿评价,可看到 AI 参与数学研究的实际形态。

  3. @AYi_AInotes79

    OpenAI 宣布其模型推翻了数学界近 80 年对平面单位距离问题的判断,找到一整族比方格子效率更高的新构造。该问题由 Paul Erdős 在 1946 年提出,模型借助无限类域塔、Golod–Shafarevich 理论等代数数论工具求解,125 页思维链已公开并经数学家验证。

    引用OpenAI (@OpenAI)@OpenAI

    Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video

    推荐理由:原文呈现 AI 自主解决数学开放问题的过程,读者可了解它如何把冷门数论工具带入几何难题。

  4. @polynoamial79

    OpenAI 分享称,一个通用内部模型在平面单位距离问题上取得突破,推翻了数学界近 80 年来认为最优解近似方格网格的看法,发现了一族性能更优的全新构造。该问题由 Paul Erdős 于 1946 年提出,OpenAI 称这是 AI 首次自主解决数学领域一个著名开放问题。作者提到不到 1 年前前沿 AI 模型还处于 IMO 金牌水平,并预期这一进展速度会持续。

    引用OpenAI (@OpenAI)@OpenAI

    Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video

    推荐理由:OpenAI 称其内部通用模型推翻平面单位距离问题近 80 年的网格假设,读者可据此判断 AI 自主做数学研究的进度。

  5. @OpenAI69

    OpenAI 表示,一项离散几何猜想的证明由一个通用推理模型给出,而不是专门为解数学题或该问题构建的系统。该结果被视为数学与 AI 社区的一个重要里程碑,详情见 https://openai.com/index/model-disproves-discrete-geometry-conjecture/。

    推荐理由:OpenAI 说明该证明出自通用推理模型而非专为数学问题打造的系统,读者可据此了解结果在数学与 AI 交叉领域的意义。

5月20日周三
5月14日周四
  1. @berryxia72

    Unsloth 创始人 Daniel Han 发布 Qwen3.6 实验版 MTP GGUF,27B 模型单 GPU 生成速度达 140 tokens/s,35B-A3B 版本达 220 tokens/s。

    引用Daniel Han (@danielhanchen)@danielhanchen

    We released experimental MTP Qwen3.6 Unsloth GGUFs! Qwen3.6 27B MTP now runs at 140 tokens/s. Qwen3.6 35B-A3B MTP gets 220 tokens/s generation on a single GPU. Qwen3.6 27B and 35B-A3B have >1.4x speed-up over the original GGUFs without any change in accuracy. Guide + GGUFs + Benchmarks: unsloth.ai/docs/models/qwen3… In terms of average speedup, we see a 1.4x for dense models at draft tokens = 2 and for the MoE around 1.15 to 1.2x. We do not recommend more than 2 draft tokens because the acceptance rate drops precipitously from 83% to 50% with 4 draft tokens, and the forward passes for MTP become less beneficial. Use `--spec-type mtp --spec-draft-n-max 2` Thanks to Aman for github.com/ggml-org/llama.cp…!

    推荐理由:原文给出单 GPU 实测速度、加速比与 draft tokens 甜点,可据此判断本地 30B 级模型的部署空间。

5月11日周一
  1. Thinking Machines Lab Blog73

    Thinking Machines Lab 发布 TML-Interaction-Small 交互模型研究预览

    Thinking Machines Lab 发布交互模型研究预览,模型原生处理音频、视频和文本的实时交互,而非依赖外部 harness。TML-Interaction-Small 为 276B 参数 MoE(12B 激活),采用 200ms 微轮次多流设计和无编码器早期融合,并配合异步后台模型处理深度推理。

    推荐理由:原文给出交互模型的技术路线、架构细节和基准对比,读者可据此评估原生交互与外挂式实时方案的能力差距。

4月25日周六
  1. LMSYS Blog73

    SGLang 与 Miles 实现 DeepSeek-V4 (1.6T Pro, 284B Flash) Day-0 推理与 RL 训练支持

    SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。

    推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。

4月24日周五
4月16日周四
  1. Claude Platform release notes84

    Anthropic 发布 Claude Opus 4.7,维持 $5/$25 定价并引入 task budgets 与高分辨率图像输入

    Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。

    推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。

3月17日周二
3月11日周三
  1. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

12月17日周三
  1. LMSYS Blog62

    LMSYS 发布 Mini-SGLang:5k 行代码的高性能 LLM 推理引擎

    LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。

    推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。

12月3日周三
  1. Mistral AI77

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3,均以 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。

    推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。

12月1日周一
  1. DeepSeek API updates69

    DeepSeek-V3.2-Speciale 开放非正式 API 访问,截止 2025-12-15

    DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。

    推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。