跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

当前仅显示精选新闻

最新精选

第 81–100 条 · 共 211 条
9月2日周三
  1. @rohanpaul_ai70

    据 The Information 报道,OpenAI 的 Astra 模型据称采用了循环深度(looped transformer)架构,同一批 Transformer 层会在生成下一个 token 前反复处理同一信息。

    引用@rohanpaul_ai@rohanpaul_ai

    OpenAI says Astra is its first model to reach the Critical cybersecurity capability threshold. Under its Preparedness Framework, that means Astra can, with the right tools and access, find unknown flaws and develop exploits across hardened systems without step-by-step human guidance. Hence, OpenAI now says Astra will launch with additional chain-of-thought monitoring, while classifiers can automatically stop potentially unauthorized actions. Astra reached roughly 39% exploit success at ~75K output tokens, while GPT-5.6 Sol is only around 1% there and needs nearly 140K tokens to reach ~12% i.e. Astra is dramatically more capable and token-efficient at exploit development on this internal benchmark. Expert assessments went further: Astra escaped a browser sandbox, executed host commands, and escalated an unprivileged operating-system user to root.

    推荐理由:借 The Information 的报道说清 looped transformer 如何在不增参数的前提下提高单 token 算力,以及它对推理可监控性的影响。

9月1日周二
  1. @TencentHunyuan72

    腾讯混元称 Hy4 preview 在 AI 研究中自行发现推理瓶颈,通过算子融合与通信优化把端到端吞吐提升 31.8%,且在不同上下文长度和并发下保持稳定。该模型此前以 770B 总参数、49B 激活参数、1M 上下文发布,主打生产力与开源前沿,并给出博客、HuggingFace 和 GitHub 入口。

    引用@TencentHunyuan@TencentHunyuan

    🚀 Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog:https://t.co/rbl1IWRk3C HuggingFace:https://t.co/mE9wevH5XR Github:https://t.co/pyl9zckpoL https://t.co/4iW6gSuZKr

    推荐理由:官方给出模型自主定位推理瓶颈并完成优化的具体数字,可供观察自我优化在推理侧的落地方式。

8月31日周一
  1. MiniMax 稀宇科技 · 微信公众号66

    MiniMax 将 H3 Max 768P 与 480P 接入开放平台,支撑实时 AI 直播

    MiniMax 将 H3 Max 768P 与 H3 Max 480P 接入开放平台和 MiniMax Design。H3 Max 生成 5 秒 768p 音视频不到 3 秒,吞吐量约为 MiniMax H3 的 35 倍;fal 工程师和 Pieter Levels 已基于它搭建 Twitch 实时直播与 24 小时 AI 直播网站。

    推荐理由:官方给出 H3 Max 的生成速度、吞吐量对比和接入入口,读者可以判断实时 AI 直播这类场景是否已经跑得通。

8月29日周六
8月27日周四
8月26日周三
  1. @rohanpaul_ai66

    Z.ai 披露此前匿名上线的模型 Ox Alpha 实为 GLM-5.3-Flash,作者转述的报道称该服务由数万个国产加速器支撑,而非 NVIDIA GPU 集群。

    引用@rohanpaul_ai@rohanpaul_ai

    OxAlpha is a new iteration of GLM, from China’s Z .ai And it will change how you run long running agent fast. --- bloomberg .com/news/articles/2026-08-26/china-s-z-ai-made-ox-alpha-stealth-model-that-rivals-deepseek https://t.co/ZOTlnBgOsy

    推荐理由:原文确认 Ox Alpha 即 GLM-5.3-Flash,并给出参数规模、架构改动与基准对比,便于对照其相对 GLM-5.2 的位置。

  2. @AYi_AInotes68

    彭博社报道称,在 OpenRouter 排行榜上登顶的匿名模型 Ox Alpha 由智谱开发,智谱将开源其权重,该模型目前仍免费使用。按帖中说法,它是以推理优先架构设计的编码与智能体模型,原生支持文本、图像和视频输入,社区测试在 10 个高难度真实 Coding 任务中取得 80% 过关率,全量 DeepSWE 为 64.6%。作者还提到智谱此前刚发布开源模型 GLM-5.3。

    推荐理由:彭博社确认匿名模型 Ox Alpha 出自智谱并将在今晚开源权重,读者可了解它的真实来源与开放安排。

  3. Z.ai72

    智谱(Z.ai)发布 GLM-5.3-Flash,称具备有竞争力的价格与原生多模态能力,上下文窗口为 1M token,为 320B-A18B 模型并以 MIT License 开源权重。该模型此前曾以 Ox Alpha 名义预览,完全运行于中国 AI 芯片;现已在官方平台提供权重、API、Coding Plan、ZCode、Chat 和 AutoClaw 入口。

    推荐理由:官方公告同时给出价格定位、开源权重和芯片适配信息,读者可以据此评估它在现有工作流中的替换可能。

  4. @testingcatalog76

    阿里发布 Qwen3.8 Flash,一款 125B 参数的多模态 MoE 模型,原生上下文 262K,可通过 YaRN 扩展至 1M。QwenCloud API 定价为每 1M 输入 tokens 0.16 美元、每 1M 输出 tokens 0.47 美元。该模型基于新架构,是 Qwen4 所用架构的前身,在 DeepSWE 1.1 得 58.7 分、SWE-bench Pro 得 62.5 分。

    引用@Alibaba_Qwen@Alibaba_Qwen

    Model Architecture Four core upgrades for maximum capability, efficiency, capacity, and stability: - Attention: GDN + QSA Hybrid. Gated DeltaNet (GDN) compresses history. Qwen Sparse Attention (QSA) uses a lightweight indexer for micro-block context selection. Lower the cost of attention on long sequences. - Residual: Gated Residual (GR) widens the residual stream to 4 branches with a dynamic read and write gating, strengthening cross-layer information flow and significantly improving training stability. - Embedding: N-gram Embedding uses local context lookups to expand model capacity at minimal compute cost, while keeping the embedding table in host memory with asynchronous prefetching. - Optimization: Muon optimizer. Refines Muon through improved orthogonalization, smarter parameter assignment between Muon and AdamW, and fused-parameter splitting, with scaling laws refitted for the new architecture.

    推荐理由:原文给出上下文长度、API 定价与多项编码基准分数,读者可据此对比同表内 DeepSeek 与 Claude 模型的定位。

  5. 机器之心 · 微信公众号77

    阿里发布 Qwen3.8-Flash,同步开源 Qwen3.8-Flash-Next

    阿里发布 Qwen3.8-Flash,并在 Hugging Face 与 ModelScope 开放同一模型的 Qwen3.8-Flash-Next 权重,主模型 125B 参数、每 token 仅激活 6B,千问 AI 平台定价为每百万 token 输入 1 元、输出 3 元。

    推荐理由:文章拆解了 Qwen3.8-Flash 在注意力、残差与嵌入上的四处架构改动,并把它放进每任务成本的行业对比框架里。

  6. @kimmonismus80

    Qwen3.8-Flash-Next 发布,采用 125B MoE 参数加 51B N-gram embeddings,每 token 仅激活 6B 参数。

    引用@kimmonismus@kimmonismus

    Qwen 3.8 Flash-Next official released: A 6B-active open model just beat Claude Opus 4.6 Max across 8 of 9 comparable benchmarks! Qwen3.8-Flash-Next is a highly sparse MoE: • 125B model parameters • 51B additional n-gram embeddings • Only 6B parameters active per token It scores: • 62.5 SWE-bench Pro • 81.0 SWE-bench Multilingual • 73.9 CoworkBench • 55.7 JobBench • 73.5 Toolathlon • 81.3 IFBench • 91.7 GPQA Diamond • 91.9 LiveCodeBench It also outperforms Qwen3.8-27B and DeepSeek-V4-Flash across most of the table. Super cool release!!

    推荐理由:原文给出四项架构改动与 1/9 训练成本的对比,读者可以了解高稀疏 MoE 如何压低单 token 计算量。

  7. AI前线 · 微信公众号77

    OpenAI 公布自研推理芯片 Jalapeño 实测结果,多项指标超过英伟达 GB300

    OpenAI 公布自研推理芯片 Jalapeño 的实测结果,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,峰值每瓦吞吐量达到对比系统的 1.5 至 1.9 倍,端到端延迟优于对手 1.7 至 3.6 倍。

    推荐理由:OpenAI 公布自研推理芯片的实测对标数据,可看到模型公司自研算力对现有 GPU 与软件生态的实际冲击。

  8. 量子位 · 微信公众号80

    OpenAI 公开自研芯片小辣椒,SemiAnalysis 实测其能效与时延优于 Blackwell

    OpenAI 在 Hot Chips 2026 大会上公开自研推理芯片小辣椒,SemiAnalysis 受邀到其实验室用 InferenceX 实测,结论是这颗第一代芯片在多个开源模型上击败了能测到的英伟达、AMD 和谷歌芯片。

    推荐理由:文章给出 SemiAnalysis 现场实测的能效与时延数据,并交代了单 token 预测等对比口径的限制。

  9. IT Home76

    OpenAI 自研芯片 Jalapeño 性能数据公布,DeepSeek R1 每瓦吞吐量为 GB300 的 1.7 倍

    OpenAI 于 8 月 25 日发布博文展示其自研 AI 推理芯片 Jalapeño,并用 SemiAnalysis 的 InferenceX 基准测试了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款模型。

    推荐理由:官方基准显示 Jalapeño 的推理能效比 GB300 高约 1.5 至 1.7 倍,可据此观察自研 ASIC 对算力成本结构的影响。

8月25日周二
  1. ByteByteGo68

    研究者用同族小模型还原 Anthropic、OpenAI 与 Google 的加密推理块

    2026 年 8 月,MATS Research、ELLIS Institute Tübingen 与 Max Planck Institute for Intelligent Systems 的研究者测试了 Anthropic、OpenAI 和 Google 返回给客户端的加密推理块,发现把块重放进同族更便宜的模型,就能让隐藏推理以明文输出。

    推荐理由:研究揭示加密推理块可被同族小模型复述,公开 agent 日志里的密钥无法靠清洗明文保护。

  2. Hugging Face Blog63

    IBM 发布 Granite 4.2 推理模型家族并详解构建过程

    IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。

    推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。

  3. @kimmonismus71

    OpenAI 称其首款自研推理芯片 Jalapeño 在速度和能效上超过 Nvidia GB200 与 GB300 系统。据 InferenceX 测试,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,该芯片峰值吞吐下每瓦 AI 算力提升 1.5–1.9×,端到端延迟降低 1.7–3.6×,高交互负载性能提升 2.1–4.1×。

    推荐理由:OpenAI 自研推理芯片的对比测试数据与 2026 年底部署计划一并给出,可据此了解其硬件自研路线的进展。

8月22日周六
8月21日周五
  1. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。