

推荐理由:原文对比了简单智能体循环与完整系统的表现,可用于判断复杂架构在什么问题上才真正必要。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
当前仅显示精选新闻

推荐理由:原文对比了简单智能体循环与完整系统的表现,可用于判断复杂架构在什么问题上才真正必要。
NVIDIA 发布 Nemotron-Labs Diffusion 系列扩散语言模型,包含 3B、8B、14B 文本模型和 8B 视觉语言模型,均提供基础版与指令微调版。
推荐理由:原文给出该系列的多规模配置与三种推理模式的实测对比数据,读者可据此判断扩散语言模型在延迟敏感场景中的可行性。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型(modified MIT 许可),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,自托管最少只需四块 GPU,API 定价每百万输入 token $1.5、输出 token $7.5。
推荐理由:官方同步发布模型与云端异步智能体,给出基准分数、定价和开源权重,可对照评估其编码与长程任务能力。
OpenAI 称其内部推理模型自主推翻了数学家 Paul Erdős 在 1946 年提出的平面单位距离问题猜想,找到了比正方形网格更优的新点构型,性能提升为固定多项式因子。
Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video
推荐理由:OpenAI 称推理模型自主推翻 Erdős 猜想,作者补充了选题由 OpenAI 决定这一前提,便于读者评估结论边界。
推荐理由:材料点出 AI 解题的思维链长达125页且多在构造反例,并附上数学家 Gowers 的审稿评价,可看到 AI 参与数学研究的实际形态。
Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video
推荐理由:原文呈现 AI 自主解决数学开放问题的过程,读者可了解它如何把冷门数论工具带入几何难题。
Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video
推荐理由:OpenAI 称其内部通用模型推翻平面单位距离问题近 80 年的网格假设,读者可据此判断 AI 自主做数学研究的进度。
推荐理由:OpenAI 说明该证明出自通用推理模型而非专为数学问题打造的系统,读者可据此了解结果在数学与 AI 交叉领域的意义。
OpenAI 称其一个模型解决了有 80 年历史的单位距离问题,推翻了离散几何领域的一项核心猜想。OpenAI 把这一结果称为 AI 驱动数学研究的里程碑。
推荐理由:OpenAI 称其模型解决了 80 年历史的单位距离问题,读者可据此了解 AI 参与数学发现的进展。
Google 发布 Gemini 3.5 模型家族,称其结合前沿智能与行动能力。官方表示该系列为不只推理、还能执行的智能体模型设定新标准。推文附有一段视频。
推荐理由:官方给出 Gemini 3.5 的定位与智能体能力方向,读者可据此了解新一代模型家族的侧重点。
We released experimental MTP Qwen3.6 Unsloth GGUFs! Qwen3.6 27B MTP now runs at 140 tokens/s. Qwen3.6 35B-A3B MTP gets 220 tokens/s generation on a single GPU. Qwen3.6 27B and 35B-A3B have >1.4x speed-up over the original GGUFs without any change in accuracy. Guide + GGUFs + Benchmarks: unsloth.ai/docs/models/qwen3… In terms of average speedup, we see a 1.4x for dense models at draft tokens = 2 and for the MoE around 1.15 to 1.2x. We do not recommend more than 2 draft tokens because the acceptance rate drops precipitously from 83% to 50% with 4 draft tokens, and the forward passes for MTP become less beneficial. Use `--spec-type mtp --spec-draft-n-max 2` Thanks to Aman for github.com/ggml-org/llama.cp…!
推荐理由:原文给出单 GPU 实测速度、加速比与 draft tokens 甜点,可据此判断本地 30B 级模型的部署空间。
Thinking Machines Lab 发布交互模型研究预览,模型原生处理音频、视频和文本的实时交互,而非依赖外部 harness。TML-Interaction-Small 为 276B 参数 MoE(12B 激活),采用 200ms 微轮次多流设计和无编码器早期融合,并配合异步后台模型处理深度推理。
推荐理由:原文给出交互模型的技术路线、架构细节和基准对比,读者可据此评估原生交互与外挂式实时方案的能力差距。
SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。
推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。
深度求索上线并开源全新系列模型 DeepSeek-V4 预览版,按大小分为 V4-Pro 与 V4-Flash 两个版本,1M(一百万)上下文成为其所有官方服务标配。
推荐理由:DeepSeek-V4 预览版把 1M 上下文设为官方服务标配,并同步开源 Pro 与 Flash 两个版本。
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
Mistral 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态与 Devstral 的智能体编码能力统一到单一开源模型,采用 Apache 2.0 许可证。
推荐理由:官方公布了架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的效率对比,可据此评估其开源部署价值。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。
推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。
推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。