Mistral AI 发布首个推理模型 Magistral,分 Small 开源与 Medium 企业双版本
Mistral AI 发布首个推理模型 Magistral,含 24B 参数开源版 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:官方给出两个版本的基准分数、开源许可和语言能力细节,读者可据此评估它在推理模型中的定位。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
Mistral AI 发布首个推理模型 Magistral,含 24B 参数开源版 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:官方给出两个版本的基准分数、开源许可和语言能力细节,读者可据此评估它在推理模型中的定位。
DeepSeek 官方宣布 deepseek-reasoner 模型升级为 DeepSeek-R1-0528,推理能力增强,AIME 2025 Pass@1 从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0,Aider 从 57.0 升至 71.6。
推荐理由:官方更新日志列出各基准的具体分数变化,读者可以直接对比新旧 R1 在推理和幻觉上的差异。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V3-0324。基准测试提升明显,MMLU-Pro 75.9 → 81.2,GPQA 59.1 → 68.4,AIME 39.6 → 59.4,LiveCodeBench 39.2 → 49.2。
推荐理由:原文给出各基准测试的具体提升数字和功能变化,读者可据此评估升级对现有应用的影响。
DeepSeek 在 API 中上线 deepseek-reasoner,即新模型 DeepSeek-R1,通过指定 model=deepseek-reasoner 调用。详细更新见 DeepSeek-R1 正式发布说明,调用指南见推理模型文档。
推荐理由:原文说明 deepseek-reasoner 即 DeepSeek-R1,给出了调用方式,方便开发者在 API 中直接使用新推理模型。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。
DeepSeek 将 DeepSeek V2 Chat 与 DeepSeek Coder V2 合并升级为 DeepSeek V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问新模型。
推荐理由:原文来自官方更新日志,给出了合并后的模型名称、API 兼容方式和多项评测分数变化,便于读者对照评估升级效果。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升。
推荐理由:官方给出代码、数学、推理和对战胜率的前后对比数据,读者可以据此评估这次升级的实际幅度。