DeepSeek-V3.1 发布,deepseek-chat 与 deepseek-reasoner 均升级至该模型
DeepSeek 宣布 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.1,分别对应其非思考模式与思考模式。
推荐理由:官方说明了两个 API 端点对应的模式切换,并给出 SWE-bench 等三项基准分数,读者可据此评估升级影响。
DeepSeek 宣布 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.1,分别对应其非思考模式与思考模式。
推荐理由:官方说明了两个 API 端点对应的模式切换,并给出 SWE-bench 等三项基准分数,读者可据此评估升级影响。
Microsoft AI 发布 MAI-DxO 诊断编排器与 SD Bench 基准,将 304 个 NEJM 病例转化为逐步诊断挑战,MAI-DxO 正确诊断最高达 85%,是同一组有经验医生的四倍以上,且以更低检查成本得出正确诊断。
推荐理由:原文同时给出诊断准确率、成本对比和研究局限,并说明 SD Bench 尚未公开,读者可据此理解结果边界。
Mistral AI 发布首个推理模型 Magistral,含 24B 参数开源版 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:官方给出两个版本的基准分数、开源许可和语言能力细节,读者可据此评估它在推理模型中的定位。
DeepSeek 官方宣布 deepseek-reasoner 模型升级为 DeepSeek-R1-0528,推理能力增强,AIME 2025 Pass@1 从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0,Aider 从 57.0 升至 71.6。
推荐理由:官方更新日志列出各基准的具体分数变化,读者可以直接对比新旧 R1 在推理和幻觉上的差异。
Mistral AI 发布教程,介绍用 LLM As A Judge 评估 RAG 系统的方法。文章讲解 TruLens 提出的 RAG Triad 框架,从上下文相关性。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V3-0324。基准测试提升明显,MMLU-Pro 75.9 → 81.2,GPQA 59.1 → 68.4,AIME 39.6 → 59.4,LiveCodeBench 39.2 → 49.2。
推荐理由:原文给出各基准测试的具体提升数字和功能变化,读者可据此评估升级对现有应用的影响。
DeepSeek 在 API 中上线 deepseek-reasoner,即新模型 DeepSeek-R1,通过指定 model=deepseek-reasoner 调用。详细更新见 DeepSeek-R1 正式发布说明,调用指南见推理模型文档。
推荐理由:原文说明 deepseek-reasoner 即 DeepSeek-R1,给出了调用方式,方便开发者在 API 中直接使用新推理模型。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench(08.01-12.01)准确率从 29.2% 提升至 34.38%。中文写作与推理能力在内部测试集中也有提升,同时优化了文件上传和网页总结功能的用户体验。
DeepSeek 将 DeepSeek V2 Chat 与 DeepSeek Coder V2 合并升级为 DeepSeek V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问新模型。
推荐理由:原文来自官方更新日志,给出了合并后的模型名称、API 兼容方式和多项评测分数变化,便于读者对照评估升级效果。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升。
推荐理由:官方给出代码、数学、推理和对战胜率的前后对比数据,读者可以据此评估这次升级的实际幅度。