deepseek-chat 升级为 DeepSeek-V3-0324,多项基准测试显著提升
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V3-0324。基准测试提升明显,MMLU-Pro 75.9 → 81.2,GPQA 59.1 → 68.4,AIME 39.6 → 59.4,LiveCodeBench 39.2 → 49.2。
推荐理由:原文给出各基准测试的具体提升数字和功能变化,读者可据此评估升级对现有应用的影响。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V3-0324。基准测试提升明显,MMLU-Pro 75.9 → 81.2,GPQA 59.1 → 68.4,AIME 39.6 → 59.4,LiveCodeBench 39.2 → 49.2。
推荐理由:原文给出各基准测试的具体提升数字和功能变化,读者可据此评估升级对现有应用的影响。
Mistral AI 发布 Mistral Small 3.1,相比 Mistral Small 3 提升文本性能,新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,官方称超越 Gemma 3 和 GPT-4o Mini 等同级模型。
推荐理由:官方给出了与 Gemma 3 和 GPT-4o Mini 的对比数据、部署门槛和开放下载渠道,可据此评估端侧与低成本部署选择。
deepseek-chat 模型已升级为 DeepSeek-V3,接口不变,仍可通过指定 model=deepseek-chat 调用。详细更新可参考官方 DeepSeek-V3 正式发布说明。
推荐理由:API 接口保持不变,现有用户可无迁移成本地用上 DeepSeek-V3,原文还指向了详细更新说明。
DeepSeek 将 DeepSeek V2 Chat 与 DeepSeek Coder V2 合并升级为 DeepSeek V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问新模型。
推荐理由:原文来自官方更新日志,给出了合并后的模型名称、API 兼容方式和多项评测分数变化,便于读者对照评估升级效果。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升。
推荐理由:官方给出代码、数学、推理和对战胜率的前后对比数据,读者可以据此评估这次升级的实际幅度。
Suno 发布 v3 模型,称其首个能生成广播级音乐的模型,已在 https://app.suno.ai 向所有用户开放。v3 可在几秒内生成完整两分钟歌曲,改进包括更好的音质、更多风格流派、更少幻觉和更自然的结尾。模型不识别艺术家引用,并采用不可闻水印技术检测 Suno 生成的歌曲,v4 已在开发中。
推荐理由:Suno 官方说明 v3 在音质、风格与提示词遵循上的具体改进,读者可据此对比自己此前的生成体验。