Mistral AI 联合 All Hands AI 发布 Devstral 编码模型
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方发布给出 SWE-Bench Verified 成绩、开源许可和部署门槛,读者可据此判断它在本地或企业编码场景中的位置。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方发布给出 SWE-Bench Verified 成绩、开源许可和部署门槛,读者可据此判断它在本地或企业编码场景中的位置。
Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、成本低约 8 倍和更易部署的新级别模型。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准数字和 $0.4/$2 定价,读者可以据此评估它在企业部署中的性价比。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V3-0324。基准测试提升明显,MMLU-Pro 75.9 → 81.2,GPQA 59.1 → 68.4,AIME 39.6 → 59.4,LiveCodeBench 39.2 → 49.2。
推荐理由:原文给出各基准测试的具体提升数字和功能变化,读者可据此评估升级对现有应用的影响。
DeepSeek 将 DeepSeek V2 Chat 与 DeepSeek Coder V2 合并升级为 DeepSeek V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问新模型。
推荐理由:原文来自官方更新日志,给出了合并后的模型名称、API 兼容方式和多项评测分数变化,便于读者对照评估升级效果。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升。
推荐理由:官方给出代码、数学、推理和对战胜率的前后对比数据,读者可以据此评估这次升级的实际幅度。