Mistral 用 AI 智能体将欧洲能源运营商 40,000 行 Fortran 77 迁移到 C++
Mistral 帮助一家欧洲能源运营商将 40 万行油藏模拟器代码库中的 40,000 行 Fortran 77 核心功能迁移到 C++,该代码无测试套件且文档分散。
推荐理由:原文复盘了完整迁移过程和三条可迁移经验,读者可以借鉴其验证优先与结构化工作流的落地方法。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Mistral 帮助一家欧洲能源运营商将 40 万行油藏模拟器代码库中的 40,000 行 Fortran 77 核心功能迁移到 C++,该代码无测试套件且文档分散。
推荐理由:原文复盘了完整迁移过程和三条可迁移经验,读者可以借鉴其验证优先与结构化工作流的落地方法。
GitHub 发布 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级编码质量,所有 GitHub Copilot 计划用户可在 Copilot CLI 通过 /experimental 使用。
推荐理由:原文给出三种执行模式和三项基准的质量与成本数据,读者可以据此评估多模型编排对现有编码工作流的适用性。
GitHub 官方博客发布面向新手的教程,介绍如何在 GitHub Copilot app 中同时运行多个 agent 会话。每个会话可运行在独立的 Git worktree 上互不干扰,各自保留上下文,用户通过 sessions 视图追踪进度,教程以 tailspin-toys 仓库演示了并行添加功能、无障碍审查和运行测试的做法。
推荐理由:官方教程讲清了并行 agent 会话如何借助 Git worktree 隔离运行,读者可以照着示例直接上手尝试。
Hugging Face 发布开源工具 funes,把机器上已有的 Agent 会话记录变成可检索的记忆层,一条 funes add 命令即可接入 Claude Code、Codex、pi 和 Hermes。
推荐理由:原文给出 funes 的本地检索管线、跨机器同步与 token 成本对比数据,读者可以据此判断它能否改善多机多 Agent 的工作流。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。
推荐理由:官方给出具体基准数据和定价,可用于对比 3.7 Flash 判断升级性价比,Cyber 版的开放范围也值得安全团队留意。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型、安全防护级别不同,Fable 5.1 全面开放,Mythos 5.1 限可信访问计划。
推荐理由:原文给出新旧模型基准对比、cache reads 降价幅度和访问政策变化,读者可据此评估升级成本与适用场景。
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时运行的智能体编码、知识工作和研究,并向 Project Glasswing 参与者提供 Claude Mythos 5.1。
推荐理由:官方发布说明列出了定价、上下文窗口和多项 API 变更,方便现有使用方评估迁移和缓存成本影响。
推荐理由:Cursor CEO 一方回应断供传闻,补充了自家流量占比等一手信息,可帮读者了解双方目前的态度。
推荐理由:官方宣布权重开放并给出下载与博客入口,读者可以据此评估 GLM-5.3 在智能体编码场景的可用性。
Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。
推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。
Linear 完成 9900 万美元回购,估值 25 亿美元,是去年 12.5 亿美元的两倍,Accel、01A、Salesforce Ventures 和 S32 参与其中;公司现金流为正,账上现金超过历史融资总额。
推荐理由:官方披露 2.5B 估值回购与 100M ARR 等关键数据,读者可借此了解 Linear 的经营现状与智能体业务进展。
推荐理由:原文交代了 GLM-5.3 的能力侧重、基准分数和开放节奏,读者可以据此判断其在开源与闭源模型中的位置。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
Cursor is now part of @SpaceX. Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more. SpaceX has built some of the most inspiring and impressive technology in the world, and we’re grateful for the opportunity to become part of such a special company. Onwards.
推荐理由:作者以 Cursor CEO 身份确认收购交割完成,读者可据此了解 Cursor 后续将与 SpaceXAI 团队共同参与 Grok 相关产品工作。
Cursor 宣布正式被 SpaceX 收购,始于 4 月的收购流程完成。Cursor 将使用 SpaceX 的 GPU 集群获得算力,以更低成本向客户提供能力更强的模型;其提到周三发布的 Grok 4.6 初步展示了双方合作的成果,Cursor 仍将继续帮助用户减少编写代码的时间。
推荐理由:收购方官方宣布交易完成,并说明算力与模型成本的联动,读者可了解 Cursor 后续产品方向。
推荐理由:原文给出 Gemini 3.7 Flash 的降价幅度和三项能力改进方向,并列出可用渠道,读者可快速了解这版更新。
Google DeepMind 发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准数字与限时定价,开发者可据此评估是否把编码和 Agent 工作流迁移到新模型。
Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。
推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 上线,模型名 deepseek-v4-pro,API 调用方式不变。官方称 Agent 能力大幅提升,生产环境性能表现提升尤为显著,并公布 HLE (wo / w tools) 42.7/60.0、Terminal Bench 2.1 87.9、NL2Repo 61.5 等基准成绩。
推荐理由:官方公告列出了正式版在多项 Agent 与编码基准上的分数、Responses API 支持和峰谷定价细节,方便用户评估迁移与调用时机。
Cursor 与 SpaceXAI 发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、复杂交互和视觉工作。
推荐理由:官方发布说明了训练方法与多项智能体编程基准成绩,读者可据此对比 Grok 4.5 与 GPT-5.6 Sol 的表现。