xAI 通过 API 开放编码模型 grok-build-0.1 公测
xAI 通过 API 以公测形式开放编码模型 grok-build-0.1,该模型专门针对包括网页开发、调试和 MCP 支持在内的智能体编码任务训练,也是驱动 Grok Build 的同一模型。
推荐理由:模型给出 100+ tokens/秒的服务速度与每百万 token 1 美元输入、2 美元输出的定价,便于评估智能体编码场景的成本与速度取舍。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
当前仅显示精选新闻xAI 通过 API 以公测形式开放编码模型 grok-build-0.1,该模型专门针对包括网页开发、调试和 MCP 支持在内的智能体编码任务训练,也是驱动 Grok Build 的同一模型。
推荐理由:模型给出 100+ tokens/秒的服务速度与每百万 token 1 美元输入、2 美元输出的定价,便于评估智能体编码场景的成本与速度取舍。
xAI 发布 AI 助手 Grok,其底层是自研前沿 LLM Grok-1,Grok 通过 𝕏 平台具备对世界的实时知识。Grok-1 在 HumanEval 上取得 63.2%、MMLU 73%、GSM8k 62.9%、MATH 23.9%,xAI 称其在该算力级别中超过 ChatGPT-3.5 和 Inflection-1,仅落后于训练数据和算力大得多的 GPT-4。
推荐理由:原文给出 Grok-1 在 HumanEval、MMLU 等基准上的分数与同算力级别的横向对比,可据此判断其能力定位。
xAI 发布 Grok 4.6,在 Grok 4.5 基础上强化长时间运行的智能体以及更复杂的交互与视觉任务,官方称其在多项智能体编码和知识工作基准上达到前沿水平。
推荐理由:官方列出 Grok 4.6 在多项智能体编码与知识工作基准上的对比数据,可据此判断其在长任务上的位置。
xAI 发布 Grok-2 与 Grok-2 mini 的早期预览版,称它们在聊天、编码和推理上较 Grok-1.5 有显著提升。早期版本以 sus-column-r 名义在 LMSYS 榜单测试,xAI 称其整体 Elo 超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。
推荐理由:原文给出 Grok-2 与 Grok-2 mini 的完整基准表和竞技场排名,可与 Claude、GPT-4o 等模型直接对照。
xAI 发布 Grok-1.5 模型,具备长上下文理解与高级推理能力,将在未来几天面向早期测试者和 𝕏 平台现有 Grok 用户开放。Grok-1.5 在 MATH 得 50.6%、GSM8K 得 90%、HumanEval 得 74.1%,相比 Grok-1 的 23.9%、62.9% 和 63.2% 均有提升。
推荐理由:原文给出 Grok-1.5 的数学、编码基准成绩与 128K 上下文窗口,读者可据此对比同期模型的推理能力。
Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 总参数中仅激活 39B,并以 Apache 2.0 许可开放。
推荐理由:原文给出与主流开源模型在多语言、数学和编码基准上的对比,可用于评估同等推理预算下的性能取舍。
Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。
推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。
Mistral AI 发布 Mistral Large 2,具备 128k 上下文窗口和 1230 亿参数,针对长上下文应用设计,可在单节点上实现大吞吐推理。官方称其预训练版本在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 处于同一水平。
推荐理由:原文给出 128k 上下文、123B 参数与单节点部署的设定,读者可据此判断这一代模型在性能与成本之间的取舍。
Mistral AI 发布新一代旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,具备 32K token 上下文窗口与原生函数调用能力。
推荐理由:官方给出与 GPT-4 的基准位次和 Azure 上线渠道,读者可据此了解这款欧洲旗舰模型的定位。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的 7B 指令代码模型,权重已在 HuggingFace 开放,采用 Apache 2.0 许可。
推荐理由:Mamba 架构带来线性时间推理与长序列建模,官方还测试了 256k token 的上下文检索,为代码助手的本地部署提供 Transformer 之外的选择。
Mistral AI 发布首个代码模型 Codestral,这是一个 22B 开放权重模型,支持 80 多种编程语言、32k 上下文窗口,并通过 fill-in-the-middle 机制补全代码、编写测试。
推荐理由:22B 开放权重代码模型给出 32k 上下文与多语言基准对照,可据此判断自部署代码补全的取舍。
Claude Code 的自动模式现已改为默认设置,由分类器评估每个待执行动作并拦截可能有害的命令,取代逐条人工批准权限提示。Anthropic 称内部评估中分类器发现的危险操作多于开发者手动点击批准时,且在第三方红队测试下表现稳定;由于会话打断更少,Claude 在两次中断之间的连续工作时间是此前默认设置的 9 倍。
推荐理由:官方给出自动模式在 Nuro、Gusto、Garner Health 生产环境的落地细节,可了解分类器在速度与安全之间的取舍。
Together AI 在 DeepSWE 全部 113 个任务、共 904 次 rollout 上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:基于 904 次 rollout 的实测数据,给出两模型成本差距、各自强项和级联路由方案,可迁移到模型选型决策。
Anthropic 发布 Claude Sonnet 5,称其为最具智能体能力的 Sonnet 模型,即日起成为 Free 和 Pro 套餐默认模型,Max、Team、Enterprise 用户也可使用,定价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Anthropic 官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比数据,读者可据此判断同级模型的智能体能力与成本差距。
Anthropic 发布 Claude Opus 5,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到领先水平,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 25 美元。
推荐理由:官方给出 Opus 5 在编码与知识工作基准上的位置和定价,可对照前代 Opus 4.8 判断性能与成本的取舍。
Cursor 公开其自研多智能体 harness 研究,该系统以数千个 agent 连续运行一周,为研究项目(一个 Web 浏览器)完成绝大多数代码提交,一周内共 1000 万次工具调用,峰值吞吐约每小时 1000 次 commit。
推荐理由:原文披露了多智能体 harness 的角色分工与吞吐权衡,可作长时运行编码系统的设计参考。
初创科技公司 CEO Lech Mazur 借助 GPT-5.6 Pro 完成森多夫猜想的证明,论文配有约 9 万行 Lean 4 形式化代码。陶哲轩用数天时间在大量 AI 辅助下消化、简化并重新形式化该证明,Lean 代码缩减到约 1.5 万行,并发现整理后的论证实际上证明了更强的 Phelps-Rodriguez 猜想,该猜想已于 1972 年提出。
推荐理由:一篇非职业数学家借助 AI 完成的证明经陶哲轩简化后得出更强结果,可看到 AI 参与数学研究的具体分工。
SpaceX 于 8 月 14 日完成对 Cursor 母公司 Anysphere 的收购,交易金额 600 亿美元,Cursor 股东最终获得的是 SpaceX 股票。
推荐理由:从4月算力协议到600亿美元收购,呈现AI应用公司被上游模型公司挤压后向上游靠拢的行业变化。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
Cursor is now part of @SpaceX. Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more. SpaceX has built some of the most inspiring and impressive technology in the world, and we’re grateful for the opportunity to become part of such a special company. Onwards.
推荐理由:作者以 Cursor CEO 身份确认收购交割完成,读者可据此了解 Cursor 后续将与 SpaceXAI 团队共同参与 Grok 相关产品工作。