Cursor 公开多智能体编码研究,数千 agent 一周完成浏览器项目多数提交
Cursor 公开其自研多智能体 harness 研究,该系统以数千个 agent 连续运行一周,为研究项目(一个 Web 浏览器)完成绝大多数代码提交,一周内共 1000 万次工具调用,峰值吞吐约每小时 1000 次 commit。
推荐理由:原文披露了多智能体 harness 的角色分工与吞吐权衡,可作长时运行编码系统的设计参考。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
当前仅显示精选新闻Cursor 公开其自研多智能体 harness 研究,该系统以数千个 agent 连续运行一周,为研究项目(一个 Web 浏览器)完成绝大多数代码提交,一周内共 1000 万次工具调用,峰值吞吐约每小时 1000 次 commit。
推荐理由:原文披露了多智能体 harness 的角色分工与吞吐权衡,可作长时运行编码系统的设计参考。
inclusionAI 发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,在关键基准上追平或超过上一代 1T 级旗舰 Ring-2.6-1T。
推荐理由:模型卡给出混合线性注意力架构与多精度量化对比,读者可据此评估长上下文智能体任务的部署成本。
SpaceX 于 8 月 14 日完成对 Cursor 母公司 Anysphere 的收购,交易金额 600 亿美元,Cursor 股东最终获得的是 SpaceX 股票。
推荐理由:从4月算力协议到600亿美元收购,呈现AI应用公司被上游模型公司挤压后向上游靠拢的行业变化。
机器之心解读了 DeepSeek Harness 背后的八十页论文《A Programming Paradigm for Spatiotemporal Composability》。
推荐理由:文章把八十页论文里的效应与余效应机制讲成运行时插件的卸载设计,便于理解自修改智能体如何干净回收组件。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
北京协和医院神经外科博士后金山木使用 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时的自主运行中证明了自 2004 年以来悬置 22 年的 Crouzeix 猜想。
推荐理由:原文给出自主证明的运行方式、提示词策略与开源材料,读者可了解智能体独立完成数学证明的一条路径。
Cursor is now part of @SpaceX. Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more. SpaceX has built some of the most inspiring and impressive technology in the world, and we’re grateful for the opportunity to become part of such a special company. Onwards.
推荐理由:作者以 Cursor CEO 身份确认收购交割完成,读者可据此了解 Cursor 后续将与 SpaceXAI 团队共同参与 Grok 相关产品工作。
SpaceX 于当地时间 8 月 14 日正式完成对 AI 编程初创公司 Cursor 的 600 亿美元收购,此前两个月双方已宣布达成收购协议。Cursor 通过博客表示,收购后可动用全球规模最大的 GPU 集群,用充足算力开发能力更强、运行成本更低的模型。双方在交易完成前已于 7 月推出首个联合模型 Grok 4.5,主要用于编程、金融和法律任务,两家公司称其使用成本低于其他竞争模型。
推荐理由:这笔 600 亿美元交易连同使用大规模 GPU 集群的承诺,呈现了 AI 编程赛道当前的资本与算力竞争体量。
a16z 发文分析 Cursor 被 SpaceX 以 600 亿美元全股票收购一事,称这是迄今最大的风投支持创业公司收购案。
推荐理由:a16z 以 Cursor 被 SpaceX 收购为线索,复盘其两次自我重塑,并给出迭代速度决定胜负的行业判断。
Cursor 正式被 SpaceX 收购,始于 4 月的收购流程至此完成。收购后 Cursor 将可使用全球最大的 GPU 集群,获得构建更强大且运行成本更低的模型所需的算力,从而以更低成本为客户提供能力更强的模型。文中称周三发布的 Grok 4.6 初步展示了双方如今能够共同打造的成果。
推荐理由:收购完成后 Cursor 将接入 SpaceX 的 GPU 集群,原文给出了对模型成本与能力的具体预期。
DeepSeek 于 8 月 13 日发布首个 Harness 版本 DSH,以 MIT 协议在 GitHub 开源,核心口号是一切皆插件。
推荐理由:文章把 DSH 的插件化架构放进 Harness 范式尚未收敛的背景里,解释其开源策略为何是保留选择权而非交付成品。
DeepSeek 于 8 月 13 日发布首个 Harness 版本 DSH,以 MIT 协议开源在 GitHub 上,仓库版本号仍停留在 0.1.0-rc,官方称其为开发者预览版且未来会出现破坏兼容性的变更。
推荐理由:从插件化架构与开源生态两个角度拆解 DSH,帮助读者理解 DeepSeek 把 Harness 探索交给社区的思路。
智谱正式发布 GLM-5.3,基座模型与 GLM-5.2 相同,全部提升来自后训练 Scaling,官方称其为编程能力最强的开源模型,内部自建体感评测较 GLM-5.2 提升 50%。
推荐理由:GLM-5.3 在基座不变的前提下靠后训练 Scaling 推高编程与智能体基准,权重将在两周后开放。
DeepSeek 在 8 月 13 日晚发布 DeepSeek Harness v0.1 开发者预览版,采用 MIT 协议开源,用 npx @deepseek-ai/dsh web 即可在本地浏览器启动。
推荐理由:文章以一夜实测加插件生态盘点,对比 Claude Code 的封闭外壳路线,呈现 harness 被开源后的竞争变化。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告。Hub 公开模型仓库从 243 万增至 296 万,数据集突破 100 万;中国实验室在几乎所有月份的最大开源模型参数都超过美国实验室,754B 至 2.78 万亿参数,而 Qwen 衍生模型达 151,448 个,成为社区主要基座。
推荐理由:Hugging Face 官方半年报用 Hub 数据拆解开源模型格局,涵盖中美发布规模、下载与关注背离、Qwen 生态地位和 Agent 流量。
Google DeepMind 发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准数字与限时定价,开发者可据此评估是否把编码和 Agent 工作流迁移到新模型。
DeepSeek Harness 正式发布并开源,作者内测半个月后把自己的 Vibe Coding 项目从 Codex 迁移到 DSH。DSH 采用一切皆插件的 Cordis 架构,内置 100 多个插件,提供标准、PTC、极简、创造四类 Agent 预设,并有可直接查看原始事件的轨迹回放视图。
推荐理由:作者用半个月内测体验对比 Codex,呈现 DSH 的插件化架构与轨迹回放等设计,便于判断它与现有编码 Agent 的差异。
DeepSeek 释出自家 Coding Agent 产品 DeepSeek Harness,以「一切皆插件」为内核原则,当前为 developer preview 版本 0.1.0-rc.5、MIT 许可。
推荐理由:文章拆解了 DeepSeek Harness 的 Cordis 插件内核与四种运行模式,便于对照 Claude Code、Codex 理解其设计取舍。
DeepSeek Harness 已发布,底层框架 Cordis 只管插件加载和依赖,模型、工具、策略、存储、上下文、UI 都以插件形态存在,以 MIT 协议开源并已获 10K+ star。
推荐理由:原文列出 Harness 的插件化架构与 PTC 工具调用模式,可据此判断它对 Agent 工作流的影响。
DeepSeek 发布 DeepSeek Harness v0.1 开发者预览,面向全球构建 agent harness 的开发者开放,代码库以 MIT 许可证开源。
推荐理由:官方开放了开发者预览并说明一切皆插件的架构设计,开发者可以据此评估是否用它搭建智能体。