跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

当前仅显示精选新闻
456条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 201–220 条 · 共 456 条
8月17日周一
  1. xAI News66

    xAI 通过 API 开放编码模型 grok-build-0.1 公测

    xAI 通过 API 以公测形式开放编码模型 grok-build-0.1,该模型专门针对包括网页开发、调试和 MCP 支持在内的智能体编码任务训练,也是驱动 Grok Build 的同一模型。

    推荐理由:模型给出 100+ tokens/秒的服务速度与每百万 token 1 美元输入、2 美元输出的定价,便于评估智能体编码场景的成本与速度取舍。

  2. xAI News62

    xAI 发布 Grok 及底层模型 Grok-1

    xAI 发布 AI 助手 Grok,其底层是自研前沿 LLM Grok-1,Grok 通过 𝕏 平台具备对世界的实时知识。Grok-1 在 HumanEval 上取得 63.2%、MMLU 73%、GSM8k 62.9%、MATH 23.9%,xAI 称其在该算力级别中超过 ChatGPT-3.5 和 Inflection-1,仅落后于训练数据和算力大得多的 GPT-4。

    推荐理由:原文给出 Grok-1 在 HumanEval、MMLU 等基准上的分数与同算力级别的横向对比,可据此判断其能力定位。

  3. xAI News74

    xAI 发布 Grok-2 与 Grok-2 mini 测试版

    xAI 发布 Grok-2 与 Grok-2 mini 的早期预览版,称它们在聊天、编码和推理上较 Grok-1.5 有显著提升。早期版本以 sus-column-r 名义在 LMSYS 榜单测试,xAI 称其整体 Elo 超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。

    推荐理由:原文给出 Grok-2 与 Grok-2 mini 的完整基准表和竞技场排名,可与 Claude、GPT-4o 等模型直接对照。

  4. xAI News70

    xAI 发布 Grok-1.5,上下文窗口扩至 128K tokens

    xAI 发布 Grok-1.5 模型,具备长上下文理解与高级推理能力,将在未来几天面向早期测试者和 𝕏 平台现有 Grok 用户开放。Grok-1.5 在 MATH 得 50.6%、GSM8K 得 90%、HumanEval 得 74.1%,相比 Grok-1 的 23.9%、62.9% 和 63.2% 均有提升。

    推荐理由:原文给出 Grok-1.5 的数学、编码基准成绩与 128K 上下文窗口,读者可据此对比同期模型的推理能力。

  5. Mistral AI67

    Mistral 发布 Mistral Small v24.09,并推出免费层与全线降价

    Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。

    推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。

  6. Mistral AI68

    Mistral AI 发布 Mistral Large 2,128k 上下文与 123B 参数

    Mistral AI 发布 Mistral Large 2,具备 128k 上下文窗口和 1230 亿参数,针对长上下文应用设计,可在单节点上实现大吞吐推理。官方称其预训练版本在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 处于同一水平。

    推荐理由:原文给出 128k 上下文、123B 参数与单节点部署的设定,读者可据此判断这一代模型在性能与成本之间的取舍。

  7. Claude Blog65

    Claude Code 自动模式成为默认设置,Anthropic 公布生产环境实践

    Claude Code 的自动模式现已改为默认设置,由分类器评估每个待执行动作并拦截可能有害的命令,取代逐条人工批准权限提示。Anthropic 称内部评估中分类器发现的危险操作多于开发者手动点击批准时,且在第三方红队测试下表现稳定;由于会话打断更少,Claude 在两次中断之间的连续工作时间是此前默认设置的 9 倍。

    推荐理由:官方给出自动模式在 Nuro、Gusto、Garner Health 生产环境的落地细节,可了解分类器在速度与安全之间的取舍。

8月16日周日
  1. Anthropic Newsroom85

    Anthropic 发布 Claude Sonnet 5,智能体性能接近 Opus 4.8

    Anthropic 发布 Claude Sonnet 5,称其为最具智能体能力的 Sonnet 模型,即日起成为 Free 和 Pro 套餐默认模型,Max、Team、Enterprise 用户也可使用,定价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Anthropic 官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比数据,读者可据此判断同级模型的智能体能力与成本差距。

  2. Anthropic Newsroom86

    Anthropic 发布 Claude Opus 5,编码与知识工作基准领先且定价与 Opus 4.8 持平

    Anthropic 发布 Claude Opus 5,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到领先水平,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 25 美元。

    推荐理由:官方给出 Opus 5 在编码与知识工作基准上的位置和定价,可对照前代 Opus 4.8 判断性能与成本的取舍。

  3. Cursor Blog70

    Cursor 公开多智能体编码研究,数千 agent 一周完成浏览器项目多数提交

    Cursor 公开其自研多智能体 harness 研究,该系统以数千个 agent 连续运行一周,为研究项目(一个 Web 浏览器)完成绝大多数代码提交,一周内共 1000 万次工具调用,峰值吞吐约每小时 1000 次 commit。

    推荐理由:原文披露了多智能体 harness 的角色分工与吞吐权衡,可作长时运行编码系统的设计参考。

  4. 机器之心 · 微信公众号76

    AI 辅助证明 70 年森多夫猜想,陶哲轩简化后得出更强结果

    初创科技公司 CEO Lech Mazur 借助 GPT-5.6 Pro 完成森多夫猜想的证明,论文配有约 9 万行 Lean 4 形式化代码。陶哲轩用数天时间在大量 AI 辅助下消化、简化并重新形式化该证明,Lean 代码缩减到约 1.5 万行,并发现整理后的论证实际上证明了更强的 Phelps-Rodriguez 猜想,该猜想已于 1972 年提出。

    推荐理由:一篇非职业数学家借助 AI 完成的证明经陶哲轩简化后得出更强结果,可看到 AI 参与数学研究的具体分工。

8月15日周六
  1. Nathan Lambert: Interconnects71

    Nathan Lambert 解析 GLM-5.3 为何能紧跟前沿

    Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。

    推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。

8月14日周五
  1. Michael Truell85

    Cursor CEO Michael Truell 宣布对 SpaceX 的收购已正式交割完成,Cursor 成为 SpaceX 一部分。Cursor 团队将加入 SpaceXAI 团队,参与改进 Grok Build、Grok Bot、Grok API 和 Cursor 等产品。

    引用Cursor@cursor_ai

    Cursor is now part of @SpaceX. Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more. SpaceX has built some of the most inspiring and impressive technology in the world, and we’re grateful for the opportunity to become part of such a special company. Onwards.

    推荐理由:作者以 Cursor CEO 身份确认收购交割完成,读者可据此了解 Cursor 后续将与 SpaceXAI 团队共同参与 Grok 相关产品工作。