跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

当前仅显示精选新闻
426条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 341–360 条 · 共 426 条
6月1日周一
  1. @kimmonismus74

    MiniMax 发布 M3 开放权重模型,在 SWE-Bench Pro 上得分 59%,略高于 GPT-5.5 的 58.6%,高于 Gemini 3.1 Pro 的 54.2%,编码上仍落后 Opus 4.7。该模型支持 1M token 上下文并原生多模态,在 BrowseComp 上以 83.5% 领先 Opus 4.7,每 token 成本约为 GPT-5.5 的 1/12。权重和完整技术报告预计约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:原文给出了 M3 与 GPT-5.5、Opus 4.7 的基准对比和成本差距,读者可据此判断开放权重模型的能力位次。

  2. @PBDTokenRouter68

    MiniMax M3 现已在 PBD TokenRouter 上线,该开源权重模型同时具备编码与智能体能力。其在 SWE-Bench Pro 取得 59.0%、Terminal Bench 2.1 取得 66.0%、MCP Atlas 取得 74.2%,并借 MiniMax Sparse Attention 支持最高 1M token 上下文,且原生支持多模态。PBD 自 M2.7 起与 MiniMax 团队合作,用户可用同一密钥替换模型 ID 调用。

    推荐理由:原文列出 M3 的三项基准分数与 1M token 上下文,读者可据此比较其与同类开源模型的定位。

  3. @MiniMax_AI66

    MiniMax 发布 M3 模型。官方主推提到视频控制、游戏等场景,以及开源权重、超大上下文和强编码能力。引用评测 @MinLiBuilds 称 M3 有 1M context、原生多模态与 Agentic 三项特性,并用截图在多 agent 工作流下于 2 小时做出可运行的双人对决小游戏。

    引用实践哥MinLi (@MinLiBuilds)@MinLiBuilds

    跟祖传的 20K context 说 bye bye 了。 MiniMax M3 发布了,三个亮点: 1M context、原生多模态、Agentic。 我这次做了一次完整评测,使用CC workflow 、 @ZenMuxAI和MiniMax M3: 给一张截图,做一个“凡人修仙剑阵对决手势游戏”。 要求是:支持双人对决 、使用 workflow 拆解任务、加入石头剪刀布机制。 2 小时后,游戏真的跑起来了。 这一代LLM的版本答案我知道了: 1M 上下文 + 多模态+ agent 模式。 1M context 是推理深度的基础,多 agent 负责拆任务和执行。 Video

    推荐理由:官方给出 M3 的开源权重与大上下文等信息,引用评测展示了多模态加 Agent 工作流的实际产出。

  4. @flowith65

    flowith 宣布现已支持 MiniMax M3,并称其具备 1M 上下文、出色的编码能力和原生多模态。作者表示可以在 flowith 中并排运行并对比不同模型。其引用的 MiniMax 发布信息称,M3 是首个同时结合三项前沿能力的开放权重模型,代码与智能体评测包括 SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0%、MCP Atlas 74.2%,权重与技术报告约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:flowith 上线 MiniMax M3 支持,读者可了解该模型在 1M 上下文与原生多模态上的接入进展。

  5. @MiniMax_AI66

    MiniMax M3 已在 Novita AI 上线,作为 Day-0 API 合作方开放,首周享 50% 折扣。Novita 称 M3 是首个同时具备前沿编码与智能体能力、最高 1M tokens 上下文和原生多模态的开源权重模型,其中上下文由 MiniMax Sparse Attention 实现,基准成绩为 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1、74.2% MCP Atlas。

    引用Novita AI (@novita_labs)@novita_labs

    🚀 We’re launching MiniMax M3 from @MiniMax_AI on Novita AI as a Day-0 API launch partner. The first open-weights model to combine: • Frontier coding and agent capabilities 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 74.2% MCP Atlas • Up to 1M tokens of context Enabled by MiniMax Sparse Attention • Native multimodality from day one Built for both text and visual understanding Excited to make MiniMax M3 available to developers on Day 0. Video

    推荐理由:M3 在 Novita 上线并附上 SWE-Bench Pro 等基准,可据此了解其编码与智能体能力定位。

  6. @MiniMax_AI75

    MiniMax-M3 已在 Venice(@AskVenice)上线,作者称其开放权重,具备前沿编码与智能体能力,支持 1M 上下文和原生多模态,首日即可用并支持匿名访问。引用文案称其为首个兼具前沿编码与智能体性能并原生支持多模态的开放权重模型,面向长周期复杂工作流。

    引用Venice (@AskVenice)@AskVenice

    MiniMax-M3 by @MiniMax_AI is now live on Venice. The first open-weight model to deliver frontier coding and agentic performance with native multimodality. Built for long-horizon, complex workflows. Available anonymously.

    推荐理由:MiniMax-M3 以开放权重同时具备前沿编码与智能体能力,支持 1M 上下文和原生多模态,面向长周期复杂工作流。

  7. @MiniMax_AI71

    MiniMax 发布 M3 模型,并在发布当天同步上线 OpenRouter。该模型具备 1M token 上下文窗口、前沿编码与智能体能力,以及原生多模态,首周提供 50% 折扣。OpenRouter 称其为前沿级开源权重模型,原生多模态覆盖图像与视频。

    引用OpenRouter (@OpenRouter)@OpenRouter

    MiniMax-M3 is live on OpenRouter! A frontier-class open-weight model that combines a 1M-token context window, frontier coding and agentic performance, and native multimodality (image & video) in one model.

    推荐理由:MiniMax-M3 上线 OpenRouter 并给出首周折扣,可了解其 1M 上下文与多模态能力的组合方式。

  8. @ollama67

    MiniMax M3 上线 Ollama Cloud,双方合作下该模型部署在美国并采用零数据保留。用户可通过 Claude Code 与 Codex 调用,命令如 ollama launch claude --model minimax-m3:cloud 和 ollama launch codex --model minimax-m3:cloud。据转发的 MiniMax 介绍,M3 是首个融合三项前沿能力的开放权重模型,MiniMax Sparse Attention 将上下文扩展至 1M,权重与技术报告约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:材料给出 M3 在 Ollama Cloud 的调用命令与零数据保留说明,可据此直接上手编码与智能体任务。

5月30日周六
  1. @berryxia67

    OpenAI 宣布 Codex 的计算机操作(Computer Use)现已支持 Windows,能在 Windows 电脑上执行任务;同时 ChatGPT 手机 App 支持 Windows 版 Codex,用户可远程启动、查看和指挥任务,电脑继续工作。作者认为这是早期体验,但对 Windows 主力用户而言,跨设备智能体落地更近一步。

    引用OpenAI (@OpenAI)@OpenAI

    Windows users, this one’s for you. Computer use now works on Windows, so Codex can take action on your Windows computer. And with Windows support for Codex in the ChatGPT mobile app, you can start, review, and steer tasks on the go while work continues on your Windows machine. An early experience, but we’re working on more ways to keep your work moving, wherever you are. Video

    推荐理由:Codex 的计算机操作登陆 Windows 并可通过 ChatGPT 手机端远程指挥,Windows 主力用户可据此判断跨设备智能体的可用性。

  2. @OpenAI68

    OpenAI 宣布 Codex 的 computer use 功能现已支持 Windows,可以直接在 Windows 电脑上执行操作。同时 ChatGPT 移动端应用加入 Codex 的 Windows 支持,用户可在移动中启动、查看和引导任务,工作继续在 Windows 机器上进行。OpenAI 表示这是早期体验,仍在开发更多让工作持续推进的方式。

    推荐理由:OpenAI 官方给出 Codex 在 Windows 上的操作能力与移动端接续入口,读者可据此判断现有工作流能否迁移。

5月29日周五
  1. @op741865

    Claude Code 发布研究预览版 Dynamic Workflows,由 Claude 现场编写编排脚本,并发启动大量协同 Subagent 处理复杂任务。

    引用ClaudeDevs (@ClaudeDevs)@ClaudeDevs

    New in Claude Code (research preview): dynamic workflows. Claude writes an orchestration script on the fly, then spins up a large fleet of coordinated subagents in parallel to take on your most complex tasks. Use the word "workflow" in a prompt to get started.

    推荐理由:作者补充了官方公告之外的触发方式和 Ultra Code 模式限制,便于判断这一功能如何接入现有流程。

  2. @op741867

    Anthropic 发布 Claude Opus 4.8,在 Opus 4.7 基础上带来更准确的判断、对自身进展更诚实,并能比前代独立工作更长时间,今天即可使用且价格不变。博主 @op7418 认为 Opus 4.8 所有能力相较 4.7 都有提升,其中发现自己问题的能力提升非常多,此前让 4.7 review 自己的代码基本没用。

    引用Claude (@claudeai)@claudeai

    Introducing Claude Opus 4.8: it builds on Opus 4.7 with sharper judgment, more honesty about its own progress, and the ability to work independently for longer than its predecessors. Available today at the same price.

    推荐理由:作者对比 4.7 指出自查能力是这次升级中变化最大的一项,可据此判断新版本在代码审查场景的实际差异。

  3. Claude Code GitHub Releases62

    Claude Code v2.1.154 发布,新增 Opus 4.8 与动态 workflow

    Claude Code 发布 v2.1.154,引入 Opus 4.8 作为默认模型并默认高推理强度,可用 /effort xhigh 处理最难任务。新增动态 workflow,可协调数十到数百个后台 Agent,用 /workflows 查看;Opus 4.8 的 fast mode 降价为标准费率 2 倍换 2.5 倍速度;另有多项修复,包括阻止 rm -rf $HOME、改进数据外泄检测等。

    推荐理由:发布说明列出 Opus 4.8 默认高推理、动态 workflow 编排多 Agent 与 fast mode 降价等变化,读者可据此评估升级对现有工作流的影响。

  4. Sierra Blog68

    Sierra 工程师复盘如何独自用 AI 编码智能体在 4 个月内完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。

    推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。

5月28日周四
  1. Mistral AI71

    Mistral 发布统一智能体 Vibe,Le Chat 升级为 Work 与 Code 双模式

    Mistral 将 Le Chat 升级为统一智能体 Vibe,一个账号覆盖工作与编码场景,已上线 chat.mistral.ai。Work Mode 面向长时多步任务,支持企业知识搜索、数据分析、文档起草、定时任务和可复用技能;Code Mode 提供远程编码会话并推出 VS Code 扩展,CLI 新增技能命令、会话权限控制和 /teleport 迁移。

    推荐理由:原文是 Mistral 官方发布,完整列出 Work 与 Code 两种模式的能力、集成入口和各档定价,读者可据此评估是否替换现有工作流。

  2. Linear Now63

    Linear 发布 Diffs,主打快速代码评审

    Linear 发布代码评审产品 Diffs,面向所有套餐开放,目标是让代码评审在不牺牲严谨性的前提下保持快速。评审在 Linear 内打开并关联对应的 issue 和项目,优先级可见;Guided reviews 把大 diff 按工作的推理顺序拆成章节,先展示核心改动,结构化 diff 高亮会剥离格式改动,让 2000 行的 PR 在一次阅读中变得可读。

    推荐理由:Linear 官方解释了 Diffs 针对的评审痛点与具体设计,读者可以对照自己团队被 agent 大量 PR 拖慢的评审流程判断是否适用。