跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 661–680 条 · 共 812 条
6月1日周一
  1. @MiniMax_AI76

    MiniMax 宣布 M3 在 OrcaRouter 首日上线,首周使用可享 50% 折扣。引用信息显示,M3 支持最高 1M token 上下文(最低保证 512K),具备新一代稀疏注意力、更快推理和更强的智能体工作流,并称其为最受期待的开源模型发布之一。

    引用OrcaRouter 🐳 (@OrcaRouter)@OrcaRouter

    🚀 @MiniMax_AI M3 is now available on OrcaRouter. One of the most anticipated open model releases, bringing next-gen sparse attention, ultra-long context handling (up to 1M tokens of context with a guaranteed minimum of 512K), faster inference, and stronger agentic workflows. Try it out here: orcarouter.ai/models/minimax…

    推荐理由:MiniMax M3 首日上线 OrcaRouter,读者可据此了解其长上下文与智能体工作流的能力定位。

  2. @op741870

    MiniMax 发布大版本模型升级 MiniMax M3,标配 1M 超长上下文,采用新的 MSA(MoE with Segment-wise Attention)稀疏注意力架构,并从训练起融合文本、图片、视频和桌面操作的原生多模态能力。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:MiniMax M3 标配 1M 上下文并采用新的稀疏注意力架构,读者可据此了解长上下文模型的算力成本变化。

  3. @MiniMax_AI75

    MiniMax-M3 已在 Venice(@AskVenice)上线,作者称其开放权重,具备前沿编码与智能体能力,支持 1M 上下文和原生多模态,首日即可用并支持匿名访问。引用文案称其为首个兼具前沿编码与智能体性能并原生支持多模态的开放权重模型,面向长周期复杂工作流。

    引用Venice (@AskVenice)@AskVenice

    MiniMax-M3 by @MiniMax_AI is now live on Venice. The first open-weight model to deliver frontier coding and agentic performance with native multimodality. Built for long-horizon, complex workflows. Available anonymously.

    推荐理由:MiniMax-M3 以开放权重同时具备前沿编码与智能体能力,支持 1M 上下文和原生多模态,面向长周期复杂工作流。

  4. @MiniMax_AI71

    MiniMax 发布 M3 模型,并在发布当天同步上线 OpenRouter。该模型具备 1M token 上下文窗口、前沿编码与智能体能力,以及原生多模态,首周提供 50% 折扣。OpenRouter 称其为前沿级开源权重模型,原生多模态覆盖图像与视频。

    引用OpenRouter (@OpenRouter)@OpenRouter

    MiniMax-M3 is live on OpenRouter! A frontier-class open-weight model that combines a 1M-token context window, frontier coding and agentic performance, and native multimodality (image & video) in one model.

    推荐理由:MiniMax-M3 上线 OpenRouter 并给出首周折扣,可了解其 1M 上下文与多模态能力的组合方式。

  5. @ollama67

    MiniMax M3 上线 Ollama Cloud,双方合作下该模型部署在美国并采用零数据保留。用户可通过 Claude Code 与 Codex 调用,命令如 ollama launch claude --model minimax-m3:cloud 和 ollama launch codex --model minimax-m3:cloud。据转发的 MiniMax 介绍,M3 是首个融合三项前沿能力的开放权重模型,MiniMax Sparse Attention 将上下文扩展至 1M,权重与技术报告约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:材料给出 M3 在 Ollama Cloud 的调用命令与零数据保留说明,可据此直接上手编码与智能体任务。

  6. @MiniMax_AI66

    MiniMax 发布 MiniMax M3,称其为首个同时结合编码与 Agent、长上下文、原生多模态三项前沿能力的开源权重模型。编码与 Agentic 基准成绩为 SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0%、SWE-fficiency 34.8%、KernelBench Hard 28.8%、MCP Atlas 74.2%;MiniMax Sparse Attention 将上下文扩展至 1M,模型从 Step Zero 起原生多模态。API 已在 platform.minimax.io 上线,同时推出 MiniMax Code,权重与技术报告约 10 天后发布。

    推荐理由:MiniMax M3 放出编码、1M 上下文与多模态的基准成绩,可供开源权重模型选型时对照参考。

  7. MiniMax Blog81

    MiniMax 发布 M3:1M 上下文、原生多模态与前沿编码能力

    MiniMax 发布 M3 模型,采用自研稀疏注意力架构 MSA,支持最高 1M token 上下文,SWE-Bench Pro 得分 59.0%、Terminal-Bench 2.1 得分 66.0%,并原生支持图像与视频输入及桌面操作。

    推荐理由:官方详解了 MSA 架构与 1M 上下文的具体实现,并给出多项基准成绩和真实任务案例,可据此评估其编码与长程智能体能力。

5月30日周六
  1. @berryxia67

    OpenAI 宣布 Codex 的计算机操作(Computer Use)现已支持 Windows,能在 Windows 电脑上执行任务;同时 ChatGPT 手机 App 支持 Windows 版 Codex,用户可远程启动、查看和指挥任务,电脑继续工作。作者认为这是早期体验,但对 Windows 主力用户而言,跨设备智能体落地更近一步。

    引用OpenAI (@OpenAI)@OpenAI

    Windows users, this one’s for you. Computer use now works on Windows, so Codex can take action on your Windows computer. And with Windows support for Codex in the ChatGPT mobile app, you can start, review, and steer tasks on the go while work continues on your Windows machine. An early experience, but we’re working on more ways to keep your work moving, wherever you are. Video

    推荐理由:Codex 的计算机操作登陆 Windows 并可通过 ChatGPT 手机端远程指挥,Windows 主力用户可据此判断跨设备智能体的可用性。

  2. @OpenAI68

    OpenAI 宣布 Codex 的 computer use 功能现已支持 Windows,可以直接在 Windows 电脑上执行操作。同时 ChatGPT 移动端应用加入 Codex 的 Windows 支持,用户可在移动中启动、查看和引导任务,工作继续在 Windows 机器上进行。OpenAI 表示这是早期体验,仍在开发更多让工作持续推进的方式。

    推荐理由:OpenAI 官方给出 Codex 在 Windows 上的操作能力与移动端接续入口,读者可据此判断现有工作流能否迁移。

5月29日周五
  1. @OpenRouter69

    阶跃星辰发布 Step 3.7 Flash,主打 agent 效率,采用 198B 稀疏 MoE、约 11B 激活、256K 上下文和 3 级推理,以 Apache 2.0 开放权重。该模型在 ClawEval-1.1 得 67.1、SimpleVQA Search 得 79.2 均列第一,SWE-PRO 得 56.3,并支持 Claude Code、MCP 等工具调用,可在 Mac Studio M4 Max、DGX Spark 等设备本地运行。

    引用StepFun (@StepFun_ai)@StepFun_ai

    ⚡️ Step 3.7 Flash is here: The new frontier is agent efficiency. #1 ClawEval-1.1 (67.1), #1 SimpleVQA Search (79.2), #2 SWE-PRO (56.3), 95.3 on V* Python. Open weights under Apache 2.0. Built for agentic, coding, search, and multimodal workflows — balancing speed, cost, and reliable execution. - 400 TPS. 198B sparse MoE, ~11B active. 256K context, 3 reasoning levels. - Understands UIs, charts, docs, images — then writes code or calls tools to act on what it sees. - Web + visual search reaches further: more sources, deeper follow-up. - Reliable tool use — less drift, fewer broken toolcalls. 98%+ on τ²-bench across all difficulty levels. - Works with Claude Code, KiloCode, Hermes Agent, OpenClaw, and protocols like MCP. - Runs locally on Mac Studio M4 Max, DGX Spark, AMD AI Max+ 395. GitHub: github.com/stepfun-ai/Step-3… HuggingFace: huggingface.co/stepfun-ai/St… GGUF: huggingface.co/stepfun-ai/St… ModelScope: modelscope.cn/models/stepfun… API: platform.stepfun.ai Blog: static.stepfun.com/blog/step…

    推荐理由:从开放权重和速度成本平衡切入 agent 场景,读者可对照其编程与搜索评测及本地部署支持。

  2. @op741865

    Claude Code 发布研究预览版 Dynamic Workflows,由 Claude 现场编写编排脚本,并发启动大量协同 Subagent 处理复杂任务。

    引用ClaudeDevs (@ClaudeDevs)@ClaudeDevs

    New in Claude Code (research preview): dynamic workflows. Claude writes an orchestration script on the fly, then spins up a large fleet of coordinated subagents in parallel to take on your most complex tasks. Use the word "workflow" in a prompt to get started.

    推荐理由:作者补充了官方公告之外的触发方式和 Ultra Code 模式限制,便于判断这一功能如何接入现有流程。

  3. @frxiaobei65

    Claude Code 推出研究预览版动态工作流,Claude 会即时编写编排脚本,并行启动大量协同子智能体来处理复杂任务,在提示词中使用 workflow 一词即可启用。转发该消息的作者以 workflow -> agent > dynamic workflow 表达了对这一演进方向的看法。

    引用ClaudeDevs (@ClaudeDevs)@ClaudeDevs

    New in Claude Code (research preview): dynamic workflows. Claude writes an orchestration script on the fly, then spins up a large fleet of coordinated subagents in parallel to take on your most complex tasks. Use the word "workflow" in a prompt to get started.

    推荐理由:该功能把编排脚本生成与并行子智能体调度交给 Claude 自己完成,可用于观察多智能体工作流的实现方式。

  4. Claude Code GitHub Releases62

    Claude Code v2.1.154 发布,新增 Opus 4.8 与动态 workflow

    Claude Code 发布 v2.1.154,引入 Opus 4.8 作为默认模型并默认高推理强度,可用 /effort xhigh 处理最难任务。新增动态 workflow,可协调数十到数百个后台 Agent,用 /workflows 查看;Opus 4.8 的 fast mode 降价为标准费率 2 倍换 2.5 倍速度;另有多项修复,包括阻止 rm -rf $HOME、改进数据外泄检测等。

    推荐理由:发布说明列出 Opus 4.8 默认高推理、动态 workflow 编排多 Agent 与 fast mode 降价等变化,读者可据此评估升级对现有工作流的影响。

  5. @kimmonismus76

    Anthropic 发布 Claude Opus 4.8,官方称其在 Opus 4.7 基础上判断力更锐利、对自身进展更诚实,可独立工作的时间更长,今日起以相同价格提供。作者补充称该版本在 Agentic coding 基准上有显著提升,并引用官方说法指出 Fast 模式运行同一模型、速度约为 2.5 倍,价格比以前便宜三倍。

    引用Claude (@claudeai)@claudeai

    Introducing Claude Opus 4.8: it builds on Opus 4.7 with sharper judgment, more honesty about its own progress, and the ability to work independently for longer than its predecessors. Available today at the same price.

    推荐理由:除 Agentic coding 基准提升外,原文给出同模型约 2.5 倍速、成本降至此前三分之一的 Fast 模式,便于权衡延迟与价格。

  6. Sierra Blog68

    Sierra 工程师复盘如何独自用 AI 编码智能体在 4 个月内完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。

    推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。