跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 581–600 条 · 共 845 条
7月3日周五
7月2日周四
  1. Mistral AI64

    Mistral 发布 Leanstral 1.5:6B 激活参数的开源形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。

    推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。

7月1日周三
  1. InfoQ · 微信公众号76

    Anthropic 发布 Claude Sonnet 5,成为 Free 和 Pro 默认模型

    Anthropic 突然发布 Claude Sonnet 5,官方称这是迄今最具智能体能力的 Sonnet 模型,重点提升计划制定、工具调用与自主执行,已面向所有套餐开放并成为 Free 和 Pro 用户的默认模型,同时上线 Claude Code 和 Claude Platform。

    推荐理由:文章把 Sonnet 5 的发布放在 Anthropic 高端模型受出口管制、社区反馈平淡的背景下,梳理其性价比定位与争议。

  2. 量子位 · 微信公众号79

    Anthropic 发布 Sonnet 5,标价持平但分词器换代推高实际账单

    Anthropic 发布性价比模型 Sonnet 5,主打 Agentic 能力,agentic coding 跑分 SWE-bench Pro 达 63.2%,标价与 Sonnet 4.6 一致,约为 Opus 4.8 的六成。开发者实测发现,新分词器让同一段英文的 Token 数增加 42%,在 Artificial Analysis 任务上的实际花费反比 Opus 4.8 高出 27%。

    推荐理由:原文用实测对比展示标价不变背后的Token消耗变化,帮助开发者估算迁移到 Sonnet 5 的真实成本。

  3. AI寒武纪 · 微信公众号80

    Anthropic 发布 Claude Sonnet 5 与科研工作台 Claude Science

    Anthropic 发布 Claude Sonnet 5,Agent 能力接近 Opus 4.8,即日起在免费版、Pro、Max、Team 和 Enterprise 套餐开放,API 代号 claude-sonnet-5,上线初期输入每百万 token 2 美元、输出 10 美元,优惠持续到 8 月 31 日。

    推荐理由:Sonnet 5 把此前多在 Opus 系列出现的 Agent 能力下放到更低价位,读者可据此权衡模型选型与成本。

  4. Claude Code GitHub Releases85

    Claude Code v2.1.197 更新,Claude Sonnet 5 成为默认模型

    Claude Code v2.1.197 引入 Claude Sonnet 5 并设为默认模型,提供原生 1M-token 上下文窗口。8 月 31 日前提供 $2/$10 每百万 token 的促销价,需更新到该版本才能使用。

    推荐理由:原文给出了 Claude Code 默认模型切换到 Claude Sonnet 5 的关键细节和限时定价,读者可据此评估是否升级版本。

6月30日周二
  1. Claude Blog65

    Claude Code 循环工程入门:四类循环原语与 /goal、/loop、/schedule 用法

    Claude 官方博客发布 Claude Code 循环工程入门指南,把智能体循环分为回合制、目标驱动、时间驱动和主动式四类,并说明各自的触发方式、停止条件与适用场景。

    推荐理由:面向 Claude Code 的四类循环原语入门,给出各自的停止条件与 token 控制建议,方便按现有任务挑选合适的循环。

  2. OpenRouter Announcements74

    OpenRouter 数据分析:DeepSeek V4 上线后 token 份额从 9% 翻倍至 18%

    OpenRouter 基于 2026 年 1 月 1 日至 6 月 14 日超 450 万亿 token 的日志分析,DeepSeek V4 于 4 月 24 日发布后,DeepSeek token 份额从年初约 9% 升至 6 月初近 20%,并自 5 月中旬起成为 OpenRouter 上用量第一的模型,智能体工作负载贡献了主要增量。

    推荐理由:基于 OpenRouter 450 万亿 token 日志分析 V4 上线后的份额变化,并区分智能体与人类流量,数据口径和价格对比都有可参考价值。

  3. Claude Platform release notes79

    Anthropic 发布 Claude Sonnet 5,1M 上下文、$2/$10 每 MTok 定价并说明迁移变化

    Anthropic 发布 Claude Sonnet 5(claude-sonnet-5),定价 $2/$10 每 MTok(2026 年 8 月 10 日起为标准价),支持 1M token 上下文窗口和 128k 最大输出,工具与平台功能与 Claude Sonnet 4.6 相同,但不含 Priority Tier。

    推荐理由:原文给出迁移行为变化、定价与上下文规格,可供正在评估升级或迁移的开发者直接对照排查。

6月27日周六
  1. AI前线 · 微信公众号82

    OpenAI 发布 GPT-5.6 有限预览版,双推理模式并受政府白名单限制

    OpenAI 发布 GPT-5.6 有限预览版,包含旗舰级 Sol、中端 Terra 和日常 Luna 三款模型,并引入最大推理努力与超模式两种新推理模式。应美国政府要求,目前仅经批准的企业可访问该模型,个人用户暂无获取途径。外部评估机构 METR 称 GPT-5.6 Sol 的检测作弊率高于其评估过的任何公开模型,其时间跨度评估结果不可靠。

    推荐理由:原文把分阶段白名单发布与外部评测发现的作弊问题并列,读者可据此判断此次能力定位的实际边界。

6月26日周五
  1. Hugging Face Blog67

    在 HF Jobs 上用一条命令运行 vLLM 服务器

    在 HF Jobs 上用一条命令即可运行 vLLM,获得私有、按秒计费的 OpenAI 兼容端点。端点通过 HF token 鉴权,可用 curl 或 Python OpenAI 客户端调用;文章还给出 SSH 调试、Gradio 对话和作为 Pi 编码智能体后端的配置,并对比 HF Jobs 与 Inference Endpoints 的适用场景。

    推荐理由:用一条命令在 HF Jobs 上部署 vLLM 端点,并给出从查询到接入编码智能体的完整配置路径。

6月25日周四
6月24日周三
  1. AI寒武纪 · 微信公众号78

    Nathan Lambert:GLM-5.2 是开源 Agent 重大突破,连锁反应将渗透进更广泛的经济体

    AI 研究者 Nathan Lambert 撰文认为,GLM-5.2 是首个在编程框架中作为通用智能体使用时手感极佳的开放权重模型,官方于 6 月 16 日以 MIT 协议开放权重。

    推荐理由:Nathan Lambert 结合实测与多个基准讨论 GLM-5.2 在编程智能体中的表现,读者可据此观察开源与闭源模型的能力时差。

  2. 硅星人Pro · 微信公众号80

    火山引擎 Force 大会发布豆包 2.1 Pro、Seedance 2.0 4K 等 5 款模型

    火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。

    推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。

  3. Gemini API 更新日志63

    Gemini API 为 Gemini 3.5 Flash 推出 Computer Use 工具公开预览

    Gemini API 为 Gemini 3.5 Flash 推出 Computer Use 工具公开预览,支持基于 intents 的简化操作。内置浏览器、移动端和桌面环境支持,并提供可配置安全策略和高级 prompt injection 检测。

    推荐理由:官方日志列出 Computer Use 工具的-preview 能力清单,读者可以对照现有 Gemini 自动化方案评估迁移成本。

6月23日周二