跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 261–280 条 · 共 847 条
9月3日周四
  1. @claudeai77

    Claude 现在可在 Claude Cowork 和 Claude Code 中后台使用电脑,用户给桌面任务后,Claude 会像用户一样点击、输入并打开应用,同时用户可以处理其他事情。官方展示的授权界面显示,电脑使用需要用户批准,允许 Claude 在后台或完全控制屏幕的情况下查看和操作已批准的应用。

    推荐理由:官方说明 Claude Cowork 和 Claude Code 能在后台操作电脑,并展示了应用授权入口,读者可据此判断这类电脑操作智能体的可用边界。

  2. Claude Blog63

    Anthropic 发布 Claude 商务智能体蓝图,含购物与商家智能体参考实现

    Anthropic 发布用于构建 commerce agents 的蓝图,包含让工程团队在数天内跑起商务智能体所需的 harness、模式与护栏,并提供零售、旅行、电信和票务场景的购物智能体与商家智能体参考实现。

    推荐理由:Anthropic 公开 commerce agents 蓝图与参考实现,开发者可据此判断商务智能体的落地路径与部署选择。

  3. @fofrAI74

    Google DeepMind 发布两款 Gemini 新模型:3.8 Flash 与 3.8 Flash Cyber。3.8 Flash 在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,3.8 Flash Cyber 则主打前沿水平的漏洞检测与自动修补。

    引用@GoogleDeepMind@GoogleDeepMind

    Two new Gemini models are here to help scale your AI agents and secure code: 🔘 3.8 Flash: our most intelligent model yet with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. 🔘 3.8 Flash Cyber: our most capable cybersecurity model with frontier-level vulnerability detection and automated patching.

    推荐理由:Google 一次发布两款 Gemini 3.8 Flash 模型,分别面向智能体任务与代码安全,可对照 3.7 Flash 看提升方向。

9月2日周三
  1. @omarsar067

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款模型。前者在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,后者面向网络安全,具备前沿级漏洞检测与自动修补能力。Elvis Saravia 称 Gemini 3.8 Flash 的定价有吸引力,并认为 3.8 Flash Cyber 在修补能力上处于 Pareto 前沿。

    引用@GoogleDeepMind@GoogleDeepMind

    Two new Gemini models are here to help scale your AI agents and secure code: 🔘 3.8 Flash: our most intelligent model yet with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. 🔘 3.8 Flash Cyber: our most capable cybersecurity model with frontier-level vulnerability detection and automated patching.

    推荐理由:随推附上的对比表把 Gemini 3.8 Flash 的定价与多项基准成绩与 Claude、GPT-5.6 并列,便于横向比较。

  2. @OfficialLoganK65

    Gemini 3.8 Flash 发布,主打智能体与编码能力提升,是 6 周内第三个更新的 Flash 模型。推文附带的对比表显示,其输入价格 $0.75/1M tokens、输出价格 $3.75/1M tokens,Terminal-bench 2.1 得 89.4%,LBVBench 长视频理解得 87.8%(agentic)。优惠价有效期至 2026 年 12 月 31 日,2027 年 1 月 1 日起将调整为输入 $1.50/1M tokens、输出 $7.50/1M tokens。

    推荐理由:原文列出 Gemini 3.8 Flash 的价格与多项基准对比,读者可据此判断其智能体和编码能力相较前代及竞品的位置。

  3. @GoogleAI74

    Google 将 3.8 Flash 开放给 Google AI Pro 与 Ultra 订阅者,覆盖 Gemini App、Google 搜索 AI Mode 和 Google Sheets。开发者可通过 Google AI Studio 与 Android Studio 的 Gemini API 使用,在 antigravity 中探索 agent-first 工作流,并在 stitch 中用 3.8 Flash 生成 UI。Gemini Enterprise 用户可在下拉模型菜单或 Gemini Enterprise Agent Platform 中选择该模型。https://t.co/OzPm3Et10i

    推荐理由:原文列出 3.8 Flash 在订阅端、开发者工具和企业平台的具体开放入口,读者可据此判断自己能否用上。

  4. @GoogleDeepMind67

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,前者面向智能体与软件工程,后者面向代码安全。官方称 3.8 Flash 是迄今最智能的模型,在软件工程、智能体任务和多步推理上相较 3.7 Flash 有明显提升。3.8 Flash Cyber 则具备前沿水平的漏洞检测与自动化补丁修复能力。

    原始视频预览图;未保存可播放视频URL

    推荐理由:官方列出两款 3.8 Flash 的定位差异与相对 3.7 Flash 的提升方向,便于判断编码与安全场景的选型。

  5. @GoogleDeepMind65

    Google DeepMind 宣布推出 Fairwind 计划,为政府和可信合作伙伴提供 3.8 Flash Cyber 的访问权限,用于保护关键基础设施和国家安全。Gemini 3.8 Flash 正在 Antigravity 中推送,并通过 Google AI Studio 和 Android Studio 的 API 提供。Google AI Pro 和 Ultra 订阅者可在 Gemini App 及 Google Search 的 AI Mode 中使用 3.8 Flash。

    原始视频预览图;未保存可播放视频URL

    推荐理由:官方公布了 Fairwind 计划与 Gemini 3.8 Flash 的推送渠道,读者可据此了解面向政府和关键基础设施的接入方式。

  6. @frxiaobei67

    Cognition 正准备以约 470 亿美元估值再融约 10 亿美元,Bloomberg 称其年化收入已超过 9 亿美元。今年 5 月它曾以 260 亿美元估值融资 10 亿美元,当时年化收入约 4.92 亿美元;该公司是 Devin 的开发商,并已接手 Windsurf 的产品、品牌、IP 和团队。

    推荐理由:Cognition 三个月内年化收入从约 4.92 亿美元增至超 9 亿美元,估值接近翻倍,可作为观察 AI Coding Agent 商业化的样本。

  7. Cursor Blog72

    Cursor 发布自托管机器,云端智能体可在自有基础设施上运行

    Cursor 发布自托管机器功能,云端智能体可以运行在团队自管的机器资源池上,智能体循环、推理与规划仍留在 Cursor 云端。工具执行则转移到自有环境中的机器:安装 Cursor CLI 并运行 agent worker start 建立通往 Cursor 云端的出站 HTTPS 长连接,Cursor 从不主动向用户网络发起连接。

    推荐理由:自托管机器把工具执行环境交回团队自有基础设施,推理与编排仍留在 Cursor 云端,读者可据此判断适用边界。

  8. @kimmonismus66

    Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数量 2.4T、上下文 1M tokens,已在 QwenCloud API 上线,定价为每 1M tokens 输入 $2、输出 $6,并针对 Coding 与 Cowork 做了后训练。作者称该版本在基准上已接近 Fable 5,并注意到如此明显的提升已不再伴随版本号变化,同时认为中国实验室与美国的差距正在缩小。

    引用@Alibaba_Qwen@Alibaba_Qwen

    🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902! 2.4T parameters. 1M context tokens. Built for real world complexity. Further post trained on Coding & Cowork, Qwen3.8-Max-0902 now delivers stronger performance across complex enterprise tasks, scientific research, and long horizon workflows. 💰Pricing per 1M tokens: $2 input, $6 output. $0.17 explicit cache hit, $0.25 implicit cache hit. Now live via API on QwenCloud. Come try it! 🙌 API: https://t.co/dq3WgMk980

    推荐理由:材料给出 Qwen3.8-Max-0902 的参数、上下文与定价,作者由此讨论版本迭代节奏和中美实验室差距的缩小。

  9. AI寒武纪 · 微信公众号77

    Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1 双旗舰模型,缓存读取价格降 75%

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1 两款底层架构相同、安全防护等级不同的模型,Fable 5.1 面向大众开放,Mythos 5.1 仅通过可信访问计划向特定机构开放。

    推荐理由:缓存读取价格下调75%并给出分子设计与金星地形重建案例,便于对比新旗舰的能力与成本结构。

  10. @AYi_AInotes67

    阿里更新旗舰模型 Qwen3.8-Max-0902,在 CodeArena WebDev 榜单以 1691 分排名第一,超过 Claude Opus 5 的 1688 分和 Kimi K3 的 1674 分,较前代 Qwen3.8-Max 的 1669 分高出 22 分。

    引用@Alibaba_Qwen@Alibaba_Qwen

    🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902! 2.4T parameters. 1M context tokens. Built for real world complexity. Further post trained on Coding & Cowork, Qwen3.8-Max-0902 now delivers stronger performance across complex enterprise tasks, scientific research, and long horizon workflows. 💰Pricing per 1M tokens: $2 input, $6 output. $0.17 explicit cache hit, $0.25 implicit cache hit. Now live via API on QwenCloud. Come try it! 🙌 API: https://t.co/dq3WgMk980

    推荐理由:列出新版 Qwen 在代码榜单的排位与每百万 tokens 定价,可据此评估替换现有 Agent 底座的成本。