跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 461–480 条 · 共 847 条
8月13日周四
  1. Cursor Blog65

    Cursor 推出 builds,云端智能体启动最高快 3 倍

    Cursor 推出 builds 功能,在后台预先准备可直接使用的开发环境副本,让云端智能体启动最高快 3 倍;Cursor 内部环境启动快了 10 倍,首个 token 生成快了 3 倍。builds 默认每小时创建一次,智能体始终基于最新的成功构建启动,构建失败时继续沿用上一次成功构建,工作不中断。8 月 17 日起,所有新建和现有环境将默认使用 builds,且不额外收费。

    推荐理由:Cursor 公布云端智能体启动变快 3 倍的后台预构建机制,并说明迁移与调试方式。

  2. DeepSeek68

    DeepSeek 发布 DeepSeek-V4-Pro,重点升级 Agent 能力并已在 app/web 的 Expert Mode 和 API 上线,模型名不变。V4-Pro 与 V4-Flash 支持灵活推理档位,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。同时原生支持 OpenAI Responses API,针对 Codex 优化并提供一键设置,详情见 API 文档。

    推荐理由:发布方直接给出 Agent 能力升级、可调推理档位和 OpenAI Responses API 兼容,读者可对照判断是否切换日常模型。

  3. Hugging Face Blog71

    Hugging Face 复盘复现 2,226 篇 ICML 2026 论文的 hackathon

    Hugging Face 于 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战赛,1,221 名参与者用 Claude Code、Codex、Cursor 等智能体在 19 天内发布 6,816 份 Trackio 日志,复现 2,226 篇论文,约占会议的 34%。

    推荐理由:官方复盘给出了逐条声明级别的复现数据和失败案例,可迁移到用智能体做大规模论文审计的工作流。

  4. Claude YouTube74

    Claude Cowork 上线 Chrome 侧边栏

    Claude Cowork 现已作为 Chrome 侧边栏运行,能读取用户已登录的页面并执行阅读、点击、输入和填写表单等操作。技能、插件和连接器首次可在浏览器中使用,对话会保存到历史记录,会话随账号而非设备保留。任务可在浏览器标签页开始,随后在桌面端或手机上继续。

    推荐理由:Claude Cowork 进入浏览器侧边栏,读者可了解技能与连接器如何让智能体直接操作用户已登录的网页。

  5. GitHub Blog67

    AutoGPT:贡献者已 AI 优先,开源项目如何把规则写进代码库

    AutoGPT 创始 AI 工程师 Nicholas Tindle 分享应对 AI 智能体提交 pull request 的做法:把 AGENTS.md 和技能文件放到代码旁边,用 pull request 模板和覆盖率门槛当硬闸门,并让 CLA 签名充当人类识别器。

    推荐理由:AutoGPT 把 AGENTS.md、技能和 CI 门槛放到代码旁的做法,可以迁移到其他开源项目的维护流程里。

  6. 量子位 · 微信公众号78

    DeepSeek V4 Pro 正式版发布,多项基准对标 Fable 5

    DeepSeek V4 Pro 正式版发布,API 平台已上线 DeepSeek-V4-Pro-0813,官方博客尚未发布。在 HLE、Terminal Bench、Cybergym、DeepSWE 等 Agent 基准上,它几乎全面超过 Opus 4.8,逼近 Fable 5,部分榜单反超;百万 tokens 输入 3 元、缓存命中 0.025 元、输出 6 元。

    推荐理由:素材给出多项 Agent 基准对比与 API 定价,可据此判断国产开源模型与闭源前沿的差距及调用成本。

  7. IT Home77

    阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文

    阿里 Qwen 团队通过魔搭 ModelScope 社区开放 Qwen3.8-2.4T-A95B 模型权重,总参数 2.4T、每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。

    推荐理由:官方同时给出 MoE 路由结构、上下文长度与后训练三环节,可据此看清超大规模开源模型在长周期 Agent 任务上的工程取舍。

  8. Gemini API 更新日志65

    Gemini 3.7 Flash 正式发布 GA

    Google 在 Gemini API 更新日志中宣布 Gemini 3.7 Flash(gemini-3.7-flash)正式可用(GA),定位为面向编码和 Agent 的主力模型。官方称其在软件工程、Web 开发和智能体工作流上有大幅改进,2026年12月31日前提供入门价。

    推荐理由:官方说明点名软件工程与智能体工作流的改进,并给出了到2026年底的入门价格窗口。

  9. DeepSeek API updates84

    DeepSeek-V4-Pro 正式版上线,Agent 能力提升并支持 Responses API

    DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 上线,模型名 deepseek-v4-pro,API 调用方式不变。官方称 Agent 能力大幅提升,生产环境性能表现提升尤为显著,并公布 HLE (wo / w tools) 42.7/60.0、Terminal Bench 2.1 87.9、NL2Repo 61.5 等基准成绩。

    推荐理由:官方公告列出了正式版在多项 Agent 与编码基准上的分数、Responses API 支持和峰谷定价细节,方便用户评估迁移与调用时机。

8月12日周三
  1. IT Home78

    SpaceXAI 发布 Grok 4.6 模型,强化长流程智能体任务

    Grok 4.6 正式发布,在 Grok 4.5 基础上进一步强化长时间运行的智能体任务,以及复杂的交互和视觉工作。在综合 9 项基准的 Artificial Analysis Intelligence Index 上,Grok 4.6 与 GPT-5.6 Sol 取得相同成绩,并已在 Cursor 和 Grok Build 上线。

    推荐理由:Grok 4.6 强化长流程智能体任务,在 9 项基准综合指数上与 GPT-5.6 Sol 同分。

  2. 机器之心 · 微信公众号76

    论文揭示前沿模型 API 漏洞:可用弱模型提取 Claude、GPT-5.6 的隐藏思维链

    一篇论文指出 OpenAI、Anthropic、Google 的前沿模型 API 存在设计缺陷,加密返回的完整思维链可以被转移到同系列较弱模型中复述为明文。研究者拿不到服务器端明文,只能用 API 计费的思考 Token 数做长度校验,在 120 道 Codeforces 题目上提取文本的 Token 数与源模型报告高度接近。

    推荐理由:论文给出了跨模型提取隐藏思维链的完整攻击链,读者可据此了解推理模型 API 的设计缺陷与修复方向。

  3. Cursor Blog68

    Cursor 与 SpaceXAI 发布 Grok 4.6,面向长时间运行的智能体

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,该模型基于 Grok 4.5 打造,重点面向长时间运行的智能体以及更复杂的交互与视觉工作。它在由九项基准测试构成的 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。

    推荐理由:Grok 4.6 与 GPT-5.6 Sol 在综合智能指数上持平,文中给出了与 Grok 4.5 及 GPT-5.6 Sol 的多项基准对比。

  4. OpenRouter Announcements65

    OpenRouter 上线实时网络搜索基准:比较引擎、深度与模型的取舍

    OpenRouter 发布实时网络搜索基准榜单,覆盖 BrowseComp、DeepSearchQA、WideSearch 和 HLE 四套评测,比较模型、引擎(Exa、Parallel、Perplexity 及 OpenAI、Anthropic、Google 原生搜索)、搜索方法与预算的组合。

    推荐理由:原文用四套实时榜单量化搜索预算、引擎与模型对质量和成本的影响,还给出可直接套用的参数配置方法。

  5. Claude Blog64

    Claude in Chrome 侧边栏升级为 Claude Cowork 会话

    Claude 在 Chrome 的侧边栏会话已改为 Claude Cowork 会话,对话会保存到历史记录,技能和连接器可在浏览器中使用,在标签页里开始的任务能在桌面端、网页端和移动端接续完成。

    推荐理由:官方说明了侧边栏会话与多端打通后的连续工作方式,也交代了浏览器智能体面临的提示词注入风险和新增的动作检查。

  6. Google Research66

    Google Research 推出 AMIE (Video):实现实时音视频临床问诊,表现达到专科医生水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。

    推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。

8月11日周二
  1. IT Home86

    Anthropic 称未公开研究版 Claude 将黎曼 ζ 函数零点比例下界从 41.6% 提高到 67.2%

    Anthropic 宣布,尚未公开的研究版 Claude 在黎曼猜想相关研究中取得进展,把黎曼 ζ 函数临界线上零点比例的长期下界从 41.6% 提高到 67.2%。

    推荐理由:未公开的研究版 Claude 以 60 个子级智能体自主推进数天,把临界线零点比例下界从 41.6% 提升到 67.2%,并公开了 Lean 验证材料。