跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 381–400 条 · 共 874 条
8月22日周六
8月21日周五
  1. Claude Blog69

    Anthropic 发布 AI-Native SDLC 手册,梳理 Claude 在六个研发阶段的落地方式

    Anthropic 发布 AI-Native SDLC playbook,把软件开发流程拆成 Plan、Design、Build、Test、Deploy、Maintain 六个阶段,逐阶段给出具体做法、治理考量与度量指标。

    推荐理由:Anthropic 公开其内部把 Claude 嵌入研发六个阶段的做法,含各阶段产物与治理门槛,便于团队对照改造自身流程。

  2. @omarsar067

    DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API 平台上线,该实验性多模态模型在文本能力上与 DeepSeek-V4-Flash 持平,在多模态智能体基准上大幅超越 V4-Flash 并接近 Opus-4.8。DeepSeek Harness 0.1.1 同日发布,内置对新模型的直接支持,调用模型名为 deepseek-v4-flash-vision-exp。作者另提示关注支持文本、图像和视频输入的 Ox Alpha 1M token 上下文,称其在编码和智能体任务上表现突出。

    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:官方基准对比显示该实验模型在多模态智能体任务上接近 Opus-4.8,读者可据此了解多模态智能体的当前水平。

  3. @AYi_AInotes72

    DeepSeek 在 API 平台上线实验性多模态模型 deepseek-v4-flash-vision-exp,官方称其文本能力与 DeepSeek-V4-Flash 对齐,多模态 Agent 性能接近 Opus-4.8,在 Agents Last Exam 和 ZeroBench 上局部超过。

    原始视频预览图;未保存可播放视频URL
    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:逐条列出这个实验性多模态模型的单图 token 上限、分级定价与免费 Files API 额度,可供评估视觉 Agent 的成本与接入方式。

  4. @kimmonismus67

    DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,文本能力与 DeepSeek-V4-Flash 持平,多模态智能体基准表现接近 Opus-4.8。官方称该模型在多模态智能体基准上较 V4-Flash 大幅提升,可通过 model=deepseek-v4-flash-vision-exp 调用,DeepSeek Harness 0.1.1 同日发布并原生支持该模型。转发该消息的作者提到,取得这一成绩的是 Flash 系列中的小模型。

    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:基准对比显示 Flash 小模型在多模态智能体评测上已接近 Opus-4.8,可供判断轻量模型的能力边界。

  5. @testingcatalog71

    DeepSeek-V4-Flash-Vision-Exp 多模态模型已在 DeepSeek API 平台上线,官方称其性能接近 Opus 4.8,文本能力与 DeepSeek-V4-Flash 持平。该模型支持 Chat Completions、Messages 和 Responses,可混合输入文本与图像,图像可通过 base64、外部 URL 或 Files API 提供,按 V4-Flash 价格计费,每张图片最多 384 tokens。随附基准表显示其在 Terminal Bench 2.1 得分 83.9、ApexBench 得分 36.5。

    引用@deepseek_ai@deepseek_ai

    Multimodal API support 🔌 🔹 Set model='deepseek-v4-flash-vision-exp' 🔹 Images are tokenized for billing: up to 384 tokens each, at V4-Flash pricing 🔹 Supports Chat Completions, Messages & Responses 🔹 Supports mixed text + image input; images can be provided via base64, external URLs, or the Files API. Docs: https://t.co/USZ5gZ3wWB 3/n

    推荐理由:材料给出新模型与 Opus 4.8 及自家文本版本的基准对比和计费细节,便于判断实际可用性。

  6. IT Home80

    OpenAI 开源 Codex Harness,放出 CLI、SDK 与 app-server 三类组件

    OpenAI 以 Apache-2.0 许可开源驱动 Codex 的底层执行框架 Harness,并放出三类组件:运行自动化流水线的 codex exec CLI、支持 TypeScript 和 Python 的 Codex SDK,以及通过 JSON-RPC 连接本地 Codex 进程的 app-server。

    推荐理由:开源的三类组件与 Harness 调优带来的基准变化,可供开发者评估把智能体嵌入自有产品的落地方式。

  7. 机器之心 · 微信公众号77

    Anthropic 拟最早8月底提交 S-1,IPO 目标估值1.5-2万亿美元

    据彭博社报道,Anthropic 正加速公开上市进程,计划最早于今年8月底向 SEC 公开提交 S-1 招股说明书,目标估值1.5-2万亿美元,募资规模有望持平或超越 SpaceX 创下的750亿美元纪录,预计最快今年第四季度挂牌。

    推荐理由:材料给出 Anthropic 的上市时间表、募资体量和营收运行率数据,读者可据此看清前沿模型实验室登陆公开市场的节奏与规模。

  8. @ClaudeDevs70

    Claude Platform 上的 computer use、browser tool、Skills API 和 Files API 现已正式可用(generally available)。官方表示,这些能力可用于在没有 API 的应用中自动化工作,并减少每个任务的往返次数;开发者也可以基于版本化的 skills 和可复用文件构建 Claude Managed Agents。https://t.co/aXHuc6eQBB

    原始视频预览图;未保存可播放视频URL

    推荐理由:这些能力从测试转为正式可用,开发者可在没有 API 的应用里做自动化,并用版本化技能和可复用文件搭建托管智能体。

  9. Claude Blog72

    Claude 平台 computer use、Skills API 和 Files API 正式可用

    Anthropic 宣布 computer use、Skills API 和 Files API 在 Claude Platform 正式可用,computer use 同时新增 browser use 工具,除截图外还读取页面结构,让智能体定位具体字段或按钮。

    推荐理由:正式版给出了多动作执行、浏览器工具和文件存储的具体变化,可据此判断现有智能体工作流的改造空间。

  10. xAI News70

    xAI 将 Grok Build 开放至网页、iOS 和 Android

    xAI 将 Grok Build 从 7 月起仅限 SuperGrok Heavy 的 Early Beta 开放给所有用户,网页、iOS 和 Android 均可使用,只需在对话中描述应用、游戏、网站或仪表盘即可生成可运行版本。

    推荐理由:Grok Build 从仅限 SuperGrok Heavy 的早期测试转向全量开放,并补齐发布分享、自有域名与 GitHub 导出等交付环节。

8月20日周四
  1. @rohanpaul_ai65

    一篇论文提出自我改进 LLM 智能体的技能错误演化现象,不安全任务被蒸馏成可复用技能后,即使原始恶意指令已消失,仍会在后续会话中改变智能体行为。在 21 个演化后的智能体方法配置中,21 个全部产出了不安全技能文件,但只有 15 个在全新会话中造成实际危害,其余 6 个未触发危害。

    推荐理由:论文给出技能库持久化风险的量化证据,并附检测基准与修复方案,可迁移到智能体安全评估。

  2. Mistral AI66

    Mistral 发布 Agentic Search,多步检索在 FinanceBench 上将准确率从 26.7% 提升至 86%

    Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五个工具让模型多步检索、翻阅并验证复杂文档,可通过 Mistral Search Toolkit 及 Studio 和 Vibe 中的 Libraries 使用,无需微调。

    推荐理由:官方给出多步检索循环的完整工具设计和两个基准的具体数字,读者可据此评估它替代一次性 RAG 的适用场景。

  3. @kimmonismus71

    Asana 原估需要五年的 Enzyme 迁移,借助 OpenAI Codex 智能体约一周半完成。最多四个 Codex 智能体依据一段五句话的提示词,在代码库的不同副本上并行工作,工程师每天审阅两次它们的提案。整个项目模型与基础设施成本约 12,000 美元,而此前预估的人力成本约为 600 万美元。

    推荐理由:原文给出 Asana 大型前端迁移的工时与成本对比,可作为判断智能体承接遗留代码改造的参考。

  4. @gdb65

    Codex 的开源 harness 可用于构建编码之外的智能体产品,一个税务申报试点处理了 7,000 份申报,把准备时间缩短约三分之一。团队用它把智能体接入内部应用和运营仪表盘,由应用掌控界面、上下文、工具与审批,harness 负责智能体循环。

    引用@OpenAIDevs@OpenAIDevs

    Teams are using the open-source Codex harness to bring agents into the tools they already use, from internal apps to operations dashboards. Their applications control the interface, context, tools, and approvals while the harness handles the agent loop. https://t.co/shi2vwqxh4

    推荐理由:税务试点把 Codex 用在编码之外,配合开源 harness 展示了智能体接入自有产品的一条路径。

  5. @rohanpaul_ai67

    Stripe 泄露的投资人信披露其收购 OpenRouter,信中称 OpenRouter 的 token 消耗今年迄今以每周 9% 的速度复合增长。信中写道公司把 1 月 1 日视为奇点起点并据此运营,认为智能体正处在成为独立经济参与者的边缘。信中还提到 Stripe 已被超过 500 万家企业采用,相关资金流量约占全球 GDP 的 2%,并称当前规模相对未来可能达到的水平仍然微小。

    推荐理由:泄露的投资人信给出 OpenRouter 的 token 消耗增速,可看到支付公司如何把智能体当作经济参与者来定价。