跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 361–380 条 · 共 856 条
8月26日周三
  1. Claude Blog73

    Claude Cowork 桌面端内置浏览器上线

    Anthropic 在 Claude Cowork 桌面应用中内置浏览器,Claude 可自主导航网页、阅读、点击、填表,本周起向 Pro、Max 和 Team 计划推送,Enterprise 管理员即日起可开启。

    推荐理由:官方说明了内置浏览器与 Claude in Chrome 的分工、登录方式和安全边界,读者可据此判断网页类任务该交给哪条路径。

8月25日周二
  1. Hugging Face Blog63

    IBM 发布 Granite 4.2 推理模型家族并详解构建过程

    IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。

    推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。

  2. OpenRouter Announcements60

    OpenRouter 发布 Video Generation API 代码指南,一个端点调用 Seedance、Veo、Wan

    OpenRouter 发布视频生成 API 教程,通过 POST /api/v1/videos 提交任务、轮询状态、下载 MP4,同一集成可用 Seedance 2.0、Veo 3.1、Wan 2.7,切换模型只需改 model 标识符。

    推荐理由:OpenRouter 官方教程给出完整的异步视频生成集成代码,包括轮询、失败状态处理和换模型时需注意的参数差异,可直接迁移到自己的项目。

8月24日周一
  1. @kimmonismus65

    英伟达据悉正考虑在股权融资中向 Perplexity 投资数十亿美元,此轮估值超过 300 亿美元,较其上一轮融资提升逾 50%。Perplexity 的年化收入从今年年初不到 2.5 亿美元升至超过 7.5 亿美元,部分由其新的 Computer 智能体带动。双方此前曾探讨授权与招聘协议,谈判现已转向传统投资。

    推荐理由:英伟达拟以超 300 亿美元估值投资 Perplexity,材料给出其年化收入三倍增长与 Computer 智能体的关联。

  2. @alibaba_cloud74

    Kimi-K3 已在阿里云 Model Studio 和 Qwen Cloud 上线,拥有 2.8T 参数和原生 1M token 上下文,面向仓库级软件工程、视觉创作以及能自主规划下一步的智能体。阿里云同步开放 1M token 免费试用,提供 1M-token free trial 与上线即有的 autoTPM 弹性容量。

    推荐理由:阿里云给出 Kimi-K3 的参数量、上下文规格与两个平台的试用入口,可据此判断其可用渠道与定位。

8月22日周六
  1. @AYi_AInotes68

    Google 发布 Gemini 3.7 Flash,官方将其定位为迄今最智能的工作马模型,Google 高管发推称这是其史上增长最快的一次模型发布。

    引用@OfficialLoganK@OfficialLoganK

    Gemini 3.7 is our fastest growing model launch to date, amazing to see the reception!!!

    推荐理由:文章给出 Gemini 3.7 Flash 的代码评测与价格变化,并讨论低价模型对 Agent 算力成本结构的影响。

  2. @SemiAnalysis_65

    SemiAnalysis 指出台积电营收 $40.2B、毛利率 67.7%,营业利润率首次单季超过 60%,三项均创历史新高。N3 仍是 AI 周期的供给瓶颈,台湾、亚利桑那和日本各有新 N3 厂在建并伴随 N5 转换,N2 以更高定价进入,带动混合 ASP 同比 +14%。

    推荐理由:台积电营收与毛利率创新高,结合 N3 产能瓶颈与 N2 定价数据,可看到 AI 需求如何传导到晶圆代工环节。

8月21日周五
  1. Claude Blog69

    Anthropic 发布 AI-Native SDLC 手册,梳理 Claude 在六个研发阶段的落地方式

    Anthropic 发布 AI-Native SDLC playbook,把软件开发流程拆成 Plan、Design、Build、Test、Deploy、Maintain 六个阶段,逐阶段给出具体做法、治理考量与度量指标。

    推荐理由:Anthropic 公开其内部把 Claude 嵌入研发六个阶段的做法,含各阶段产物与治理门槛,便于团队对照改造自身流程。

  2. @omarsar067

    DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API 平台上线,该实验性多模态模型在文本能力上与 DeepSeek-V4-Flash 持平,在多模态智能体基准上大幅超越 V4-Flash 并接近 Opus-4.8。DeepSeek Harness 0.1.1 同日发布,内置对新模型的直接支持,调用模型名为 deepseek-v4-flash-vision-exp。作者另提示关注支持文本、图像和视频输入的 Ox Alpha 1M token 上下文,称其在编码和智能体任务上表现突出。

    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:官方基准对比显示该实验模型在多模态智能体任务上接近 Opus-4.8,读者可据此了解多模态智能体的当前水平。

  3. @AYi_AInotes72

    DeepSeek 在 API 平台上线实验性多模态模型 deepseek-v4-flash-vision-exp,官方称其文本能力与 DeepSeek-V4-Flash 对齐,多模态 Agent 性能接近 Opus-4.8,在 Agents Last Exam 和 ZeroBench 上局部超过。

    原始视频预览图;未保存可播放视频URL
    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:逐条列出这个实验性多模态模型的单图 token 上限、分级定价与免费 Files API 额度,可供评估视觉 Agent 的成本与接入方式。

  4. @kimmonismus67

    DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,文本能力与 DeepSeek-V4-Flash 持平,多模态智能体基准表现接近 Opus-4.8。官方称该模型在多模态智能体基准上较 V4-Flash 大幅提升,可通过 model=deepseek-v4-flash-vision-exp 调用,DeepSeek Harness 0.1.1 同日发布并原生支持该模型。转发该消息的作者提到,取得这一成绩的是 Flash 系列中的小模型。

    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:基准对比显示 Flash 小模型在多模态智能体评测上已接近 Opus-4.8,可供判断轻量模型的能力边界。

  5. @testingcatalog71

    DeepSeek-V4-Flash-Vision-Exp 多模态模型已在 DeepSeek API 平台上线,官方称其性能接近 Opus 4.8,文本能力与 DeepSeek-V4-Flash 持平。该模型支持 Chat Completions、Messages 和 Responses,可混合输入文本与图像,图像可通过 base64、外部 URL 或 Files API 提供,按 V4-Flash 价格计费,每张图片最多 384 tokens。随附基准表显示其在 Terminal Bench 2.1 得分 83.9、ApexBench 得分 36.5。

    引用@deepseek_ai@deepseek_ai

    Multimodal API support 🔌 🔹 Set model='deepseek-v4-flash-vision-exp' 🔹 Images are tokenized for billing: up to 384 tokens each, at V4-Flash pricing 🔹 Supports Chat Completions, Messages & Responses 🔹 Supports mixed text + image input; images can be provided via base64, external URLs, or the Files API. Docs: https://t.co/USZ5gZ3wWB 3/n

    推荐理由:材料给出新模型与 Opus 4.8 及自家文本版本的基准对比和计费细节,便于判断实际可用性。

  6. IT Home80

    OpenAI 开源 Codex Harness,放出 CLI、SDK 与 app-server 三类组件

    OpenAI 以 Apache-2.0 许可开源驱动 Codex 的底层执行框架 Harness,并放出三类组件:运行自动化流水线的 codex exec CLI、支持 TypeScript 和 Python 的 Codex SDK,以及通过 JSON-RPC 连接本地 Codex 进程的 app-server。

    推荐理由:开源的三类组件与 Harness 调优带来的基准变化,可供开发者评估把智能体嵌入自有产品的落地方式。

  7. 机器之心 · 微信公众号77

    Anthropic 拟最早8月底提交 S-1,IPO 目标估值1.5-2万亿美元

    据彭博社报道,Anthropic 正加速公开上市进程,计划最早于今年8月底向 SEC 公开提交 S-1 招股说明书,目标估值1.5-2万亿美元,募资规模有望持平或超越 SpaceX 创下的750亿美元纪录,预计最快今年第四季度挂牌。

    推荐理由:材料给出 Anthropic 的上市时间表、募资体量和营收运行率数据,读者可据此看清前沿模型实验室登陆公开市场的节奏与规模。

  8. @ClaudeDevs70

    Claude Platform 上的 computer use、browser tool、Skills API 和 Files API 现已正式可用(generally available)。官方表示,这些能力可用于在没有 API 的应用中自动化工作,并减少每个任务的往返次数;开发者也可以基于版本化的 skills 和可复用文件构建 Claude Managed Agents。https://t.co/aXHuc6eQBB

    原始视频预览图;未保存可播放视频URL

    推荐理由:这些能力从测试转为正式可用,开发者可在没有 API 的应用里做自动化,并用版本化技能和可复用文件搭建托管智能体。