跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 101–120 条 · 共 816 条
9月26日周六
  1. GitHub Blog · AI & ML60

    GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 提供 canvas 功能,运行 /create-canvas 技能并用自然语言描述工作流、界面操作和 agent 职责三要素,即可生成看板、清单等自定义界面并保存为可共享的 extension。

    推荐理由:官方教程给出从描述到生成可复用 canvas 界面的具体步骤和三个提问框架,读者可以直接照做迁移到自己的工作流。

  2. Claude66

    Claude 官方表示 Claude Opus 5.5 发布数日,汇总了用户用其探索和发现的喜爱案例。引用案例中,@RyanSael 让 Opus 5.5 通过构建交互式镜头实验室讲解相机对焦,一次生成耗时 1 小时 26 分钟,API 成本 $25.66,成品见 https://lens.lab.sael.net。

    引用Ryan Sael@RyanSael

    I asked Opus 5.5 to explain camera focus by building an interactive lens lab Here's what it came up with after 1 hour 26 minutes in one shot, $25.66 API cost https://lens.lab.sael.net Move the focus ring and you can see the glass elements shift the sharp plane through the scene

    推荐理由:官方汇总用户用 Opus 5.5 探索的成果,引用案例给出了单次生成时长与成本,可作实际使用参考。

9月25日周五
  1. GitHub Blog · AI & ML61

    GitHub Copilot 博客:为什么聊天界面往往不是正确的 UI,用 canvas 试试

    GitHub Copilot 博客作者提出聊天(chat)很多时候是错误的 AI 交互界面,介绍 GitHub Copilot app 中的 canvas,它是在应用内运行、无浏览器外壳的全栈小应用,可与 Copilot agent 双向通信。

    推荐理由:作者作为 Copilot 团队成员提出用 canvas 自定义界面替代聊天框,并结合工作流自动化等实例说明何时值得让智能体先造工具。

  2. GitHub Blog · AI & ML63

    GitHub Security Lab 发布 Fuzzing Taskflow:用 LLM 智能体自动化 C/C++ 模糊测试

    GitHub Security Lab 的 Antonio Morales 基于自家的 Taskflow Agent 框架构建了 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。

    推荐理由:原文给出完整的架构设计、覆盖反馈循环和分层判断方法,读者可以据此把 LLM 智能体接到自己的模糊测试流程里。

  3. Claude Blog60

    Anthropic 开放 Claude 插件目录提交,新增开发者门户

    Anthropic 开放 Claude 插件目录提交,开发者可通过新的提交门户上传插件并在审核通过后上架。插件可打包 MCP 连接器、Agent Skills 或两者,在 Claude Code 中还可包含 LSP、命令、钩子和 agents;门户支持自动校验、安全扫描、审核状态跟踪,上线后提供按产品面和版本划分的安装分析。

    推荐理由:官方说明了插件提交、审核与使用分析的完整流程,开发者可以据此决定如何把现有 MCP 连接器或技能打包上架。

9月24日周四
  1. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-flash-2.0:100B 总参数、6.1B 激活的 MoE 模型

    inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。

    推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。

  2. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-2.5-1T:1T 总参数、63B 激活的即时模型,支持 1M 上下文

    inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。

    推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。

  3. inclusionAI Hugging Face models69

    inclusionAI 正式开源 Ling-2.6-flash:104B 总参数、7.4B 激活的混合线性 MoE 模型

    inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。

    推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。

  4. inclusionAI Hugging Face models60

    inclusionAI 发布万亿参数推理模型 Ring-2.6-1T

    inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。

    推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。

  5. Google Developers Blog61

    Google Cloud API Gateway 公测支持将 REST API 直接暴露为 MCP 工具

    Google Cloud API Gateway 进入 Public Preview,可充当远程 MCP 服务器,无需单独搭建 MCP 服务器即可把现有 REST 操作变成智能体可调用的 MCP 工具。

    推荐理由:官方宣布 API Gateway 可直接充当远程 MCP 服务器,复用既有鉴权与配额,无需另建 MCP 服务器,适合评估 Agent 接入现有 API 的路径。

  6. Claude73

    Anthropic 官方账号宣布 Claude Marketplace 上线,用户可在其中发现工具、智能体和专家伙伴。用途包括添加 Slack、Notion 等连接器和插件,购买 Cursor、CrowdStrike 等公司的智能体和产品,以及通过 Accenture、Deloitte 等服务伙伴扩展规模。

    推荐理由:官方宣布 Claude Marketplace 上线,读者可以据此了解连接器、Agent 产品和服务伙伴三类入口的实际内容。

  7. Anthropic Research64

    Anthropic Project Swap 实验:Claude 智能体在交易市场代用户换书的表现

    Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。

    推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。

  8. LangChain Blog60

    LangChain 发布 LangSmith Fine-Tuning 与 smithtune CLI,可将 Agent 轨迹转为微调模型

    LangChain 推出 LangSmith Fine-Tuning(Public Beta)和 smithtune CLI,把 LangSmith 轨迹数据集准备、Fireworks 或 Baseten 训练、LangSmith 评估与部署整合到一条命令行流程中,目前支持 SFT。

    推荐理由:官方给出内部两个 Agent 的 SFT 实测数据和完整工作流,读者可据此评估轨迹数据微调自家模型的收益与成本。

9月23日周三