跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 601–620 条 · 共 845 条
6月23日周二
  1. inclusionAI Hugging Face models62

    inclusionAI 发布 SingGuard-8b 策略自适应多模态安全护栏模型

    inclusionAI 发布 SingGuard 多模态安全护栏模型家族,支持文本、图像、图文及多语言、query 侧与 response 侧的安全评估。模型把生效的安全策略作为运行时输入而非固定训练分类,部署方无需重训即可按默认类别或自定义自然语言规则判定内容,并以 safe/unsafe 加匹配风险类别的 <answer> 标签输出结果。

    推荐理由:原文给出策略作为运行时输入的设计与多模态、多语言覆盖范围,读者可据此判断免重训适配审核规则的可行性。

  2. Qwen Blog61

    Qwen 发布 Qwen-AgentWorld 面向通用智能体的语言世界模型

    Qwen 团队发布 Qwen-AgentWorld,一个原生语言世界模型,用一个模型模拟七个领域的智能体环境,包括文本类环境 MCP、Search、Terminal 和 SWE。官方称环境建模从持续预训练(CPT → SFT → RL)开始就是训练目标,而非在通用 LLM 上的事后改造。

    推荐理由:原文说明该模型从预训练起就以环境建模为目标,覆盖七个领域,读者可了解其与通用 LLM 改造路线的区别。

  3. Hugging Face Blog65

    huggingface_hub 如何用 AI 起草、人工把关实现每周发版

    huggingface_hub 将发布周期从每 4 到 6 周一次缩短到每周一次,用 GitHub Actions 编排整个流程,由开源权重模型起草 release notes 和 Slack 公告,再由人工审核后发布。

    推荐理由:原文公开了发版工作流的信任校验循环,读者可据此把模型起草加确定性校验的方法迁移到自己的项目。

6月22日周一
  1. Nathan Lambert: Interconnects82

    Nathan Lambert:GLM-5.2 是开源智能体模型的台阶式跃迁

    Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。

    推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。

6月21日周日
  1. microsoft.com(经 Hacker News)78

    AutoJack:单个网页即可对运行 AI 智能体的主机实现 RCE

    微软安全博客披露名为 AutoJack 的攻击方式,称访问单个页面即可对运行 AI 智能体的主机实现远程代码执行(RCE)。该文出自 Microsoft Security 博客,链接指向其 2026/06/18 的文章。

    推荐理由:披露单个网页即可对运行 AI 智能体的主机实现 RCE,可借此了解智能体部署环境的攻击面。

6月19日周五
  1. Hugging Face Blog62

    MosaicLeaks 基准提出 PA-DR 训练法,把研究智能体的隐私泄露从 34.0% 降到 9.9%

    MosaicLeaks 提出一项深研究任务,用交错公开与私密信息的多跳问题衡量研究智能体外部查询的隐私泄露,并定义意图、答案、全信息三类泄露指标。团队提出的 Privacy-Aware Deep Research(PA-DR)训练法把严格链成功率从 48.7% 提升到 58.7%,同时把答案或全信息泄露从 34.0% 降到 9.9%。

    推荐理由:材料把智能体的外部查询日志视为泄露通道,量化三类泄露,并显示提示词难以约束、需靠训练才能把泄露压低三倍多。

6月18日周四
  1. Claude Blog64

    Anthropic 说明 Claude Code 中 CLAUDE.md、skills、hooks 与 subagents 的适用场景

    Anthropic 在 Claude Blog 发文对比 Claude Code 中 CLAUDE.md、rules、skills、subagents、hooks 和 output styles 的加载时机与上下文成本,并给出各自适用的指令类型。

    推荐理由:文章按加载时机与上下文成本逐项对比 CLAUDE.md、rules、skills、subagents 和 hooks,给出指令该放哪里的判断依据。

  2. Claude Blog65

    Claude Code 推出 artifacts,可将工作进展生成实时可分享的网页

    Anthropic 宣布 Claude Code 支持 artifacts,可基于会话完整上下文(代码库、连接器、对话)生成 PR walkthrough、仪表盘、发布清单等实时网页,并随会话进展自动更新。页面默认组织内私有,支持版本历史和管理员权限控制,目前以 beta 形式面向 Claude Team 和 Enterprise 组织开放,可从 Claude Code CLI 和桌面应用使用。

    推荐理由:官方说明给出 artifacts 的工作方式、调试场景和组织级权限设置,团队用户可据此评估是否引入协作流程。

6月17日周三
  1. Hugging Face Blog69

    Strands Agents 与 LeRobot 如何从 Hugging Face Hub 部署到机器人硬件

    AWS 以 Apache 2.0 开源的 Strands Robots 把 LeRobot 的硬件抽象、仿真和策略推理封装成 AgentTools,让单个 Strands 智能体从 Hugging Face Hub 数据集走到真实机器人。

    推荐理由:把从 Hub 数据集到物理机器人的流程拆成五步,仿真与真机共用同一数据集格式,可作为具身智能体接入的参考。

  2. Hugging Face Blog85

    GLM-5.2 发布,面向长周期任务并支持 1M token 上下文

    GLM-5.2 发布,是面向长周期任务的旗舰模型,首次在 1M token 上下文上提供该能力,并采用 MIT 开源协议。相比 GLM-5.1,它在 Terminal-Bench 2.1 上从 63.5 提升到 81.0,在 SWE-bench Pro 上从 58.4 提升到 62.1。

    推荐理由:GLM-5.2 将上下文扩展到 1M token 并以 MIT 协议开源,读者可对照它与 Claude Opus 4.8、GPT-5.5 在长周期基准上的差距。

  3. Hugging Face Blog68

    Hugging Face 发布 Agentic Resource Discovery 规范与 Discover Tool

    Hugging Face 发布了由 Microsoft、Google、GoDaddy、Hugging Face 等贡献者参与开发的 Agentic Resource Discovery(ARD)草案规范,以及参考实现 Discover Tool,让智能体在运行时用自然语言搜索发现 MCP 工具、Skills 和 A2A 智能体,而不必预先安装。

    推荐理由:原文给出了 ARD 规范的落地形态与可调用的搜索入口,读者能据此理解智能体按需发现能力的路径。

  4. AI寒武纪 · 微信公众号80

    智谱发布 GLM-5.2:753B 参数、1M token 上下文并完全开源

    智谱发布 GLM-5.2,以 MIT 协议完全开源,参数 753B,支持 1M token 上下文窗口,主打长程任务能力。文中称在相近 token 消耗下其能力介于 Opus 4.7 与 Opus 4.8 之间;FrontierSWE 得分 74.4,落后 Opus 4.8 约 1%,超过 GPT-5.5 的 72.6。

    推荐理由:文中给出 GLM-5.2 在长程编程基准上与 Opus 4.8 的分数对比,可看到开源模型在长任务上的位置。

6月16日周二
6月12日周五
  1. Hugging Face Blog61

    AllenAI 开源 olmo-eval 模型开发评测工作台

    AllenAI 发布 olmo-eval,一个面向模型开发循环的开源评测工作台,在其 OLMES 评测标准基础上扩展。它把任务、套件与 harness 解耦,支持智能体与多轮评测,并可按需选择直接运行或容器沙箱执行,以控制成本。除整体分数外,它还给出标准误和最小可检测效应,并能将两个模型 checkpoint 逐题对齐比较,以区分真实改进与噪声。代码已在 GitHub 开放。

    推荐理由:它把评测从一次性跑分挪进持续训练循环,逐题对比 checkpoint 能看出被平均分掩盖的真实变化。

  2. Linear Now72

    Linear 推出 coding sessions、自动化 triage 和 Diffs,让 Linear Agent 直接完成编码

    Linear 发布 coding sessions、自动化 triage 和 Diffs,Linear Agent 可以从 issue 直接触达实现:阅读 issue 与讨论、调查代码库、提出方案、写代码并开 PR,全程在云端用 Claude Code 或 Codex 等模型与 harness 完成。

    推荐理由:Linear 官方给出从 issue 到 PR 的完整执行闭环细节,并附自用数据与 Ramp、Coinbase 案例,读者可评估其对工程流程的影响。

6月11日周四
  1. AI as Normal Technology73

    Arvind Narayanan:AI 为何没有也不会取代软件工程师

    作者论证 AI 达到某能力阈值将引发大规模裁员的叙事不成立。纽约州 WARN 披露首年超 160 家公司提交通知,仅 Nespresso 勾选 AI 项,约 25,000 名被裁者中仅 46 人与 AI 相关;Block、Snap、Intuit 等被广泛归因于 AI 的裁员实际各有财务或重组原因,HBR 调查显示 21% 高管为预期 AI 大幅裁员、仅 2% 因实际部署裁员。

    推荐理由:作者用纽约 WARN 披露、美联储研究和 GitHub 开发者数据支撑论点,给出可用于检验裁员叙事的可迁移框架。