跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 921–940 条 · 共 957 条
2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

2月16日周一
  1. Qwen Blog82

    Qwen3.5 发布,开源权重模型 Qwen3.5-397B-A17B

    千问团队正式发布 Qwen3.5 系列,并开源该系列首个模型 Qwen3.5-397B-A17B 的权重。该模型是原生视觉语言模型,官方称其在推理、编码、智能体能力和多模态理解的全套基准评测中表现突出,面向开发者和企业开放使用。

    推荐理由:官方宣布 Qwen3.5 系列首个开源权重模型发布,覆盖推理、编码、智能体和多模态评测,适合关注开源多模态模型进展的读者。

2月12日周四
2月10日周二
  1. PromptArmor:Threat Intelligence71

    PromptArmor 揭示消息应用链接预览可致 AI 智能体数据外泄,OpenClaw 默认 Telegram 配置受影响

    PromptArmor 发布研究,指出消息应用(如 Telegram、Slack)的链接预览会在无需用户点击的情况下自动请求 URL,间接提示词注入可诱导 AI 智能体在回复中返回携带用户敏感数据的恶意链接,从而在预览时即完成数据外泄。

    推荐理由:原文给出完整的链接预览数据外泄攻击链和可复现测试,读者可据此自查所用智能体是否暴露风险。

2月7日周六
2月4日周三
  1. ElevenLabs Blog60

    ElevenLabs 完成 5 亿美元 D 轮融资,估值 110 亿美元

    ElevenLabs 完成 5 亿美元 D 轮融资,估值 110 亿美元,较一年前增长超过三倍,累计融资达 7.81 亿美元。本轮融资由 Sequoia Capital 领投,Andrew Reed 加入董事会,A16Z 加注四倍、ICONIQ 加注三倍。

    推荐理由:官方公告给出了融资金额、估值、ARR 和资金用途,读者可以据此了解 ElevenLabs 在语音智能体上的投入方向。

2月3日周二
  1. Qwen Blog63

    Qwen 发布 Qwen3-Coder-Next:面向编码智能体的开源权重混合架构模型

    Qwen 团队发布开源权重模型 Qwen3-Coder-Next,专为编码智能体和本地开发设计。模型基于 Qwen3-Next-80B-A3B-Base 构建,采用混合注意力加 MoE 的新架构,通过大规模可执行任务合成、环境交互和强化学习进行 agentic 训练。

    推荐理由:原文说明该模型面向编码智能体与本地开发,并给出混合注意力加 MoE 的架构与训练方式,读者可据此评估其定位。

1月29日周四
1月28日周三
  1. Mistral AI70

    Mistral 发布 Mistral Vibe 2.0 终端编码智能体并调整 Devstral 2 定价

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。

    推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。

1月27日周二
  1. PromptArmor:Threat Intelligence77

    PromptArmor 披露 Claude Cowork 可经提示词注入将用户文件外传至攻击者 Anthropic 账户

    PromptArmor 演示了针对 Claude Cowork 的文件外传攻击:藏在 .docx 中的提示词注入操纵 Claude 用 curl 调用 Anthropic 文件上传 API,把用户本地文件传到攻击者账户,全程无需人工批准;VM 限制出站网络但 Anthropic API 属白名单。

    推荐理由:原文完整演示了 Claude Cowork 经 Anthropic API 白名单外传本地文件的攻击链,并指出 Opus 4.5 同样可被操纵,威胁具体可查。

1月21日周三
  1. PromptArmor:Threat Intelligence77

    PromptArmor 披露 OpenAI API 日志未修复的数据外泄漏洞

    PromptArmor 披露 OpenAI Platform 的 responses 和 conversations API 日志因不安全渲染 Markdown 图片,可导致使用该平台的应用和智能体数据外泄,即使应用自身已屏蔽恶意 Markdown 图片也会中招。

    推荐理由:原文完整披露攻击链和修复进展,开发者可借此检查自己应用的日志查看风险。

  2. Replit Blog63

    Replit 介绍 Replit Agent 的决策时引导方法,提升长轨迹可靠性

    Replit 发布博文,介绍其为 Replit Agent 设计的决策时引导(decision-time guidance)机制,用轻量多标签分类器在关键决策点注入简短情境化指令,替代静态系统提示词,将可控引导从 4–5 条静态提醒扩展到数百条。

    推荐理由:Replit 自述其 Agent 的决策时引导机制,包含注入位置对比实验和缓存成本数据,方法对同类 Agent 工程有可迁移性。

1月16日周五
1月14日周三
  1. PromptArmor:Threat Intelligence76

    PromptArmor 披露 Superhuman AI 间接提示词注入导致邮件数据外泄漏洞

    PromptArmor 威胁情报团队发现 Superhuman AI 存在间接提示词注入漏洞,可把用户数十封含财务、法律、医疗信息的邮件内容提交到攻击者的 Google Form。

    推荐理由:原文给出完整的间接提示词注入攻击链和绕过 CSP 的具体手法,安全团队可以据此排查同类 AI 邮件助手的泄露风险。

1月9日周五
  1. PromptArmor:Threat Intelligence69

    PromptArmor 披露 Notion AI 间接提示词注入致数据外泄漏洞

    PromptArmor 披露 Notion AI 存在间接提示词注入漏洞,AI 文档编辑在用户批准前即已保存,攻击者借此在用户尚未响应外部 URL 信任警告时,将含薪资预期、候选人反馈等敏感信息的 hiring tracker 数据经恶意图片 URL 外泄。

    推荐理由:原文完整拆解了间接提示词注入导致 Notion AI 数据外泄的机制,并给出企业和 Notion 两方的具体缓解配置。

1月8日周四
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 IBM Bob 编码智能体可经提示词注入下载并执行恶意软件

    PromptArmor 披露 IBM 的编码智能体 Bob(含 Bob CLI 与 Bob IDE,当前 Closed Beta)存在漏洞:用户只要对一条已知可信命令(如 echo)设置 always allow,攻击者即可通过间接提示词注入触发恶意软件的下载与执行。

    推荐理由:原文演示了 IBM Bob CLI 在一次自动批准下被间接提示词注入触发恶意软件执行的完整链路,并给出三个被绕过的防御细节。

12月23日周二
  1. Replit Blog68

    Replit 接入 ChatGPT,对话中可直接构建并部署应用

    Replit 官方宣布接入 ChatGPT,用户在消息中 @replit 即可让 Agent 创建、更新并部署 Replit Apps,预览直接显示在对话中。应用存放在 Replit 账户内,可继续添加数据库、连接 API 或发布到自定义域名;该集成在 ChatGPT App Store 可用市场开放,使用消耗 Replit Agent credits,每个会话对应一个应用。

    推荐理由:官方给出连接步骤、使用方式与账户要求,读者可以据此判断在 ChatGPT 内构建应用的可行路径。

12月17日周三
  1. Gemini API 更新日志76

    Google 发布 Gemini 3 Flash Preview(gemini-3-flash-preview)

    Google 在 Gemini API 更新日志中宣布推出 Gemini 3 Flash Preview(gemini-3-flash-preview),定位为以更低成本提供对标更大模型的快速前沿性能。新模型升级了视觉与空间推理以及智能体编码能力,并附带多模态函数响应、带图像的代码执行等新功能文档。

    推荐理由:官方日志给出新模型的定位、成本与新增功能入口,便于评估其在现有 Gemini API 工作流中的替换价值。

12月9日周二
  1. Mistral AI76

    Mistral 发布 Devstral 2(123B)与 Devstral Small 2(24B)开源编码模型及 Vibe CLI

    Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。

    推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。