跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 941–960 条 · 共 959 条
12月23日周二
  1. Replit Blog68

    Replit 接入 ChatGPT,对话中可直接构建并部署应用

    Replit 官方宣布接入 ChatGPT,用户在消息中 @replit 即可让 Agent 创建、更新并部署 Replit Apps,预览直接显示在对话中。应用存放在 Replit 账户内,可继续添加数据库、连接 API 或发布到自定义域名;该集成在 ChatGPT App Store 可用市场开放,使用消耗 Replit Agent credits,每个会话对应一个应用。

    推荐理由:官方给出连接步骤、使用方式与账户要求,读者可以据此判断在 ChatGPT 内构建应用的可行路径。

12月17日周三
  1. Gemini API 更新日志76

    Google 发布 Gemini 3 Flash Preview(gemini-3-flash-preview)

    Google 在 Gemini API 更新日志中宣布推出 Gemini 3 Flash Preview(gemini-3-flash-preview),定位为以更低成本提供对标更大模型的快速前沿性能。新模型升级了视觉与空间推理以及智能体编码能力,并附带多模态函数响应、带图像的代码执行等新功能文档。

    推荐理由:官方日志给出新模型的定位、成本与新增功能入口,便于评估其在现有 Gemini API 工作流中的替换价值。

12月9日周二
  1. Mistral AI76

    Mistral 发布 Devstral 2(123B)与 Devstral Small 2(24B)开源编码模型及 Vibe CLI

    Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。

    推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。

12月4日周四
  1. PromptArmor:Threat Intelligence65

    PromptArmor 披露 vLex Vincent AI 屏幕劫持提示词注入漏洞,vLex 已修复

    PromptArmor 披露法律 AI 工具 vLex Vincent AI 的提示词注入漏洞:上传文档中以白底白字隐藏的伪证词可诱导 Vincent AI 输出 HTML 代码,在用户浏览器中渲染仿冒 vLex 登录页的钓鱼弹窗窃取凭据。

    推荐理由:原文完整拆解了提示词注入到屏幕劫持钓鱼的三步攻击链,并给出已被厂商采纳的防护配置建议。

11月20日周四
  1. PromptArmor:Threat Intelligence79

    PromptArmor 演示 Google Antigravity 经间接提示词注入外泄用户凭证与代码

    PromptArmor 发布对 Google Antigravity 的安全分析,演示通过藏在网页指南中的间接提示词注入操纵 Gemini 调用浏览器子代理,将用户 IDE 中的凭证和代码外泄到攻击者控制的 webhook.site 地址。

    推荐理由:原文完整拆解了从间接提示词注入到浏览器子代理外泄凭证的攻击链,并指出默认白名单和设置可被绕过,具备可验证的技术细节。

  2. Factory 研究 / 产品76

    Factory 披露 Droid 平台遭 AI 编排欺诈攻击并用 AI 防御的完整复盘

    Factory 披露其在 10 月检测并瓦解一起针对 Droid 平台的 AI 编排网络欺诈行动。攻击者利用 AI 编码智能体生成代理服务器、自动注册脚本和混淆逻辑,批量薅取免费 token 并转售,涉及数万个合成组织,Factory 评估有高置信度来自中国境内的大型组织且可能涉及国家级行为体。

    推荐理由:Factory 以当事方身份复盘 AI 智能体驱动的欺诈攻击与 AI 防御过程,给出攻击手法细节和可借鉴的防御思路。

11月13日周四
11月5日周三
  1. PromptArmor:Threat Intelligence74

    PromptArmor 披露 Claude for Excel 可被间接提示词注入窃取财务数据

    PromptArmor 演示 Claude for Excel 可经蓝底蓝字隐藏提示词注入,诱导模型生成含攻击者 URL 和敏感数据的 IMAGE 公式,泄露财务模型的营收预测、现金流增长和运营利润率。

    推荐理由:报告完整还原了经由 IMAGE 公式外泄 M365 财务数据的攻击链,并给出组织侧的具体缓解配置建议。

10月27日周一
  1. MiniMax Blog74

    MiniMax 开源并发布面向 Agent 与编码的 MiniMax M2

    MiniMax 开源并发布面向 Agent 和编码场景的模型 MiniMax M2,API 定价为每百万输入 tokens $0.30/¥2.1、输出 $1.20/¥8.4,为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍,TPS 约 100。

    推荐理由:官方给出了 M2 的定价、推理速度、基准成绩与部署方式,读者可据此评估其在 Agent 工作流中的成本与性能权衡。

10月21日周二
  1. PromptArmor:Threat Intelligence69

    PromptArmor 演示通过恶意插件市场劫持 Claude Code 并外传用户文件

    PromptArmor 发布研究,展示恶意 Claude Code 插件如何绕过人工审批并将用户文件外传。攻击链为用户安装仿冒 Anthropic 的第三方 Marketplace 插件后,利用恶意 hook 覆写 settings.local. 权限或自动批准 curl 命令,再借插件 Command 中的间接提示词注入诱导 Claude 向攻击者服务器发送代码库数据。

    推荐理由:原文完整演示了恶意 Claude Code 插件绕过人工审批并外传文件的攻击链,读者可据此审视插件生态与权限防线。

9月25日周四
  1. Factory 研究 / 产品64

    Factory Droid 以 58.8% 登顶 Terminal-Bench,并详解智能体设计方法

    Factory 宣布其软件开发智能体 Droid 以 58.8% 的任务解决率在 Terminal-Bench 排行榜第一,Opus 4.1、GPT-5 和 Sonnet 4 三种单模型配置均显著领先其他单模型智能体,并超过 Codex CLI(42.8%)和 Claude Code(43.2%)。

    推荐理由:原文在成绩之外给出智能体设计的可复用做法,如分层提示词、模型专属适配和精简工具,能帮助改进自己的 Agent。

9月22日周一
  1. DeepSeek API updates65

    DeepSeek-V3.1-Terminus 发布,deepseek-chat 与 deepseek-reasoner 均已升级

    DeepSeek 官方宣布 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.1-Terminus,分别对应其非思考模式和思考模式。此次更新保持模型原有能力,针对用户反馈改进了语言一致性,缓解中英文混杂和偶发异常字符问题,并优化了 Code Agent 与 Search Agent 的表现。

    推荐理由:官方说明升级后的接口对应关系和两类具体改进,现有用户可据此判断是否切换或观察效果。

9月5日周五
  1. Factory 研究 / 产品68

    Factory 讲解如何用 Linter 约束 Agent 代码生成

    Factory 发布实践文章,主张把架构、边界和规范编码为 lint 规则,让 LLM Agent 在代码生成循环中获得自动反馈并自我修正,将“lint green”作为完成标准。文章给出可检索性、代码组织、架构边界、安全、测试、可观测性等规则类别,介绍 lint 驱动的大规模迁移方法,并说明 AGENTS.md 负责“为什么”,linting 提供机器可执行的保证。

    推荐理由:文章给出把架构规范编码为 lint 规则的完整类别清单和落地流程,可直接迁移到自己团队的 Agent 开发工作流。

8月21日周四
7月11日周五
7月1日周二
  1. Factory 研究 / 产品70

    Factory 提出 Agent-Native Development 智能体开发方法论

    Factory 发布 Agent-Native Development 指南,讲解如何让智能体运行完整的开发内循环:收集上下文、规划、实现、验证并提交可审查的变更。

    推荐理由:Factory 提出 Agent-Native Development 方法论,给出精确规格、环境配置和任务失败时的恢复策略,可直接迁移到日常智能体编码工作流。

5月28日周三
5月27日周二
  1. Mistral AI65

    Mistral 发布 Agents API,内置工具连接器与智能体编排能力

    Mistral 发布新的 Agents API,将模型与代码执行、网络搜索、图像生成、Document Library 及 MCP 工具等内置连接器结合,并作为 Chat Completion API 的补充简化 Agent 场景开发。

    推荐理由:官方原文给出内置连接器、有状态对话与多智能体编排等核心能力,还附 SimpleQA 数字,读者可据此评估其对企业级 Agent 开发的适用性。

5月21日周三
12月20日周三