跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 901–920 条 · 共 959 条
4月14日周二
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Ramp Sheets AI 可经提示词注入外传财务数据

    PromptArmor 披露 Ramp 的 Sheets AI 存在数据外传漏洞,隐藏在外部数据集中的白底白字间接提示词注入可诱导 AI 插入 IMAGE 恶意公式,将用户机密财务模型数据发往攻击者服务器,全程无需用户批准。

    推荐理由:原文完整披露了攻击链和厂商修复时间线,读者可以对照 Claude for Excel 的处置理解公式外传数据的同类风险。

4月13日周一
  1. Together AI Blog62

    Together AI 发布 EinsteinArena,智能体协作将 11 维 kissing number 下界推至 604

    Together AI 发布 EinsteinArena,一个供智能体在开放数学问题上互动、讨论和竞争的平台,含实时验证与公开排行榜,已完全开源。智能体通过多轮协作将 11 维 kissing number 下界从 AlphaEvolve 的 593 推至 604,截至 2026 年 4 月 11 日已产生 11 项新 SOTA 结果,覆盖 Erdős 最小重叠问题、第二自相关不等式等。

    推荐理由:原文给出多智能体协作在开放数学问题上刷新界值的实例和开放接口,读者可以了解智能体协作搜索的实际运作方式。

4月10日周五
  1. Factory 研究 / 产品60

    Factory 详解 Missions 架构:用多智能体分工拆解大型编码任务

    Factory 发布 Missions 系统的架构解析,将大型编码任务拆分为由编排器、worker 和独立 validator 分工完成的小单元,用验证契约和共享状态避免单上下文窗口过载。

    推荐理由:原文拆解 Missions 的编排器、worker、validator 分工与状态外置设计,并给出真实任务的运行数据,方法对构建长程编码智能体有直接参考价值。

4月9日周四
  1. LlamaIndex:产品、工程与评测66

    LlamaIndex 发布 LlamaParse 与 LiteParse Agent 技能,为智能体提供文档理解能力

    LlamaIndex 为 LlamaParse 和 LiteParse 推出可安装的 Agent 技能,支持 Claude Code、OpenClaw、OpenCode 等运行时,通过 npx skills add run-llama/llamaparse-agent-skills 安装。

    推荐理由:原文面向 Agent 解析复杂文档的痛点,给出 LlamaParse 与 LiteParse 两套技能的分工思路和可安装入口,便于迁移到自有工作流。

4月8日周三
  1. Factory 研究 / 产品64

    Factory 发布桌面应用,为 Droids 提供原生多智能体界面

    Factory 发布桌面应用,作为运行 Droids 的原生界面,今日登陆 macOS 和 Windows,包含在现有订阅中。支持多智能体会话、持久化 Droid Computers(含 Cloud Computers 和 BYO Machine)、通过 Ollama 或 vLLM 运行本地模型、电脑操作、VS Code 集成、MCP/技能/钩子插件生态及移动端。

    推荐理由:原文给出多智能体会话、持久化 Droid Computer、本地模型与电脑操作等能力细节,读者可据此评估它对现有工作流的影响。

4月2日周四
  1. Qwen Blog65

    Qwen3.6-Plus 发布,主打真实世界智能体能力

    Qwen 团队继 2 月发布 Qwen3.5 系列后,宣布 Qwen3.6-Plus 正式发布,现已可通过 API 使用。官方称该版本相比前代有大幅能力提升,尤其显著增强了智能体编码能力,覆盖从前端网页开发到复杂仓库级问题求解的场景。

    推荐理由:官方宣布新一代模型上线 API,重点提升智能体编码能力,关注代码开发的读者可以对比前代评估升级幅度。

4月1日周三
  1. Factory 研究 / 产品61

    Factory 发布 Legacy-Bench 基准,检验 AI 智能体维护遗留软件的能力

    Factory 发布 Legacy-Bench 基准,用涵盖 COBOL(46%)、Java 7(32%)等六类遗留语言的数百个任务测试 AI 智能体,12 个模型-智能体组合的通过率为 16.9% 至 42.5%,而这些模型在 SWE-bench Verified 等现代基准上得分超过 70%。

    推荐理由:原文用真实遗留代码任务填补现有基准的盲区,给出各模型在 COBOL 等语言上的具体分数和失败模式,可帮助读者评估 AI 智能体处理关键遗留系统的实际能力。

3月24日周二
  1. PromptArmor:Threat Intelligence69

    PromptArmor 披露 Snowflake Cortex Code 沙箱逃逸漏洞,恶意命令可绕过人工审批执行

    PromptArmor 披露 Snowflake Cortex Code CLI 的命令验证漏洞,攻击者可借助 README 中的间接提示词注入,通过 process substitution 表达式绕过人工审批并设置 dangerously_disable_sandbox 逃逸沙箱,下载执行恶意脚本,利用缓存 token 对 Snowflake 进行数据窃取、删表等操作。

    推荐理由:原文完整复现了从提示词注入到沙箱绕过和凭证窃取的攻击链,并给出修复版本和官方通告入口,便于读者核对自身配置。

3月23日周一
3月20日周五
3月18日周三
  1. MiniMax Blog76

    MiniMax 发布 M2.7:让模型深度参与自身迭代,SWE-Pro 得分 56.22%

    MiniMax 发布 M2.7 模型,称其为首个深度参与自身演化的 M2 系列模型,让模型构建 skills、更新记忆并改进强化学习实验流程。SWE-Pro 得分 56.22%,VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高;MLE Bench Lite 三次运行平均奖牌率 66.6%。

    推荐理由:原文给出了自进化工作流细节和多维度基准数据,读者可以对照评估 M2.7 在智能体与工程任务上的实际位置。

3月17日周二
  1. Manus Blog63

    Manus 升级 Google Workspace 连接器,支持 Docs、Sheets 和 Slides 精准编辑

    Manus 为 Google Workspace 连接器推出重大升级,基于 Google Workspace 团队开源的 Google Workspace CLI(非 Google 官方支持产品),从创建和读取文件扩展到 Docs 精准文本替换、Sheets 跨表数据交叉引用、Slides 编辑现有演示文稿等精细操作。

    推荐理由:官方说明了升级后连接器能做的精细操作和免费开放方式,读者可据此判断是否改变自己的 Workspace 工作流。

3月16日周一
  1. Manus Blog69

    Manus 发布桌面应用 "我的电脑",可操作本地文件与应用

    Manus 发布 Manus 2.0 桌面应用的核心功能 "我的电脑",将此前完全运行在云端的 Manus 带到本地电脑,通过在终端执行命令行指令读写本地文件并控制本地应用。

    推荐理由:官方介绍了桌面端让 Manus 通过本地终端操作文件与应用的机制,并保留逐条命令审批的控制设计,可了解其工作流变化。

3月11日周三
  1. Replit Blog67

    Replit 发布 Agent 4:主打设计自由、并行任务与一站式产出

    Replit 发布 Agent 4,宣称可将生产级软件交付速度提升 10x。Agent 4 支持在同一环境中生成设计变体并直接应用于应用代码、多智能体并行执行任务、基于任务的工作流自动排序请求,并可在同一项目中构建 Web 与移动应用、幻灯片、数据应用和动画,还能操作 Linear、Notion 等连接服务。

    推荐理由:官方原文给出设计画布、并行任务和跨项目产物四项能力细节,可帮助读者评估它对现有开发流程的改变。

  2. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  3. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

3月7日周六
3月6日周五
  1. Manus Blog63

    Manus 横评 8 个免费 AI 作品集制作工具并给出 2026 年排名

    Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。

    推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。

  2. Manus Blog68

    Manus 评测 7 款 AI 应用构建工具:同一提示下谁最能交付完整应用

    Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。

    推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。