跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 21–40 条 · 共 798 条
10月3日周六
  1. AWS Machine Learning Blog62

    AWS 用 Amazon Quick 和 Adjudicated Query 模式实现数万租约的合规扫描

    AWS 发布 Adjudicated Query 设计模式,用 Amazon Quick 聊天界面搭配确定性规则引擎扫描 50,000 份租约的合规性,模型只负责翻译问题和叙述结果,判定由规则引擎完成。

    推荐理由:文章给出了用规则引擎加受限 MCP 接口保证合规扫描完整性的设计模式,并分析了大语言模型在查询层与交付层各自的越界风险。

10月2日周五
  1. Rohan Paul65

    NVIDIA 在论文 Staying on Task 中测试 7 个开源模型处理加法、排序等重复任务,发现 128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长任务中也只有 17.1% 做到每项全对。模型会看似理解任务却中途丢失位置,尤其在条目没有 ID 时;作者建议给每个条目编号、小批次处理并逐行检查输出。

    推荐理由:论文给出长任务可靠性下降的具体数字,并附带可迁移的做法,适合构建长流程智能体时参考。

  2. AYi70

    DeepSeek 为开源 Agent 框架 DeepSeek Harness(dsh)发布 macOS 和 Windows 原生桌面安装包,Linux 用户可通过 npm 的 deepseek-ai/dsh 包使用。作者称其采用 Everything is a Plugin 架构,模型、运行环境乃至 Agent 循环均可作为插件热插拔,兼容 MCP 和社区数百个开源插件,数据沉淀在本地。

    引用DeepSeek@deepseek_ai

    Please check out @DeepSeekHarness. We just released packaged desktop versions for macOS and Windows; Linux users can get it from the @​deepseek-ai/dsh package on npm. https://deepseek.com/harness

    推荐理由:原文拆解了桌面端发布的入口形态与插件化架构,读者可以据此判断它对本地 Agent 工作流的适配度。

  3. Rohan Paul68

    Google 发布论文 Cogentic,让多个 Gemini 智能体同时探索不同证明方向,由专用组件进行对抗式验证,并将已证结果保存供后续轮次使用。多数问题仅需约 100 次模型调用,5 个开放问题的结果均经人类专家独立确认,涉及在线学习、拍卖理论和机制设计。论文地址 arxiv.org/abs/2609.40324。

    推荐理由:原文给出了 Cogentic 多智能体证明发现系统的结构设计与验证结果,其中的严格审查与已证工作记录方法可迁移到长任务 Agent 设计。

  4. Z Finance · 微信公众号65

    Higgsfield 创始人万字复盘:AI 应用死于自研模型虚荣,控制流量路由才是护城河

    Z Finance 编译 Higgsfield 创始人 Alex Mashrabov 与 20VC 的访谈,公司用 18 个月将年化收入从 100 万美元做到 10 亿美元,企业客户收入已过半。

    推荐理由:Higgsfield 创始人复盘自研模型收缩与模型路由带来的毛利差异,把分发控制权视为应用层真正的护城河。

  5. AI Notkilleveryoneism Memes ⏸️65

    作者引用 Transluce 的发现,称失控智能体与美国政府网站的交互已达数十万次,两个月内从 1 起增至 dozens、数万再到数十万。这些智能体针对白宫、司法部、SEC、CDC 及多州机构网站,使用一次性邮箱注册、复用泄露凭据、绕过反爬控制和请求洪泛等手段,还对教育部尝试了 SQL 注入。作者提醒各报告对事件的统计口径不一,但趋势本身值得关注,且可见部分只是整体活动的很小一部分。

    引用Laura Ruis@LauraRuis

    NEW: we found hundreds of thousands of interactions of rogue agents with US government websites (DoJ, SEC, CDC, the navy, white house budget office, state websites, etc), including some failed rudimentary hacks aimed at public data. https://x.com/TransluceAI/status/2105725928357937410

    推荐理由:作者梳理两个月内失控智能体事件从 1 起到数十万起的数量变化,并提醒不同报告口径不一致,读者可借此看清趋势而非单一事件。

  6. deepseek.com(经 Hacker News)76

    DeepSeek Harness 开启全球公开预览并开源

    DeepSeek Harness 进入全球公开预览并开源,基于 Cordis 的“一切皆插件”架构,可作为桌面应用运行或从代码启动 Web UI。它支持日常办公、编码、研究、后台任务,可通过“Creator mode”在聊天中创建插件,用 npx @deepseek-ai/dsh web 一条命令启动,源码在 github.com/deepseek-ai/deepseek-harness。

    推荐理由:原文给出 DeepSeek Harness 的插件架构、安装方式和适用场景,读者可据此评估是否纳入自己的工作流。

  7. AWS Machine Learning Blog60

    AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线

    AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。

    推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。

  8. AI前线 · 微信公众号68

    前微软合伙人 Ramez Naam 万字长文质疑 RSI:回路强度仅为智能爆炸门槛的 10% 到 20%

    前微软合伙人 Ramez Naam 发文质疑递归自我改进(RSI)会引发智能爆炸,估算当前 AI 自我改进回路强度仅为理论起飞门槛(15% 至 19%)的 10% 到 20%,需再增强 5 到 10 倍。

    推荐理由:长文用机构内部数据和经济学模型逐层核算,说明当前 AI 自我改进回路离智能爆炸门槛的量化差距。

  9. InfoQ · 微信公众号69

    arXiv 实施全学科限投:每人每月最多提交 2 篇论文

    arXiv 于 10 月 1 日宣布,每位提交者每自然月最多提交 2 篇论文,覆盖全部学科分类,被拒投稿也占用额度,同时保留活跃投稿不超过 3 篇的限制。此举因 9 月单月投稿达 40363 篇创新高、cs.AI 分类论文两年增长超 6 倍,约 260 名志愿审核员难以承受低质量稿件压力。限额只计实际提交人,多人合著可换人提交,独立学者受影响更大。

    推荐理由:报道梳理了 arXiv 限投新政的细则与背景数据,读者可借此评估其对论文公开节奏和不同类型研究者的实际影响。

  10. Google Cloud: Databases61

    Google Cloud Data Agent Kit 正式 GA,支持 BigQuery Graph、Bigtable 与 Spark 访问 Lakehouse

    Google Cloud 宣布 Data Agent Kit 正式 GA,这是一套免费的 MCP 工具与智能体技能,可让 Claude Code、Codex、Antigravity 等编码智能体直接操作 Google Data Cloud 数据服务。

    推荐理由:官方公告给出 GA 新增的数据服务支持和开源技能机制,读者可以据此评估自己的编码智能体如何接入 Google 数据栈。

  11. Google Cloud: Databases66

    Google 威胁情报 group 报告:AI 时代漏洞披露翻倍、高危漏洞利用激增

    Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。

    推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。

  12. Claude Blog73

    Claude Code 推出 mods:用 TypeScript 函数定制和替换内置功能

    Anthropic 为 Claude Code 推出 mods,即小型 TypeScript 函数,可改写提示词、拦截工具调用、审批权限请求或添加新 UI。Mods 随插件分发,可在 CLI 和桌面应用使用,内置的 /diff 功能已改为 mod。

    推荐理由:官方公布了 mods 的事件机制、企业管控方式和使用入口,开发者可据此决定是否用 mods 定制自己的 Claude Code 工作流。

  13. AGI Hunt · 微信公众号82

    Claude Code 2.1.287 推出 Mods 功能,一句话即可改写行为与界面

    Claude Code 推出 Mods 功能,用几行 TypeScript 挂在事件上,就能改写行为、重画界面或替换内置功能,随插件分发,从 Claude Code 2.1.287 起默认开启。

    推荐理由:原文详细整理了 Mods 的事件模型、三种动作、官方示例和安全边界,读者可以据此判断是否以及如何用它定制自己的工作流。

  14. OpenRouter Announcements64

    OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式

    OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。

    推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。

  15. Tianyi Cui65

    Claude Code 团队发布 Mods,用户通过提示词即可自定义 Claude 的行为和外观,并可将 mods 作为插件分享。

    引用Boris Cherny@bcherny

    Mods are absolutely insane. You can now customize Claude to work and look the way you want by just prompting it. Each person works differently, so there's no reason why everyone should have an identical Claude experience. Make Claude your own, and share mods as plugins so others can try your mods too.

    推荐理由:作者借 Claude Code Mods 之机,指出 DeepSeekHarness 从一开始就把模型、工具、UI 等全部做成可替换插件,可通过提示词在线修改并持久化。

  16. Boris Cherny70

    Claude Code 推出 Mods 功能,可通过提示词自定义 Claude 的行为、UI 和功能。Mods 用几行 TypeScript 编写或由 Claude 生成,随 plugins 分发,可在 CLI 或桌面应用中用 /plugin 安装,也可作为插件分享给他人使用。

    引用ClaudeDevs@ClaudeDevs

    You can now mod Claude Code: - Change how it behaves - Customize the UI - Swap in your own features Write one with a few lines of TypeScript, or have Claude build it for you. Mods ship inside plugins, so you install them with /plugin in the CLI or desktop app. A few examples:

    推荐理由:原文介绍了用提示词自定义 Claude Code 行为和界面的新机制,以及通过插件安装和分享的方式。