跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 561–580 条 · 共 845 条
7月16日周四
  1. Sierra Blog64

    Sierra 推出内部云 Agent 平台 Pinecone

    Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。

    推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。

7月14日周二
  1. AI as Normal Technology72

    Arvind Narayanan 在 ICML 演讲谈 AI 时代还剩什么工作

    Princeton 的 Arvind Narayanan 在 ICML Seoul 发表题为“还有什么工作留给我们做”的主题演讲,主张用 AI as Normal Technology 框架看待AI影响,并称实验室里程碑不会突然让人失业。他提出方法、产品、早期采用、适应四阶段,指出可靠性指标两年内仅提升五到十个百分点、适应阶段需要数十年;未来工作将从构建转向评估,人类应与AI形成“共同超级智能”。

    推荐理由:作者结合能力与可靠性的测量数据,把AI经济影响拆为四个阶段,给出职业适应与评估优先的判断框架。

7月13日周一
  1. 数字生命卡兹克 · 微信公众号79

    实测 Grok CLI 会上传整个代码库,xAI 在曝光后远程关闭上传开关

    作者用 Codex 伪造合成仓库,实测 xAI 官方 Grok CLI 0.2.93,发现在手动开启上传开关后,它会把整个代码库打包成 before_codebase.tar.gz 和 after_codebase.tar.gz 上传到 gs。

    推荐理由:作者亲手逆向并复现了 Grok CLI 的上传管线,读者能据此判断本地编程 Agent 实际读取和上传了哪些文件。

7月10日周五
  1. 虎嗅APP · 微信公众号77

    OpenAI 发布 GPT-5.6 系列,含旗舰 Sol、均衡 Terra 与轻量 Luna

    OpenAI 推出 GPT-5.6 系列模型,分为旗舰 Sol、均衡 Terra 和轻量 Luna 三款,主推更高性价比。旗舰 Sol 定价为每百万 token 输入 5 美元、输出 30 美元,Terra 为 2.50/15 美元,Luna 为 1/6 美元,即日起在 ChatGPT、Codex 和 OpenAI API 上线。

    推荐理由:OpenAI 一次推出三档定位的 GPT-5.6 模型,文中给出了跑分与定价层层递进的对比数字。

  2. 硅星人Pro · 微信公众号81

    OpenAI 上线 GPT-5.6 全家桶 Sol、Terra、Luna,Codex 应用并入 ChatGPT

    OpenAI 发布 GPT-5.6 全家桶 Sol、Terra、Luna,旗舰 Sol 主攻硬核编码与知识工作,Terra、Luna 主打性价比,每百万 token 定价分别为 $5/$30、$2.5/$15、$1/$6。

    推荐理由:原文列出 GPT-5.6 三档模型与 Fable 5 的编码成绩、token 定价对比,并提到最小的 Luna 由 Sol 完成后训练。

  3. InfoQ · 微信公众号85

    OpenAI 推出 GPT-5.6 三档模型并上线 ChatGPT Work

    OpenAI 正式推出 GPT-5.6 系列,包含旗舰版 GPT-5.6 Sol、均衡版 GPT-5.6 Terra 和轻量版 GPT-5.6 Luna 三款模型,现已通过 ChatGPT、Codex 和 OpenAI API 上线,三档定价分别为每百万输入 Token 5、2.5、1 美元。

    推荐理由:原文给出三档模型的定价与 Token 效率数据,并说明 ChatGPT Work 从问答转向自主执行任务的定位变化。

  4. IT Home76

    OpenAI 推出 ChatGPT Work 智能体,由 GPT-5.6 支持面向长时多步骤任务

    OpenAI 推出 ChatGPT Work 智能体,由 GPT-5.6 提供支持,定位为可承担长时、多步骤任务的智能体。该智能体即日起在 ChatGPT 网页端和移动端向 Pro、Enterprise 和 Edu 用户开放,Plus 和 Business 将在未来几天推出。OpenAI 称 Codex 每周用户数已超过 500 万,其中超 100 万人将其用于软件开发之外的工作。

    推荐理由:OpenAI 把智能体能力从编码扩展到销售和财务,案例给出流程从数周缩短到 24 小时的具体参照。

  5. IT Home81

    OpenAI 上线 GPT-5.6 系列,分 Sol、Terra、Luna 三档

    OpenAI 上线 GPT-5.6 系列模型,覆盖 ChatGPT、Codex 和 API,共分 Sol、Terra、Luna 三档。旗舰 Sol 每 100 万 Tokens 输入 5 美元、输出 30 美元,并新增 Max 推理强度与 Ultra 模式,在 Terminal-Bench 2.1 标准模式得分 88.8%,Ultra 模式达 91.9%。

    推荐理由:原文给出三档模型的定价与 Terminal-Bench 得分,便于比较不同推理强度下的成本与能力取舍。

  6. 数字生命卡兹克 · 微信公众号80

    GPT-5.6 上线并合并 ChatGPT 与 Codex,推出 Sol、Terra、Luna 三个模型

    OpenAI 在直播中正式上线 GPT-5.6,一次推出 Sol、Terra、Luna 三个模型,并把 Codex 应用与 ChatGPT 合并成同一产品。作者实测 GPT-5.6 Sol 在编码和 Agent 执行上幻觉率低,在 Agents' Last Exam 中以 53.6 分比 Claude Fable 5 高 13.1 分。

    推荐理由:作者以数天高强度实测记录了 GPT-5.6 Sol 在编码、Agent 和安全防护任务上的表现,可与 Claude Fable 5 对照参考。

  7. Simon Willison82

    OpenAI 发布 GPT-5.6 系列:Luna、Terra、Sol

    OpenAI 正式发布 GPT-5.6 系列三款模型 Luna、Terra、Sol,按每百万输入/输出 token 计价分别为 1/6、2.5/15、5/30 美元,三者均为 2026 年 2 月 16 日知识截止、100 万 token 上下文窗口与 12.8 万最大输出 token。

    推荐理由:原文给出三档定价并与 Claude 对标,读者可看到双方在智能体与编码基准上的互有胜负。

  8. 赛博禅心 · 微信公众号80

    OpenAI 发布 GPT-5.6 三款模型与 ChatGPT Work

    OpenAI 发布 GPT-5.6,包含 Sol、Terra、Luna 三款模型,并推出对标 Claude Work 的 ChatGPT Work。旗舰款 Sol 在 Agents' Last Exam 测试的 55 个行业长程工作流上得分 53.6,比 Claude Fable 5 高 13.1 分。

    推荐理由:原文梳理了 GPT-5.6 三款模型的分档与命名规则,读者可以据此了解这次发布的产品结构与能力分层。

7月9日周四
  1. Google Research61

    Google Research 发布可穿戴健康基础模型 SensorFM,基于超一万亿分钟传感器数据预训练

    Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。

    推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。

  2. InfoQ · 微信公众号83

    Claude Code 用 11 天把 Bun 的 53 万行 Zig 代码重写为 Rust

    Bun 项目于 2026 年 5 月借助 Claude Code,用 11 天完成从 Zig 到 Rust 的代码迁移,涉及超 100 万行代码变更、6778 次提交和约 50 个动态工作流。

    推荐理由:Bun 借助 Claude Code 在 11 天内把 53 万行 Zig 重写为 Rust,文中给出多工作流协作方式与 16.5 万美元成本账,可供评估 AI 大规模重构的现实边界。

7月7日周二
  1. Hugging Face Blog61

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六大仿真基准

    Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。

    推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。

7月6日周一
  1. Claude Blog63

    Claude Fable 5 使用指南:如何发现自己未考虑到的信息

    Anthropic 技术人员 Thariq Shihipar 发布 Claude Fable 5 使用指南,提出用提示词让 Claude 帮自己发现未考虑到的信息。文章把未知信息分为已知的已知、已知的未知、未知的已知和未知的未知四类,并给出 blind spot pass、头脑风暴与原型、访谈、代码参考、实施计划、实施笔记、讲解文档和测验等模式及对应示例提示词。

    推荐理由:作者把发现未考虑到的信息拆成一套可复用的提示词模式,读者能直接照着改善与 Claude 的协作。