微信文章解读
‹ 返回列表

实录 OpenAI 年度发布会:25 项发布,逐一详解

值得一看
Agent架构 模型选型 toC Agent
访问原文

📋 文章概况

一篇 OpenAI 2026 DevDay 发布会的逐项实录,覆盖 25 项发布:Dots(常驻个人 agent)、ChatGPT Space、GPT-6.1 Sol 与 Ultrafast 档、Decisions API、Codex 上云与 Harness 开源、Agents API 电脑操作、插件扩展、OpenAI Marketplace 及订阅档位调整。

💎 独特亮点

  • Dots 的"主动研究"机制有明确安全边界:Dot 在后台主动找活干时,只能用已连接应用的只读工具,不能发消息、不能改内容;密码不暴露给模型;默认与用户电脑隔离,需授权才能连上笔记本。这套"后台自主 + 只读约束"的组合是可直接借鉴的 agent 权限设计。
  • GPT-6.1 Sol 的性价比数据点密集且可对标:以 Astra 约 1/5 的价格追平或接近 Astra 在 DeepSWE 1.1、OSWorld 2.0、Terminal-Bench Science 上的表现;缓存输入 $0.10/百万 token,比标准输入便宜 95%;科研任务单任务成本 $5.47 vs Astra $23.80。这些是模型选型可直接引用的对标数据。
  • Decisions API 把"做选择"作为独立产品形态:给 Luna 一组预设选项,零点几秒内返回选择,用于内容分类、路由、agent 下一步决策。把模型能力收敛到"选择"上换速度,是一个反直觉的 API 设计思路。
  • Codex Harness 开源 + Agents API 把 harness 与运行环境解耦:harness 由 OpenAI 托管维护,agent 跑在哪台"电脑"上由开发者选(OpenAI 沙箱、自有基础设施、或 9 家沙箱合作方)。这验证了"Harness 层与运行环境解耦"的架构方向。

🔭 产品方向洞察

  • Dots:常驻个人 agent,住在 ChatGPT 里,有形象、有名字、有云端电脑和浏览器,7×24 主动处理任务,跨 ChatGPT/Slack/Teams/电话/短信多渠道带同一份上下文。Pro 和 Business Premium 开放,第一个 Dot 不另收费。
  • Specialist dots:企业统一配置的岗位型 Dots(会计、营销、法务),有自己的身份、凭证和系统权限,改进在全公司共享;与微软 Agent 365 集成。企业试点预览。
  • ChatGPT Space:人和 Dots 协作的空间,核心是 Pages(动态页面)——为人和 agent 共同编辑设计的新文档类型;协作式幻灯片几周内上线。
  • OpenAI Marketplace:企业用已承诺的 OpenAI 消费预算买 32 家合作伙伴的软件(Adobe、Figma、Sierra、Harvey、CrowdStrike 等),免去逐供应商立项采购。
  • [产品] "用 ChatGPT 登录":用户在 16 个合作方产品(Devin、Notion、Vercel、Lovable 等)里直接用自己 ChatGPT 套餐的 token 额度,开发者不用垫付 token 成本。这是 toC Agent 产品可借鉴的分发与获客模式。

🔧 可动手实践

目录点 你可以做什么 可动手程度
Dots 的权限与安全边界设计 在自己的 Agent 项目中借鉴"后台主动模式 = 只读工具 + 禁止外发/修改"的约束组合;为 agent 的主动行为设置独立的权限面,与用户显式触发的操作分开 ✅可实现
GPT-6.1 Sol 性价比对标 在模型选型时引用其价格与 benchmark 数据(DeepSWE 1.1、OSWorld 2.0、Terminal-Bench Science 0.1),评估是否可作为日常主力模型替代更高价档 ✅可实现
Decisions API 的"选择即产品"思路 在自己的 Agent 中识别"只需从有限选项中选择"的决策点(路由、分类、下一步动作),用轻量模型 + 预设选项替代完整生成,换取低延迟 ✅可实现
Codex Harness 开源 研究其 harness 架构(token 效率、多 agent 控制、compaction 机制),作为自己 Agent 框架设计的参考实现 ⚠️需补充(需自行评估开源代码质量与适配成本)
[产品] "用 ChatGPT 登录"的分发模式 评估自己的 toC Agent 产品是否可接入类似"用户自带订阅额度"的登录模式,降低用户试用门槛和自身 token 成本 ⚠️需补充(需判断自身产品与 OpenAI 生态的绑定风险)

工作流(最小实验):

  1. 列出你当前 Agent 中所有"后台自动执行"的行为点(定时任务、主动监控、自动处理)。
  2. 为每个行为点定义权限面:只读工具列表、禁止的操作(发消息、改内容、写文件)。
  3. 实现一个"主动研究"模式开关:开启后 agent 只能调用只读工具,产出建议而非直接执行。
  4. 跑一周,记录 agent 主动行为的价值(省了多少人工)与误报率(多少建议被用户否决),据此调整只读工具集。

🧠 可复用认知

  • Agent 的"主动性"与"安全性"不是对立的:通过为主动行为单独设置只读权限面,可以让 agent 在后台持续工作而不越界。主动模式的权限设计应独立于用户显式触发的操作。
  • 模型性价比的竞争正在从"绝对能力"转向"能力/成本比":GPT-6.1 Sol 以 1/5 价格追平 Astra 的信号表明,日常主力模型的选择应优先考虑性价比档位,而非最高能力档。
  • 把模型能力收敛到"做选择"可以换数量级的速度提升:Decisions API 的设计说明,很多 agent 决策点不需要完整生成,预设选项 + 快速选择足以覆盖,且能保留视觉、多语言和安全能力。

🏷️ 关键词

#Dots #主动研究 #只读权限 #GPT-6.1-Sol #Ultrafast #Decisions-API #Codex-Harness #Agents-API #ChatGPT-Space #Pages #Specialist-dots #用ChatGPT登录 #OpenAI-Marketplace #harness与运行环境解耦 #模型性价比

分类标签: Agent架构 模型选型 toC Agent

📊 价值判断

推荐等级: 值得一看(信息增量强——Dots 的权限设计、Decisions API 的产品思路、GPT-6.1 Sol 的性价比数据都是新事实;但深度/实现细节中等——发布会实录以产品发布为主,Dots 和 Agents API 的具体实现机制仅给出方向性描述,摘要已承载核心可操作信息;原文的额外价值主要在 benchmark 完整数据表和演示细节,对已读摘要的读者不构成实质判断改变)
最值得看: GPT-6.1 Sol 的六组 benchmark 评测段落(DeepSWE 1.1、OSWorld 2.0、Terminal-Bench Science 0.1 的完整数据);Dots 官方介绍中的权限与安全细节段落;Decisions API 的现场演示描述
适合场景: 你在做模型选型需要最新的性价比对标数据;或你在设计常驻型 Agent 产品需要参考权限边界与主动行为的设计模式;或你在评估 toC Agent 产品的分发与获客策略("用 ChatGPT 登录"模式)