实录 OpenAI 年度发布会:25 项发布,逐一详解
📋 文章概况
OpenAI 2026 DevDay 发布会实录,逐项梳理 25 项发布,覆盖个人 Agent(Dots)、协作空间(ChatGPT Space)、新模型(GPT-6.1 Sol、Ultrafast 档)、开发者平台(Agents API、Codex Harness 开源、Codex 上云)、分发与商业化(ChatGPT 登录、插件扩展、Marketplace)五大板块。
💎 独特亮点
- Dots 的"主动研究"机制有明确安全边界:Dot 在用户未使用时后台找活干,但只能用已连接应用的只读工具,不能发消息、不能改内容;密码不暴露给模型,用户可随时打开 Dot 的云端电脑查看它在做什么。这套"后台自主 + 只读约束 + 可观测"的组合是可直接借鉴的 Agent 产品安全设计。
- GPT-6.1 Sol 的性价比数据点密集且可对标:以 Astra 五分之一的价格追平 DeepSWE 1.1 长程软件工程成绩,比 GPT-6 Sol 高 6.4 个百分点;Terminal-Bench Science 单任务成本 $5.47 vs Astra $23.80(降 75%+);事实错误率从 11.4% 降到 7.7%(低推理档降 32%)。缓存输入 $0.10/百万 token,比标准输入便宜 95%。
- Decisions API 把"做选择"从"生成"中拆出来:给 Luna 模型预设选项让它挑,零点几秒内返回,用于内容分类、请求路由、agent 下一步决策,保留看图和多语言能力。这是"用约束换速度"的工程思路,对需要低延迟决策的 Agent 场景有直接参考价值。
- Codex Harness 开源 + Agents API 把 harness 和运行环境解耦:harness 由 OpenAI 托管维护,agent 跑在哪台"电脑"上由开发者选(OpenAI 沙箱、自有基础设施、或 Blaxel/Cloudflare/Daytona/E2B 等 9 家沙箱合作方)。这验证了"Harness 层与执行环境分离"的架构方向。
🔭 产品方向洞察
- Dots:一直在线、有形象和身份的个人 Agent,住在 ChatGPT 里,有自己的云端电脑和浏览器,可跨 Slack/Teams/电话/短信/桌面/手机多端携带同一份上下文,按用户授权的权限主动做事,重要事项先请示再动手。套餐内第一个 Dot 不另收费。
- Specialist dots:企业统一配置的岗位型虚拟同事(会计、营销、法务、工单处理),有自己的身份、凭证和系统权限,产出经人审核,改进在全公司共享;与微软合作接入 Agent 365。
- ChatGPT Space:人和 Dots 一起协作的"活"空间,核心是 Pages(动态页面)文档类型,支持在页面里 @ Dot 接手任务、设长期指令让 ChatGPT 自动更新内容;协作式幻灯片几周内上线。
- Codex Security Cloud:云上持续扫描 GitHub 仓库找漏洞,自动去重、准备验证过的修复等审核,合上笔记本也照跑;含 Daybreak Blue 模型,不需另外申请。
- OpenAI Marketplace:企业用已承诺的 OpenAI 消费预算买 32 家合作伙伴的软件(Adobe、Figma、Sierra、Harvey、CrowdStrike 等),免去逐供应商立项采购。
- [产品] "用 ChatGPT 登录":用户在 16 个合作方产品(Devin、Notion、Vercel、Lovable、Warp 等)里直接用自己 ChatGPT 套餐的 token 额度,开发者不用替用户垫付 token 成本;用户可控制每个合作方的额度上限。
🔧 可动手实践
| 目录点 | 你可以做什么 | 可动手程度 |
|---|---|---|
| Decisions API 的"预设选项"模式 | 在你自己的 Agent 里实现类似机制:对需要快速决策的环节(内容分类、路由、下一步动作选择),把模型输出空间约束到预设选项集,用结构化输出 + 低延迟模型换取响应速度 | ✅可实现 |
| Dots 的"主动研究"安全边界设计 | 为你的 Agent 产品设计后台自主模式时,采用"只读工具 + 禁止外发 + 可观测窗口"三层约束:后台任务只能用只读工具,不能发消息/改内容,用户可随时查看 Agent 的工作状态 | ✅可实现 |
| GPT-6.1 Sol 的性价比对标数据 | 在做模型选型时,将 DeepSWE 1.1(长程软件工程)、OSWorld 2.0(电脑操作)、Terminal-Bench Science(科研流程)的"成本-分数"数据点作为对标基准,评估你当前主力模型在同等任务上的单位成本 | ✅可实现 |
| Codex Harness 开源 | 下载研究 Codex Harness 的架构设计(harness 与运行环境解耦、多 agent 控制、上下文压缩、工具搜索),对照你自己的 Agent 框架找可借鉴的模块划分和接口设计 | ✅可实现 |
| [产品] Dots 的"职责委托"产品形态 | 用 AI coding 快速搭一个 MVP 验证"个人 Agent 助手"假设:一个有身份的小角色,连接用户的常用工具(日历、邮件、Slack),按用户授权的权限主动处理低价值重复任务,重要事项先请示 | ⚠️需补充(需判断目标用户群和差异化切入点,Dots 本身依赖 GPT-6 Astra 级别的模型能力) |
工作流(最小实验):
- 选一个你当前 Agent 中"模型生成慢但决策空间有限"的环节(如:判断用户输入属于哪类意图、决定下一步调用哪个工具)。
- 将该环节的输出从自由文本生成改为"预设选项 + 结构化输出":定义 5-10 个候选选项,让模型只返回选项 ID。
- 用你当前的主力模型测试:对比自由生成 vs 预设选项两种模式下的响应延迟和准确率。
- 如果延迟改善显著且准确率可接受,将该模式固化为你 Agent 的"快速决策层",复杂生成仍走完整推理路径。
🧠 可复用认知
- Agent 产品的"主动自主"需要以"可观测 + 可约束"为前提:Dots 的后台主动研究之所以能被信任,是因为它同时具备只读工具约束、禁止外发限制、以及用户可随时打开云端电脑查看的能力。自主性不是二元的,而是可以在"能做什么、不能做什么、用户能否看到"三个维度上精细调节。
- 模型性价比的竞争正在从"绝对能力"转向"单位成本下的能力":GPT-6.1 Sol 以五分之一价格追平 Astra 的长程工程成绩,说明在 Agent 场景中,模型选型的核心指标是"每成功任务成本"而非单纯的 benchmark 分数。
- "用约束换速度"是低延迟 Agent 决策的有效工程手段:Decisions API 通过把输出空间压缩到预设选项,将响应时间从秒级压到零点几秒。当任务本身是"从有限集合中做选择"时,不需要完整的生成能力。
🏷️ 关键词
#Dots #ChatGPT-Space #GPT-6.1-Sol #Ultrafast #Decisions-API #Agents-API #Codex-Harness #主动研究 #只读工具约束 #每成功任务成本 #预设选项决策 #harness与运行环境解耦 #Codex上云 #OpenAI-Marketplace
分类标签: Agent架构 Agent产品设计 模型选型
📊 价值判断
推荐等级: 值得一看(信息增量强——Dots 的主动研究安全边界、GPT-6.1 Sol 的性价比数据、Decisions API 的约束换速度思路都是新信息;但摘要已承载核心数据点和机制描述,原文的额外价值主要在演示细节和产品形态的完整呈现,对需要做产品决策或模型选型的读者有实质参考)
最值得看: Dots 的官方介绍细节(主动研究的只读约束、密码处理、云端电脑可观测性);GPT-6.1 Sol 的六组评测数据(DeepSWE、OSWorld 2.0、Terminal-Bench Science 的成本-分数对比);Decisions API 的现场演示段落
适合场景: 你在设计个人 Agent 产品的自主性和安全边界;或你在做模型选型需要最新的性价比对标数据;或你想了解 OpenAI 对 Agent 平台化(harness 开源、运行环境解耦、分发渠道)的完整布局