跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 101–116 条 · 共 116 条
5月5日周二
  1. OpenAI News65

    OpenAI 将 GPT-5.5 Instant 更新为 ChatGPT 默认模型

    OpenAI 将 GPT-5.5 Instant 更新为 ChatGPT 的默认模型,称其回答更智能、更准确,并减少了幻觉。该版本同时改进了个性化控制。

    推荐理由:ChatGPT 默认模型换为 GPT-5.5 Instant,读者可据此了解回答准确度、幻觉与个性化控制的调整方向。

  2. OpenAI News75

    OpenAI 发布 GPT-5.5 Instant 系统卡

    OpenAI 发布 GPT-5.5 Instant 系统卡,说明这款最新 Instant 模型沿用系列安全缓解方案。这是首款在网络安全与生物化学预备类别中被按高能力模型处理并实施相应保障的 Instant 模型,基线对比对象为 GPT-5.3 Instant。卡片还注明不存在 GPT-5.4 Instant,并把 GPT-5.5 称为 GPT-5.5 Thinking 以避免混淆。

    推荐理由:系统卡交代 GPT-5.5 Instant 沿用系列安全缓解方案,并首次把 Instant 模型在网络安全与生物化学预备类别按高能力处理。

5月4日周一
5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月30日周四
4月29日周三
  1. 微信公众号(Mp2RSS 合集)78

    GitHub Copilot 转向按量计费、Claude Code 限制 Opus,AI 写代码成本逼近程序员工资

    GitHub 宣布自 2026 年 6 月 1 日起 Copilot 从按请求计费转为基于 GitHub AI Credits 的按使用量计费,Opus 4.7 倍率将从 7.5 倍升至 27 倍;Anthropic 同期限制 Claude Code 中 Opus 模型,Pro 用户需额外付费。

    推荐理由:原文梳理 Copilot 与 Claude Code 转向按量计费的细节,并引入 token 成本与程序员工资的比较框架。

4月28日周二
4月27日周一
  1. OpenAI News69

    OpenAI 与 Microsoft 宣布修订合作协议

    OpenAI 与 Microsoft 宣布一项修订协议,简化了双方的合作关系,增加长期确定性,并支持继续推进大规模 AI 创新。原文未给出条款细节。

    推荐理由:协议修订简化了双方的合作框架并增加长期确定性,可作为观察两家公司合作走向的节点。

4月23日周四
  1. OpenAI News79

    OpenAI 发布 GPT-5.5 系统卡

    OpenAI 发布 GPT-5.5 系统卡,介绍该模型面向写代码、在线研究、分析信息、创建文档与表格等复杂实际工作,并能跨工具完成任务。系统卡披露了预部署安全评估和 Preparedness Framework 下的针对性红队测试,覆盖高级网络安全与生物能力,并在发布前收集了近 200 家早期访问伙伴的反馈。

    推荐理由:系统卡列出 GPT-5.5 的预部署安全评估、针对性红队测试和近 200 家早期访问伙伴的反馈,读者可据此了解其发布前的安全审查流程。

4月22日周三
  1. OpenAI News72

    OpenAI 在 ChatGPT 中推出工作区智能体

    OpenAI 在 ChatGPT 中推出工作区智能体,这类智能体由 Codex 驱动,可自动化复杂工作流。它们运行在云端,帮助团队跨工具安全地扩展工作。

    推荐理由:官方说明了工作区智能体由 Codex 驱动并在云端运行,读者可据此判断它与现有团队工作流的衔接方式。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

5月1日周四
  1. AI as Normal Technology67

    Sayash Kapoor 撰文论证 AGI 不是里程碑

    Sayash Kapoor 撰文提出 AGI 不是里程碑,公司宣布实现 AGI 不是可操作事件,对商业、政策或安全都没有直接含义。文章以核武器为反类比,认为 AI 的经济影响依赖以十年计的扩散过程,并批评基于影响、内部机制和基准行为的三类 AGI 定义各有缺陷,建议企业和政策制定者关注安全扩散而非 AGI 宣言。

    推荐理由:作者区分能力与权力、以扩散视角解释 AGI 为何不是可操作事件,为评估各方 AGI 宣言提供了一个可用的分析框架。

12月19日周四
  1. AI as Normal Technology69

    AI 进步是否在放缓:Arvind Narayanan 等人解析模型扩展与推理扩展之争

    Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。

    推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。