跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

当前仅显示精选新闻

最新精选

第 701–720 条 · 共 727 条
5月7日周四
5月5日周二
  1. OpenAI News75

    OpenAI 发布 GPT-5.5 Instant 系统卡

    OpenAI 发布 GPT-5.5 Instant 系统卡,说明这款最新 Instant 模型沿用系列安全缓解方案。这是首款在网络安全与生物化学预备类别中被按高能力模型处理并实施相应保障的 Instant 模型,基线对比对象为 GPT-5.3 Instant。卡片还注明不存在 GPT-5.4 Instant,并把 GPT-5.5 称为 GPT-5.5 Thinking 以避免混淆。

    推荐理由:系统卡交代 GPT-5.5 Instant 沿用系列安全缓解方案,并首次把 Instant 模型在网络安全与生物化学预备类别按高能力处理。

5月4日周一
5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月30日周四
  1. OpenClaw Blog65

    OpenClaw 创始人复盘项目公开加固安全的历程

    OpenClaw 创始人撰文复盘项目如何在公开环境下变得安全:截至 4 月 30 日 GitHub 显示自 1 月 10 日以来共 1,309 份安全通告,其中 535 份发布、746 份判定无效,109 份 critical 报告中 95 份无效。

    推荐理由:创始人复盘 OpenClaw 在公开安全报告压力下的加固过程,给出信任模型、插件化缩小攻击面和多用户威胁的处理思路。

4月29日周三
  1. AI前线 · 微信公众号78

    GitHub Copilot 转向按量计费、Claude Code 限制 Opus,AI 写代码成本逼近程序员工资

    GitHub 宣布自 2026 年 6 月 1 日起 Copilot 从按请求计费转为基于 GitHub AI Credits 的按使用量计费,Opus 4.7 倍率将从 7.5 倍升至 27 倍;Anthropic 同期限制 Claude Code 中 Opus 模型,Pro 用户需额外付费。

    推荐理由:原文梳理 Copilot 与 Claude Code 转向按量计费的细节,并引入 token 成本与程序员工资的比较框架。

4月28日周二
4月27日周一
4月23日周四
  1. OpenAI News79

    OpenAI 发布 GPT-5.5 系统卡

    OpenAI 发布 GPT-5.5 系统卡,介绍该模型面向写代码、在线研究、分析信息、创建文档与表格等复杂实际工作,并能跨工具完成任务。系统卡披露了预部署安全评估和 Preparedness Framework 下的针对性红队测试,覆盖高级网络安全与生物能力,并在发布前收集了近 200 家早期访问伙伴的反馈。

    推荐理由:系统卡列出 GPT-5.5 的预部署安全评估、针对性红队测试和近 200 家早期访问伙伴的反馈,读者可据此了解其发布前的安全审查流程。

4月22日周三
4月11日周六
  1. Sam Altman Blog66

    Sam Altman 发文回应住宅遭燃烧瓶袭击并阐述 AI 信念

    Sam Altman 称凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他发文希望劝阻下一个袭击者。文中他阐述了对 AI 的信念,包括 AI 需要民主化、权力不能过度集中、安全不只是模型对齐还需全社会应对,并反思了自己与 OpenAI 董事会冲突中的错误,认为行业乱象源于"想控制 AGI"的心态,出路是广泛分享技术且无人独占。

    推荐理由:Sam Altman 在自家中弹燃烧瓶事件后亲述个人信念与反思,是理解其 AI 治理立场与行业判断的一手材料。

4月1日周三
  1. Factory 研究 / 产品61

    Factory 发布 Legacy-Bench 基准,检验 AI 智能体维护遗留软件的能力

    Factory 发布 Legacy-Bench 基准,用涵盖 COBOL(46%)、Java 7(32%)等六类遗留语言的数百个任务测试 AI 智能体,12 个模型-智能体组合的通过率为 16.9% 至 42.5%,而这些模型在 SWE-bench Verified 等现代基准上得分超过 70%。

    推荐理由:原文用真实遗留代码任务填补现有基准的盲区,给出各模型在 COBOL 等语言上的具体分数和失败模式,可帮助读者评估 AI 智能体处理关键遗留系统的实际能力。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

1月21日周三
  1. PromptArmor:Threat Intelligence77

    PromptArmor 披露 OpenAI API 日志未修复的数据外泄漏洞

    PromptArmor 披露 OpenAI Platform 的 responses 和 conversations API 日志因不安全渲染 Markdown 图片,可导致使用该平台的应用和智能体数据外泄,即使应用自身已屏蔽恶意 Markdown 图片也会中招。

    推荐理由:原文完整披露攻击链和修复进展,开发者可借此检查自己应用的日志查看风险。