ChatGPT Codex 上手指南:如何设置项目、创建线程并完成首个任务
OpenAI 发布 ChatGPT Codex 入门指南,介绍如何设置项目、创建线程并完成首个任务,提供分步操作指引。
媒体报道、公司博客与研究文章
OpenAI 发布 ChatGPT Codex 入门指南,介绍如何设置项目、创建线程并完成首个任务,提供分步操作指引。
OpenAI 发布 Codex 设置指南,介绍如何配置个性化、细节层级和权限,让任务运行更顺畅并自定义工作流。
OpenAI 发布 ChatGPT Codex 使用指南,介绍如何设置工作区、创建线程与项目、管理文件,并按步骤完成任务。内容覆盖从初始配置到实际执行任务的完整流程。
OpenAI 的 ChatGPT Codex 自动化教程介绍如何用日程和触发器自动生成报告、摘要和周期任务,无需手动操作。教程面向重复工作流的自动执行,通过日程和触发器减少人工介入。
OpenAI 分享 ChatGPT Work 的实用工作流,覆盖重复性任务、进度更新、调研、规划与团队运营等场景。内容面向日常办公,帮助用户把这些环节交给 ChatGPT Work 处理。
Sierra 宣布收购总部位于巴黎的 Fragment,后者利用 AI 帮助企业扩展运营、让员工专注于更高价值工作。Fragment 联合创始人 Olivier Moindrot 和 Guillaume Genthial 将加入 Sierra,增强其在法国的智能体开发能力。
Hugging Face 发布指南,讲解如何在 Chrome 扩展(Manifest V3)中用 Transformers.js 运行本地模型,并复现其 Gemma 4 浏览器助手的核心架构。
推荐理由:用一个已上线的浏览器扩展拆解 MV3 下的分层架构,可供搭建本地模型扩展时参考分工与数据边界。
OpenAI 发起 GPT-5.5 Bio Bug Bounty 红队挑战,面向生物安全风险征集通用越狱方法,奖励最高 25,000 美元。
Google 宣布在 Google Photos 的 Auto frame 功能中推出新的拍照后视角调整方法,通过 ML 模型理解场景空间布局并用生成式 AI 从新视角重构成像。
推荐理由:原文解释了两阶段 3D 场景重建加生成补全的技术路线,读者可以了解它与传统裁剪编辑的本质差别。
Anthropic 宣布 Claude 连接器扩展至生活场景,新增 AllTrails、Audible、Booking.com、Instacart、Intuit TurboTax、Spotify、Uber 等 15 款应用,目录自 2025 年 7 月上线以来已超过 200 个连接器。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Claude Managed Agents 的记忆功能现已进入公开测试,使用标准的 managed-agents-2026-04-01 header 即可调用。完整集成指南见 Using agent memory 文档。
OpenAI 将 ChatGPT for Clinicians 向通过验证的美国医生、执业护士和药剂师免费开放,用于支持临床诊疗、文书记录与研究工作。
Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。
推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。
OpenRouter 发布 Workspaces,可把项目拆分为独立环境,每个工作区拥有各自的 API keys、路由默认值、Guardrails 和可观测性配置。
推荐理由:原文列出工作区的独立配置项与账户级共享边界,读者可据此判断多项目与多团队场景下的权限划分方式。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
OpenAI 发布教程,介绍如何在 ChatGPT 中构建并使用 workspace agents。教程面向自动化重复性工作流、连接工具以及简化团队日常运营这几个场景。
OpenAI 在 ChatGPT 中推出工作区智能体,这类智能体由 Codex 驱动,可自动化复杂工作流。它们运行在云端,帮助团队跨工具安全地扩展工作。
推荐理由:官方说明了工作区智能体由 Codex 驱动并在云端运行,读者可据此判断它与现有团队工作流的衔接方式。
OpenAI 详解 Codex 智能体循环,通过 WebSockets 与连接级缓存降低 API 开销并改善模型延迟。
Anthropic 发文对比连接 Agent 与外部系统的三种路径:直接 API 调用、CLI 和 MCP,指出生产级云端 Agent 倾向采用 MCP 作为通用层。
推荐理由:Anthropic 梳理了直连 API、CLI 与 MCP 三种接入路径的取舍,并给出服务端设计与客户端上下文优化的具体模式。
OpenAI 发布开放权重模型 Privacy Filter,用于检测并脱敏文本中的个人身份信息(PII),官方称其准确率为当前最优水平。该模型以开放权重形式提供。
Google Research 在 ICLR 论文中提出 Agent 记忆框架 ReasoningBank,从成功和失败经验中蒸馏可迁移的推理记忆用于测试时自进化,代码已在 GitHub 开放。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并可直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
OpenAI 发布 ChatGPT Images 2.0,在文本渲染、多语言支持和视觉推理上做了改进。文中提到这一 2026 年发布的产品还指向 Images 2.5 的新变化。
QIMMA 是一个质量优先的阿拉伯语 LLM 排行榜,在评测模型前先对基准样本做多阶段质量校验,整合 14 个来源基准的 109 个子集、超过 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与编码 7 个领域,其中 99% 为原生阿拉伯语内容。
OpenAI 推出 Codex Labs,由 OpenAI 专家进驻企业,通过实操工作坊帮助团队把 Codex 接入现有工作流并实现可复制的部署。Codex 周活开发者已从 3 月的 300 多万增至 400 多万,Virgin Atlantic、Ramp、Notion、Cisco、Rakuten 等企业已将其用于测试覆盖、代码审查、功能开发和事件响应。
Hugging Face 发文讨论 AI 网络安全的走向,主张开放生态能让防御方获得攻击方同类的漏洞发现与修补能力。文章以 Mythos 和 Project Glasswing 为例,指出真正起作用的是模型所处的系统而非模型本身,并建议用半自主智能体配合开源安全工具,在机构内部署可审计的防御方案。
Sierra 开源 μ-Bench,包含来自 250 通真实客服电话的 4,270 条人工标注语音,覆盖英语、西班牙语、土耳其语、越南语和普通话,评测 Deepgram Nova-3、Google Chirp-3、Azure Speech、ElevenLabs Scribe v2 和 OpenAI GPT-4o Mini Transcribe。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维隐空间失效模式等问题,使基于梯度的长时程规划更稳健。
Anthropic 公布首届 Built with Opus 4.6 Claude Code 黑客松五位获奖者,其中四位并非职业开发者,项目覆盖住房、医疗、基础设施、音乐与教育。冠军 CrossBeam 由人身伤害律师 Mike Brown 打造,用并行子智能体解析建筑图纸与整改函,20 分钟生成加州许可审批行动计划。
Hyatt 在全球员工范围内部署 ChatGPT Enterprise,使用 GPT-5.4 和 Codex 提升生产力、运营效率与宾客体验。OpenAI 为此次落地提供支持。
Anthropic 与 Amazon 签署新协议,将获得最高 5 吉瓦(GW)用于训练和部署 Claude 的算力,并在未来十年向 AWS 技术投入超过 1000 亿美元。
推荐理由:协议披露了算力规模、芯片代际与投资金额,可据此判断 Claude 训练与推理基础设施的扩张节奏。
Anthropic 已退役 Claude Haiku 3(claude-3-haiku-20240307),所有对该模型的请求现在都会返回错误。官方建议用户升级至 Claude Haiku 4.5。
针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。
Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。
推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。
Google 提出推理优先的合成数据框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,从第一性原理构建数据集,无需种子数据。
Google Research 提出 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 重建模型的训练数据,在预留小鼠轴突上把重建误差降低 4.4%,主要来自合并错误的减少。该结果相当于在完整小鼠脑规模下节省 157 人年的手动校对工作,是生成式 AI 首次用于改进连接组重建的当前最优方法。MoGen 已开源,相关论文将在 ICLR 2026 展示。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,改进可控性、表现力和质量,在 Artificial Analysis TTS 排行榜获得 1,211 Elo 分。
推荐理由:官方介绍新增 audio tags 和多说话人对话能力,还给出 AI Studio 导演式控制与 API 导出的具体用法,便于开发者评估接入。
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
Sierra 为旗下检索与重排模型 Linnaeus 和 Darwin 搭建了一套每日评估系统,从客户前一天的对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出"golden articles"作为基准,再以 recall、precision、nDCG 等指标对比智能体实际检索结果。