Factory 推出 Automated QA 技能,像真实用户一样驱动应用并在 PR 中输出测试报告
Factory 发布 Automated QA 技能,由 Droid 像真实用户一样驱动应用填写表单、操作终端、调用 API,并在每个 PR 上以单条可更新评论发布带截图、终端快照和 API trace 的结构化报告。
媒体报道、公司博客与研究文章
Factory 发布 Automated QA 技能,由 Droid 像真实用户一样驱动应用填写表单、操作终端、调用 API,并在每个 PR 上以单条可更新评论发布带截图、终端快照和 API trace 的结构化报告。
OpenAI 发起 GPT-5.5 Bio Bug Bounty 红队挑战,面向生物安全风险征集通用越狱方法,奖励最高 25,000 美元。
Google 宣布在 Google Photos 的 Auto frame 功能中推出新的拍照后视角调整方法,通过 ML 模型理解场景空间布局并用生成式 AI 从新视角重构成像。
推荐理由:原文解释了两阶段 3D 场景重建加生成补全的技术路线,读者可以了解它与传统裁剪编辑的本质差别。
Replit 发布 Auto-Protect,新关键 CVE 披露时自动比对项目依赖,匹配后由 Replit Agent 自动准备并测试补丁,通过邮件发送链接供用户应用。应用后补丁合并到 preview 环境主分支,用户需重新发布应用;管理员可在 Account > Advanced 中按严重级别开启该功能,首发默认关闭。
Anthropic 宣布 Claude 连接器扩展至生活场景,新增 AllTrails、Audible、Booking.com、Instacart、Intuit TurboTax、Spotify、Uber 等 15 款应用,目录自 2025 年 7 月上线以来已超过 200 个连接器。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Claude Managed Agents 的记忆功能现已进入公开测试,使用标准的 managed-agents-2026-04-01 header 即可调用。完整集成指南见 Using agent memory 文档。
OpenAI 将 ChatGPT for Clinicians 向通过验证的美国医生、执业护士和药剂师免费开放,用于支持临床诊疗、文书记录与研究工作。
Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。
推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。
OpenRouter 发布 Workspaces,可把项目拆分为独立环境,每个工作区拥有各自的 API keys、路由默认值、Guardrails 和可观测性配置。
推荐理由:原文列出工作区的独立配置项与账户级共享边界,读者可据此判断多项目与多团队场景下的权限划分方式。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
OpenAI 发布教程,介绍如何在 ChatGPT 中构建并使用 workspace agents。教程面向自动化重复性工作流、连接工具以及简化团队日常运营这几个场景。
OpenAI 在 ChatGPT 中推出工作区智能体,这类智能体由 Codex 驱动,可自动化复杂工作流。它们运行在云端,帮助团队跨工具安全地扩展工作。
推荐理由:官方说明了工作区智能体由 Codex 驱动并在云端运行,读者可据此判断它与现有团队工作流的衔接方式。
OpenAI 详解 Codex 智能体循环,通过 WebSockets 与连接级缓存降低 API 开销并改善模型延迟。
Qwen 团队继 Qwen3.6-Plus 和 Qwen3.6-35B-A3B 后开源 Qwen3.6-27B,这是一个 270 亿参数的稠密多模态模型。模型延续多模态思考与非思考双模式,官方称其智能体编码性能达到旗舰级,超过上一代开源旗舰 Qwen3.5-397B。
Factory 开放 Droid Computers 访问,提供云端托管和 BYOM 两种方式,让 Droid 在持久环境中保留文件系统、配置、凭证和进程记忆,跨会话继续工作。托管的机器空闲时暂停、仅在唤醒时计费;BYOM 对所有用户免费,Managed Computers 面向 Max、Growth 和 Enterprise 计划开放。
推荐理由:原文给出持久化环境与临时沙箱的对比理由,以及 BYOM 免费和按唤醒计费等可用细节,可帮助判断工作流取舍。
Anthropic 发文对比连接 Agent 与外部系统的三种路径:直接 API 调用、CLI 和 MCP,指出生产级云端 Agent 倾向采用 MCP 作为通用层。
推荐理由:Anthropic 梳理了直连 API、CLI 与 MCP 三种接入路径的取舍,并给出服务端设计与客户端上下文优化的具体模式。
OpenAI 发布开放权重模型 Privacy Filter,用于检测并脱敏文本中的个人身份信息(PII),官方称其准确率为当前最优水平。该模型以开放权重形式提供。
Google Cloud 将 Replit 评为 2026 年度 AI 工具合作伙伴,该奖项授予借助 AI 帮助客户在 Google Cloud 上取得成功的合作伙伴。
Replit 发布 Security Agent,可在不到一小时内完成应用的综合安全审查。它基于可定制的威胁建模计划审查整个代码库,结合 Semgrep 和 HoundDog.ai 提升 findings 准确度,扫描会映射架构、构建威胁模型、分析路由和 API,检查 SQL 注入、跨站脚本和请求伪造等漏洞并验证是否在生产环境可利用,大项目深度审计最长 15 分钟。
推荐理由:原文给出扫描入口、工作流程和具体漏洞类型,读者可以据此评估把安全审计并入 Replit 开发流程的成本与收益。
Google Research 在 ICLR 论文中提出 Agent 记忆框架 ReasoningBank,从成功和失败经验中蒸馏可迁移的推理记忆用于测试时自进化,代码已在 GitHub 开放。
Gemini API 将 gemini-embedding-2 转为正式可用(GA)。该嵌入模型此前处于预览阶段,现已面向所有开发者开放,具体用法可查阅官方 Embeddings 页面。
LlamaIndex 与 Kaggle 合作推出文档 OCR 排行榜 ParseBench,面向企业场景的文档解析模型与智能体评测。
LlamaIndex 讲解其开源工具 LiteParse 的核心网格投影算法如何把 PDF 坐标数据重建为保留布局的纯文本。算法从重复 X 坐标提取左、右、中对齐锚点,对文本项做吸附分类后投影到等宽字符网格,并用 forward anchor 在行间传播列位置;对流动段落则退回简单拼接。
推荐理由:作者以第一手视角拆解自研算法的设计取舍,读者可以了解坐标如何重建出保留结构的纯文本。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并可直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
OpenAI 发布 ChatGPT Images 2.0,在文本渲染、多语言支持和视觉推理上做了改进。文中提到这一 2026 年发布的产品还指向 Images 2.5 的新变化。
QIMMA 是一个质量优先的阿拉伯语 LLM 排行榜,在评测模型前先对基准样本做多阶段质量校验,整合 14 个来源基准的 109 个子集、超过 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与编码 7 个领域,其中 99% 为原生阿拉伯语内容。
Replit 详解其 Vibe Coding 平台的纵深防御安全架构:每个用户开发环境运行在基于 Linux 容器(seccomp-bpf 加固)的隔离沙箱中,并正将容器基础设施替换为无共享内核的 microVM。
OpenAI 推出 Codex Labs,由 OpenAI 专家进驻企业,通过实操工作坊帮助团队把 Codex 接入现有工作流并实现可复制的部署。Codex 周活开发者已从 3 月的 300 多万增至 400 多万,Virgin Atlantic、Ramp、Notion、Cisco、Rakuten 等企业已将其用于测试覆盖、代码审查、功能开发和事件响应。
Hugging Face 发文讨论 AI 网络安全的走向,主张开放生态能让防御方获得攻击方同类的漏洞发现与修补能力。文章以 Mythos 和 Project Glasswing 为例,指出真正起作用的是模型所处的系统而非模型本身,并建议用半自主智能体配合开源安全工具,在机构内部署可审计的防御方案。
Together AI 发布多租户 GPU 集群设计指南,提出共享基础设施加租户隔离的两层架构,通过统一 GPU 资源池、专属节点与凭证、按租户计费来兼顾利用率与隔离性。平台需在调度器层面按 GPU 数量、总花费或预留时长设置硬配额,支持提前预订与冲突检测,并允许超额时自动溢出到按需公共费率。配置应在预订时按需指定编排层、CUDA 驱动版本、共享内存与存储卷,避免强制默认值。
Gemini API 发布两个 Deep Research agent 新版本,新增协作规划、可视化支持、MCP server 集成和 File Search。deep-research-preview-04-2026 主打速度和效率,适合流式回传客户端 UI;deep-research-max-preview-04-2026 为自动化上下文收集与综合提供最大全面性。
Sierra 开源 μ-Bench,包含来自 250 通真实客服电话的 4,270 条人工标注语音,覆盖英语、西班牙语、土耳其语、越南语和普通话,评测 Deepgram Nova-3、Google Chirp-3、Azure Speech、ElevenLabs Scribe v2 和 OpenAI GPT-4o Mini Transcribe。
LlamaIndex 推出 ParseBench,称其为首个面向 AI 智能体的文档 OCR 基准,覆盖图表、表格、内容忠实度等指标,含 167K+ 条规则化测试。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维隐空间失效模式等问题,使基于梯度的长时程规划更稳健。
Anthropic 公布首届 Built with Opus 4.6 Claude Code 黑客松五位获奖者,其中四位并非职业开发者,项目覆盖住房、医疗、基础设施、音乐与教育。冠军 CrossBeam 由人身伤害律师 Mike Brown 打造,用并行子智能体解析建筑图纸与整改函,20 分钟生成加州许可审批行动计划。
Hyatt 在全球员工范围内部署 ChatGPT Enterprise,使用 GPT-5.4 和 Codex 提升生产力、运营效率与宾客体验。OpenAI 为此次落地提供支持。
Anthropic 与 Amazon 签署新协议,将获得最高 5 吉瓦(GW)用于训练和部署 Claude 的算力,并在未来十年向 AWS 技术投入超过 1000 亿美元。
推荐理由:协议披露了算力规模、芯片代际与投资金额,可据此判断 Claude 训练与推理基础设施的扩张节奏。
Anthropic 已退役 Claude Haiku 3(claude-3-haiku-20240307),所有对该模型的请求现在都会返回错误。官方建议用户升级至 Claude Haiku 4.5。
千问发布下一代闭源模型 Qwen3.6-Max-Preview 预览版,相比 Qwen3.6-Plus 带来更强的世界知识与指令遵循能力,并在多项 benchmark 上实现智能体编程的显著提升。该模型仍处于积极开发中,官方表示将持续迭代。