OpenAI 据报解散其 preparedness 团队
据《金融时报》报道,OpenAI 已在 上月底 解散负责评估模型是否构成严重风险并制定缓解措施的 preparedness 团队。OpenAI 发言人 Kayla Wood 否认这一说法,称公司在网络安全、生物化学与 AI 自我提升能力等方向都有资深研究负责人,均向安全负责人 Saachi Jain 汇报。
媒体报道、公司博客与研究文章
据《金融时报》报道,OpenAI 已在 上月底 解散负责评估模型是否构成严重风险并制定缓解措施的 preparedness 团队。OpenAI 发言人 Kayla Wood 否认这一说法,称公司在网络安全、生物化学与 AI 自我提升能力等方向都有资深研究负责人,均向安全负责人 Saachi Jain 汇报。
Stripe 据报道将以 70 亿美元以上收购 AI 网关创业公司 OpenRouter。OpenRouter 的 CEO 此前曾把这家创业公司形容为 AI 领域的 Stripe。
Mark Zuckerberg 描绘的 AI 未来并未获得普遍认同。在最新一期 Equity 播客中,节目讨论了为什么并非所有人都接受他的这一愿景。
Anthropic 正处于 IPO 前的 SEC 静默期(预计秋季上市),Gary Marcus 拆解了静默期外流传的多项营收说法:路透报道称其预计 2028 年营收约 $190B-$200B。
Anthropic CEO Dario Amodei 反驳外界认为他在过度悲观描绘 AI 的看法,称当前的 AI 反弹“本质上是一场信任危机”。
SGLang 重构 CUDA Graph 支持,围绕统一的 runner/backend 接口让不同捕获策略可跨执行路径复用,并推出其原创的 Breakable CUDA Graph(BCG)服务技术。
LlamaIndex 用 Temporal 替换 RabbitMQ,支撑起每天数千万页文档的处理,并驱动其最新的 Batch API 发布。Temporal 作为持久化函数执行运行时,通过 Workflow、Activity 和 Worker 提供持久状态、公平性与并发控制,让失败任务可从断点重试。LlamaIndex 借此解决了旧队列系统在状态追踪、心跳重试和资源限流上的层层复杂度。
创作者 Makestreme 借助 Meta 开源的神经音频编解码器 EnCodec,把一首约 2 分钟、2.9MB 的 MP3 压缩至约 21KB,体积缩小 99.9%,再拆成 8 个二维码打印在纸张正反两面。
数学家 Timothy Gowers 和 Peter Sarnak 认为,大语言模型擅长组合已知方法,但缺乏产生真正全新数学思想的直觉。
奇瑞捷豹路虎 FREELANDER 神行者 8 在 48 小时内预售订单突破 1 万台,售价 33.99 万元起。该车全系标配华为乾崑智驾 ADS 5 与高通骁龙 8397 车规级芯片,标配 800V 高压平台,搭载 60.3kWh 宁德时代骁遥增混电池,CLTC 纯电续航 310km,20%-80% 充电最快 12 分钟。
斯坦福大学《AI Index 2026》报告显示,84% 的中国受访者对 AI 产品和服务感到兴奋,美国这一比例为 38%,爱德曼调查中两国受访者信任 AI 的比例分别为 72% 和 32%。
Anthropic 的 Dario Amodei 认为,公众对 AI 的负面看法根本上是一场信任危机,而非 AI 领袖警告风险所致,普通人本就不信任企业、政府和科技行业。他反对用光鲜的正面营销挽回信任,称"AI 能治愈癌症"已沦为陈词滥调,真正有效的是真的治愈癌症。他认为对 Anthropic 等 AI 公司最准确的批评是尚未兑现造福世界的承诺。
ChatGPT 的 macOS 桌面端应用上线名为 Computer History 的新功能,会把用户操作记录下来构建时间线,供 ChatGPT 和 Codex 在用户发起请求时参考,并据此学习用户工作方式、建议自动化操作,甚至接手未完成的任务。
DeepSeek 发布 V4 Pro 并开源 MIT 许可的智能体编程工具 DeepSeek Harness,明确对标 Anthropic 的 Claude Code,同时将 API 价格最高上调 11 倍。
中消协 8 月 5 日发布报告指出,AI 客服投诉显著增多,消费者反映的问题集中在 AI 客服不实承诺、人工客服接入困难、生成内容失准等方面。据北京卫视近期测试,记者拨打某短视频平台客服电话时,说出 4 次转人工后才开始转接,从拨打电话到接通人工客服用时近 6 分钟,部分平台还会通过循环应答、多层跳转阻碍进入人工服务。
Runway 上线 iPhone 和 Android 版应用,用户可随时随地进行创作。目前官方仅公布移动端可用性,未披露具体功能、模型版本或价格信息。
Runway 发布客户案例内容,并推广其 iPhone 与 Android 版应用,主打“随时随地进行创作”。原文未披露具体客户名称、使用场景或功能细节。
Sierra 博客新增工程(Engineering)栏目,并开放订阅,用于推送新产品功能与客户动态等更新。
Sierra 博客上线订阅功能,用户可订阅后获取新产品功能与客户动态等更新通知。
Sierra 在 Sierra Summit 2025 上发布 Agent Data Platform(ADP),为客服 AI 智能体提供跨会话、跨渠道、跨系统的记忆层与智能决策能力。
Sierra 博客上线研究栏目,并开放订阅,用于推送新产品功能与客户动态等信息。
Sierra 在首届客户大会 Sierra Summit 上发布 Agent OS 2.0,包含八款新产品,支持将智能体一键发布到 ChatGPT,并新增 Live Assist 实时辅助人工客服。
Sierra 博客上线订阅功能,用户可订阅以获取新产品功能、客户动态等更新通知。原文未披露更多细节。
Sierra 博客上线订阅功能,用户可订阅以获取新产品功能、客户动态等更新通知。
LangChain 宣布 Managed Deep Agents 进入公开测试,开发者可用 Python 或 TypeScript 编写 Deep Agent 并本地测试,再用 mda deploy 一条命令部署到 LangSmith 托管运行时。
推荐理由:原文列出托管运行时接管的持久化、沙箱与记忆等基础设施,并说明用户仍可控制的部分,便于判断是否把原型迁到生产。
LangChain 发布 ReviewBench,一个基于 LangSmith 单体仓库真实 PR 评审意见构建的代码审查智能体评测基准,目前包含 59 个任务、覆盖 64 个基线问题,采用 Harbor 任务格式并以 F1 为综合得分。在统一 Deep Agents 基础框架下,最强模型仅能找回约 30% 的基线问题;对 Luna 改用高推理强度与结构化评审提示词后,其表现出现变化。
LangChain 的 Deployed Engineer 介绍了其为 Kubernetes 部署构建的自主 SRE 智能体,目标是缩短故障排查与修复时间。
推荐理由:LangChain 公开了自建 SRE 智能体的架构取舍,读写分离与人工审批门的设计可迁移到其他生产运维场景。
LangChain 宣布 LangSmith LLM Gateway 进入公开测试,作为智能体与所调用模型之间的集中治理层,统一执行成本上限、速率限制、模型回退与敏感数据脱敏。
LangChain 发文区分其开源 Agent 栈的三层定位:LangGraph 是 Agent 运行时,LangChain 是 Agent 框架,Deep Agents 是开箱即用的 Agent harness,三者完全可组合、可跨层切换。
LangChain 用自家 145 个多步任务的 Deep Agents 评测套件测试 NVIDIA 开源路由库 Switchyard,只有 7% 的模型调用被送到 Claude Opus 4.8,其余 93% 由 30B 的 Nemotron 3.5 Lightning 处理。
推荐理由:用同一套 agent 评测套件对比单模型与路由方案,并给出判断是否值得上路由的成本公式。
LangChain 将数据栈从传统 BI 工具迁移到以 Hex 为核心的智能体优先架构,六周内 100% 完成迁移。其自助数据智能体目前处理的请求量约为 3 人数据团队直接承接量的 40 倍,近 30 天内近 100% 的已配置用户(占公司三分之一)使用过该智能体,期间约产生 2,200 次对话。用户可通过 Hex UI、Slack、CLI、MCP 和 LangSmith Fleet 等入口访问。
Stripe 基于 LangChain 开源的 Deep Agents 智能体框架搭建了公司级知识 AI 平台 Kai,面向全体员工提供数据分析、文档起草等能力。
Similarweb 在 LangSmith 中结合确定性检查与 LLM-as-a-judge,评估 Data Studio 智能体输出的长文研究报告。确定性检查验证工具调用与结构化输出,LLM 评审则依据 golden answer 或评分细则打分并给出评语,所有反馈与 trace 关联,可逐条下钻查看。团队还强调评估校准不当比没有评估更糟,并分享了踩坑一周的教训。
monday.com 重构了其 AI 助手 Sidekick,从单一通用智能体加不断膨胀的工具列表,转向由编排、权限感知上下文检索、专用子智能体和沙箱执行环境组成的分层架构。
LangSmith Bring Your Own Cloud(BYOC)现已在 AWS 正式可用,企业可在自己的 AWS 账户和 VPC 内运行托管版 LangSmith,traces、数据集、提示词、智能体部署等敏感数据保留在客户环境中,由 LangChain 负责监控、升级、扩缩容和集群生命周期管理。
LangChain 与 NVIDIA 发布 NemoClaw for LangChain Deep Agents 蓝图,把 LangChain Deep Agents Code、NVIDIA Nemotron 3 Ultra 和 NVIDIA OpenShell 运行时组合成开放的智能体栈,今日可用。
LangChain 发布 Deep Agents v0.7,通过删除底层基础系统提示词、裁剪 43% 内置工具描述并把 TodoListMiddleware 改为可选,默认智能体单轮的基础输入 token 减少 65%(约 6k 降至约 2k)。
推荐理由:发布给出了删减提示词后的 token 与成本对比数据,可用来判断精简 harness 对现有智能体工作流的影响。
LangChain 在博客中把 AI 智能体定义为使用大语言模型决定应用控制流的系统,自治程度取决于模型掌握多少控制流。文章用六级图谱区分工作流与智能体,从手写代码、单次 LLM 调用、链式调用一直到能自行构建并记忆工具的完全自主智能体,并指出模型控制权越多,对可观测性、评测、记忆、权限和安全执行的要求越高。
推荐理由:文章给出以控制流归属划分智能体的定义和六级自治图谱,并列出落地生产所需的基础设施与评测方法。
LangChain 提出从执行、结果、体验三个维度评估语音智能体,三者相关但不可互换。执行维度检查智能体是否按指令调用正确工具、遵守隐私与同意政策;结果维度关注交互是否真正达成目标,如预约是否成功;体验维度则看对话是否顺畅。LangSmith 支持追踪完整交互、用代码评估器和 LLM 评判器打分,并对比长期变化。
LangChain 复盘 Lyft、Fastweb + Vodafone 和 LATAM 航空三家企业客服智能体的生产实践。
推荐理由:三家企业的生产案例给出了评测、观测与架构调整的具体做法,便于对照自身客服智能体的上线流程。