Bottleneck Labs 实验:GPT-5.6 智能体独立经营 24 小时,烧 3.2 亿 Token 收入为零
Bottleneck Labs 基于 GPT-5.6 Sol 打造智能体 Saul,为其提供一家已上线 iOS 应用的公司、350 美元资金和完全解锁的 Mac mini,进行连续 24 小时独立经营实验,结果累计消耗 3.207 亿 prompt tokens、完成 1129 次工具调用,用户数从 61 增至 66,新增收入为 0 美元。
微信公众号
Bottleneck Labs 基于 GPT-5.6 Sol 打造智能体 Saul,为其提供一家已上线 iOS 应用的公司、350 美元资金和完全解锁的 Mac mini,进行连续 24 小时独立经营实验,结果累计消耗 3.207 亿 prompt tokens、完成 1129 次工具调用,用户数从 61 增至 66,新增收入为 0 美元。
DeepSeek 于 7月31日上线 V4-Flash 正式版 API,未调整模型结构和尺寸,只是在预览版基础上重新后训练,重点增强 Agent 与 Coding Agent 能力。
阿里云张鑫、NoDesk AI 王仿、腾讯任磊达在 InfoQ《极客有约》X AICon 直播中提出,Agent 进入真实业务后的失败大多发生在模型之外,需要 Harness 工程承接不确定性。张鑫认为 Harness 不是消灭幻觉,而是让 Agent 做正确的事并正确地做事,可观测性可形成飞轮效应;王仿强调企业需把给人看的上下文翻译成 Agent 能理解的语言,即本体论。
极客时间推出持续更新的 Codex 开发者知识库,围绕真实开发场景整理学习路径,内容涵盖 Codex 快速入门、登录与权限及 Context、MCP 等常见问题排查、真实项目实战案例,以及 Agent、MCP、Context Engineering 等底层能力解析,放在飞书文档中可搜索,免费领取。
谷歌在 Gemini 企业级代理平台上正式发布 AlphaEvolve,将 DeepMind 的进化式代码优化研究转化为面向谷歌云客户的产品。
Claude Code 创始人 Boris Cherny 建议每半年删除一次自己的 CLAUDE.md、Skills 和 Hooks,重新看看最新模型还需要多少指令,因为每代模型性格不同,旧指令可能已不再适用。
甲骨文将 Oracle Cloud Infrastructure 上 Always Free Ampere A1 Compute 配额从 4 OCPU/24 GB 内存降至 2 OCPU/12 GB,自 2026 年 6 月 15 日起生效,未发布博客或通知客户,仅更新了文档。
阿里云数据库团队在访谈中指出,Agent 正在成为数据库的直接用户:近几个月由 Agent 创建的阿里云 PostgreSQL 实例数已达过去 5 年累计实例的 3 倍,Databricks 收购的 Neon 也披露约 80% 实例由 Agent 创建。团队认为数据库需围绕 Agent 重构交互、内核与安全边界,DBA 角色则转向流程组织与高风险决策。
OpenAI 以 40 亿美元收购一支 150 人的工程师团队,Anthropic 则联合华尔街砸 15 亿美元成立合资公司,把 FDE(前沿部署工程师)送进客户现场。
谷歌于 2026 年 5 月推出 GKE Agent Sandbox,并介绍了 Agent Substrate 项目,前者为智能体运行大模型生成的代码提供安全沙箱,后者在 Kubernetes 集群旁另建调度层,以支撑数百万个大部分时间处于空闲的智能体会话。
美国政府要求承包商在 2026 年 8 月 31 日前全面清退 Anthropic 产品,范围覆盖 Claude 网页端与桌面应用、Claude Code 及 CLI 工具。
HumanLayer 创始人 Dex Horthy 撰文认为,没有人阅读代码的黑灯软件工厂行不通,因为模型强化学习以测试是否通过为奖励信号,无法评估代码可维护性。他回顾团队自 2025 年 7 月起全面进入黑灯模式,此后因棘手问题三次被迫重写代码库。他主张把产品评审、系统架构、程序设计和垂直切片重新交回人工参与,以换取 2 到 3 倍而非 10 到 100 倍的提速。
美国联邦通信委员会(FCC)7 月 28 日更新《受管制清单》,将外国生产的先进机器人设备和联网型电力逆变器纳入限制范围,人形机器人和四足机器人的新型号今后将难以取得在美销售所需的 FCC 设备认证。
7 月 3 日,HashiCorp 联合创始人 Mitchell Hashimoto 发推“I read the code”,获近 83 万次浏览;20 天后《代码整洁之道》作者 Uncle Bob 表示完全不去读 Agent 写出的任何代码,这条推文浏览量超过 480 万。
InfoQ 将于 7 月 29 日晚 8 点直播"你真的驾驭好 AI Coding 了吗",探讨如何打造可靠的 AI Coding 工作流。网易游戏、网龙网络、平凯数据库(TiDB)、汇丰科技的嘉宾将围绕 AI Coding 融入研发流程、从生成代码到可靠交付、构建可控可复用的 Agent 工程体系等话题展开讨论。
AMD 在旧金山 Advancing AI 2026 大会上公布新一代 Instinct MI455X 加速器及 Helios 机架级系统,Helios 已进入全面生产,预计 2026 年第三季度末开始出货。
DoltHub 发布开源版本控制型 SQL 数据库 Dolt 2.0,默认启用自动垃圾回收和归档压缩,新增 archives 存储格式,可将存储占用减少 30% 至 50%。
阿里巴巴高级技术专家陶宇田在 QCon 北京站分享了 OpenSandbox 的设计,该项目以协议优先的契约层统一沙箱语义,上层提供五种语言的 SDK 以及 CLI、MCP 接入,下层支持 Docker 和 K8s 两种 runtime。
昆仑万维集中发布 Matrix-3.5 世界模型、Mureka V9.5 及 O3 音乐模型和面向机器人的 Riemann-1.0 具身世界模型。Matrix-3.5 基于约 1 万小时、约 1200 类游戏及虚拟场景数据,升级 Patch Memory 与推理加速,面向游戏和互动内容实时生成;Riemann-1.0 用超 20 万小时数据训练,部分真实任务成功率达 80% 至 90%。
月之暗面于 7 月 27 日晚开放 Kimi K3 的模型权重、技术报告和关键 Infra 技术,Anthropic 联合创始人兼 CEO Dario Amodei 随后发文回应称,Anthropic 从未主张禁止开放权重模型。
推荐理由:材料把 K3 开源所需的千万级硬件门槛与开放权重政策争论并置,读者可据此判断开源模型的实际使用边界。
Pinecone 全面上线面向 AI 智能体的知识引擎 Nexus,可将企业分散的业务上下文整合为智能体可直接查询的结构化数据层,词元消耗降至原先的约 1/9 到 1/15。
范式智能系统研发专家杨守仁将在 8 月 21 日—22 日举办的 AICon 深圳站分享《从 HAMi 到 HAMi-DRA:异构环境的算力资源管理实践》。HAMi-DRA 是 HAMi 社区在 DRA 方向的最新实践,可在不牺牲核心调度能力的前提下,将现有 GPU 虚拟化调度体系平滑迁移至 DRA 资源模型,在调度性能和精细化管理方面带来显著提升。
7 月 24 日,黄仁勋在开通个人 X 账号后的首条推文中分享了英伟达参与签署的公开信《开放权重与美国 AI 领导力》,称世界既需要前沿闭源模型,也需要前沿开放模型,微软 CEO 纳德拉等人一同表态,Anthropic 未在首批 25 家签署方之列。
2026世界杯决赛西班牙1比0击败阿根廷,靠的是无单点故障的位置足球体系:罗德里与法比安·鲁伊斯切断梅西接球通道,阿根廷常规时间零射门,门将埃米利亚诺·马丁内斯扑出11次射门创决赛纪录。西班牙全场仅丢一球,这套体系历经近二十年打磨,德拉富恩特自2015年执教U19起积累核心班底,2024欧洲杯起终结连续136场控球率领先纪录。
梁文锋因投资人会议纪要外泄叫停 DeepSeek 新一轮融资,原 710 亿美元估值融资及 IPO 筹备暂时搁置。白宫科技政策办公室主任 Kratsios 指控月之暗面 2.8 万亿参数 Kimi K3 蒸馏 Fable,Kimi 员工以"Fable 7 月 1 日上市、K3 7 月 15 日推出"反驳。
梅西旗下的体育科技控股与投资平台 Play Time 已将李飞飞创办的空间智能公司 World Labs 纳入投资组合,梅西本人不直接参与投资决策。World Labs 随后宣布收购机器人仿真公司 SceniX,该公司由李昀烛等人联合创办,主打混合仿真,瞄准机器人行业的 Real-to-Sim 难题。
Meta 开源 Brain2Qwerty v2 非侵入式脑机接口系统,可利用 EEG 或 MEG 脑信号将想法解码为完整语句,评测中平均单词识别准确率达 61%,其他非侵入式方案仅 8%。
WAIC 2026 期间腾讯正式开源三款具身基座模型 Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0 和 Hy-Embodied-VLA-0.5,配合具身智能体 Apexio 与原生框架 TairosAgent 组成完整矩阵。
针对 AI 辅助开发中代码高速产出而设计意图与架构推理流失的问题,文章提出以基于规约的 SDD、TDD 和架构适配函数三者融合,构建与代码一同版本化的上下文存储库。该存储库分结构、变更溯源、行为、一致性四层,供人工评审、AI 智能体与后续维护者查询,使系统认知成为演进式架构贯穿全生命周期的固有属性。
DoorDash 公开了对话式 AI 助手 Ask DoorDash 的架构,该助手由 LLM、各领域专用代理和基于 MCP 的工具组成,业务功能通过共享 MCP 层以可复用工具的形式提供,而非直接写进提示词。
Anthropic 发布 Opus 5 模型,在公告列出的多项基准中表现优于 Fable 5,而 API 价格仅为后者的一半,维持每百万输入 token 5 美元、每百万输出 token 25 美元。
推荐理由:原文给出定价、基准对比与安全策略变化,读者可据此判断 Opus 5 在成本与可用性上的取舍。
WAIC 2026 圆桌讨论中,昆仑万维方汉、L2F 吉星、北电数智郭文、DeepKernel 刘卓涛判断 AI 产业正从“看模型能力”转向“算总账”。吉星称基础设施侧总投入已达 7000 亿美元量级而同期收入约 500 亿美元,单 token 价格降至去年的约八分之一到十分之一,但任务消耗 token 总量上升导致总成本不降反升。
Cursor 工程团队公布实验:一群智能体仅凭一份 835 页的 SQLite 手册,在无源码、无测试套件、不联网的条件下用 Rust 从零实现了一个数据库引擎,并通过了预留的 sqllogictest SQL 结果一致性测试。
2026 年菲尔兹奖得主之一 Jacob Tsimerman 在获奖发布会上宣布,将从纯数学研究转向 AI 安全领域并加入 OpenAI,计划参与 AI 对齐相关研究工作,OpenAI 研究员 Sebastien Bubeck、Boaz Barak、Mark Chen 等人证实了该消息。
思码逸发布《DevData 2026 研发效能基准报告》,覆盖 200+ 家企业、数万名开发者,三年间代码生产率中位值从 2983 升至 4019 代码当量/人月,需求交付周期中位值从 15 天压缩到 7 天。
华为黄之鹏与 vLLM committer 莫梓峰、第四范式杨守仁在 InfoQ 直播中讨论 AI Infra 挑战:莫梓峰称 DeepSeek V4 架构复杂,适配花了快大半年,光 kernel 就写了几个月,vLLM Omni 目前还有约 20% 优化空间未打满。杨守仁指出异构算力管理是核心痛点,客户需面对昇腾、寒武纪等两到三种卡调度,DRA 高阶特性仍多在 Alpha 阶段。
TornadoVM 5.0.0 发布,支持在 NVIDIA GPU 上原生运行 Java,并新增可直接在 TaskGraph 实例中调用原生 NVIDIA 库的 Hybrid API。
阿里云技术专家王世杰在 QCon 北京站分享了 Qoder 记忆系统的落地实践,提出记忆管理应由独立 Agent 承接,并以多阶段混合检索、记忆网络与主题树实现自进化。系统在端侧用 SQLite 存储关系表和向量表,通过 JSON Schema 约束输出使解析成功率提升约 20%,并自建测评集对比 CC 与 OpenClaw。
魔搭社区发起首期「AI+运营:运营人,造自己的工具」开发者创作大赛,最高奖金 2 万元,另提供算力资源、荣誉证书和官方推广等支持,比赛时间为 7 月 15 日至 8 月 15 日。参赛者可将运营中真实存在的问题做成能运行、能体验、能分享的作品,部署到魔搭创空间参赛,生态合作伙伴模力工场参与本次赛事的传播与共创。
InfoQ 整理了一场在 AIE World's Fair 上围绕 Loops 的辩论,Ralph Loop 创造者 Geoffrey Huntley 与 Keycard CEO Ian Livingstone 为正方,Human Layer CEO Dex Horthy 和 Sentry 开发者 Greg Pstrucha 为反方。