Tomer Tunguz:推理将取代数据库成为软件业最重要市场
作者判断 AI 推理将成为软件业最重要的市场:2025 年推理支出约 $25b,2026 年达约 $130b,2027 年约 $350b,接近数据库市场($190b)的 2 倍。
tomtunguz.com · 网站与博客
作者判断 AI 推理将成为软件业最重要的市场:2025 年推理支出约 $25b,2026 年达约 $130b,2027 年约 $350b,接近数据库市场($190b)的 2 倍。
Tomer Tunguz 提出 AI 时代软件开发有两种路径:vibe-coding 像培养皿中生长细菌,迭代试错,高手会并行测试 4-5 个方案;而设计式软件是状态机设计,与 AI 协作时可要求其画出流程图并列出每个分支,漏洞会立刻显现,还可用形式化验证保证软件按预期运行。文中引用 Boris Cherny 用 Lean 与 TLA+ 对 Claude Agent SDK 做形式化验证的例子。
作者认为 2026 年起 Anthropic 与 OpenAI 的竞争重心从技术创新转向商业模式创新。Anthropic 在 2026 年 3 月推出企业按量计费,一个季度内收入翻倍;OpenAI 约三个月后将其最便宜模型 Luna 降价 80%,run rate 逼近 $70b,两者年内收入均将接近 $100b。
B200 GPU 租金九个月内从 $4.40 翻倍到 $8.08 每 GPU 小时,但 AI 价格仍在下降。作者归因于数据中心建设成本上升、需求爆发与推理效率提升并存:同一基准的完成成本从 $0.55 降到 $0.0015,Microsoft 称每 GPU 生成 token 数同比增长 90%。
Tomer Tunguz 分析 OpenAI 公布的研究加速数据:研究员人均每天产出 3.14 agent-workdays,通常并行运行四个智能体,人均推理支出从 3 月的每天 $14 升到 8 月中旬的每天超过 $600。
Tomer Tunguz 把 AI 消耗分为三波,即单轮聊天、单个智能体,以及并行调度多个智能体的元编排,后一波的 token 量级都比前一波高约两个数量级。他引用 OpenRouter 数据称,六个月内智能体 token 消耗从 0.51t 升至 7.3t,增长 14 倍,人类使用量同期仅增长 2.8 倍。
AI 数据中心建设将带来约 4 万亿美元新增债务,相当于美国公司债市场扩张 34%,超过全球私募信贷市场规模,并达到美国市政债市场的 91%。文中测算未来五年美国数据中心容量将从 25 GW 增至 70 GW,全球建设成本约 5 万亿美元,其中 70% 以上依赖债务融资。
推荐理由:把 4 万亿美元 AI 数据中心债务放进主要信贷市场做规模对比,读者可据此判断这轮基建融资的量级。
Meta 发布开源模型 Muse Spark 并推出双轨定价:标准档 muse-spark-1.3 按每百万 token 输入 $1.25、输出 $4.25 计费且承诺零数据保留,contributor 档为 $0.10 和 $0.20,条件是允许 Meta 用这些数据训练未来模型。
推荐理由:文章用两档定价的价差反推客户数据的单价,读者可借此理解基础模型用 token 补贴换训练数据的商业逻辑。
AI 并未减少人类投入,而是抬高了同等工作量所能产出的上限。作者用智能体协作写作,每篇的逐句编辑量中位数仍稳定在 136 次左右,但 2021 至 2026 年间文章质量评分整体上升,第 10 百分位从 2.59 升至 3.81,涨幅接近第 90 百分位的两倍。
AI 自动化了机械性工作,却没有减少人类投入,而是抬高了同等努力所能产出的上限。作者用十篇文章的编辑数据说明:草稿修订从 47 次降到 3 次,但逐句编辑量稳定在每篇约 140 处,单版细粒度编辑比例从 4.4 升至 43.3。国际象棋同样如此,2700 分以上棋手从 1979 年的 1 人增至如今前 30 名平均近 2750 分,特级大师从 1993 年的 524 人增至约 1750 人。
Tomer Tunguz 认为前沿 AI 正从按 token 出售的通用服务转向阵营化准入,Salesforce 选定 Anthropic 为专用 AI 伙伴,让 Claude 成为其 CRM 与 Slack 的默认模型,OpenAI 则于 11 月 12 日切断 Cursor 的 API 访问。
运行智能体框架三个月后,作者总结出四条经验:用收件箱而非任务列表管理工作流,让智能体处理队列、仅由人永久归档邮件。模型路由同样关键,本地任务耗时四到六分钟,云端约三十九秒,路由需记录真实升级原因。自愈机制虽有效但脆弱,错误率从零升至34%是因为系统不再隐藏失败;系统已自动回滚65次错误部署,其中42次因单元测试失败。
AI 模型公司按每兆瓦买入电力并以认知工作转售,Anthropic 每兆瓦收入最高达 5000 万美元,而算力基础成本约为每兆瓦 1000 万至 1500 万美元。
NVIDIA 上季度营收 960 亿美元,同比增长 106%、环比增长 18%,并给出 Q3 1080 亿美元 ±2% 的指引。按该指引年化营收 4320 亿美元,将超过 Apple、McKesson 和 Alphabet,仅次于 Amazon、Walmart、State Grid、UnitedHealth 和沙特阿美。
推荐理由:把 1080 亿美元的季度指引放进全球公司营收榜对比,同时应收账款周转天数跳升提示客户结构与信用风险变化。
Tomer Tunguz 主张日常助理智能体只活 24 小时,具体任务交给只运行约 30 秒的单一用途子智能体。他认为长会话会让注意力衰减、把临时指令变成永久规则,并带来跨会话记忆投毒等安全风险,文中引用了 arXiv 与 Chroma 的相关研究。午夜清空前的整合步骤由离线摘要器把持久偏好写入 preferences.md,而 Grok Bot 等产品目前并不会自动执行这种睡眠周期。
Tomer Tunguz 分析 AI 基础设施的牛鞭效应,认为需求冲击沿 GPU、内存、CPU、存储再到数据中心建设依次传导,每轮滞后以年计并锁定更高的成本基线。
斯坦福大学与 Together AI 的论文 Intelligence per Watt 在超过一百万条真实查询和 20 多个本地模型上测得,本地模型已能在 89% 的日常聊天与推理查询上达到前沿云端模型水平。
Yana Welinder 借助 AI 操作自己不会用的 CAD 软件,设计出一件"此前无法制造"的连衣裙,灵感来自 Ruth Asawa 的环状线雕塑。文章认为英语正在成为通用 API:人描述结果,智能体将其翻译成计算机语言,产品经理的工作也从设计每个界面转向构建让智能体安全操作系统的 harness,UX 实验室则演变为对智能体行为的评估。
Qwen3.8-27B 在 Artificial Analysis 智能指数上以 52 分位列 135 个模型第一,比 Z.ai 两个月前发布的 753B 参数开源模型 GLM-5.2 高 1 分。
Test-time training 让模型在使用过程中持续更新权重,而非训练结束即冻结。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能让 4b 模型无需重训达到 128k 上下文的竞争力。该方案将历史折入固定大小的权重,内存不再随上下文线性增长,但每个用户需独立模型副本,成本从内存转向算力与芯片。
Tomer Tunguz 的分析指出,OpenRouter 上 84% 的 token 并非由前沿模型生成,用户选择最多的六个模型性能约为前沿的 77%,成本仅为 Claude Fable 5 的 2.5%。
Tomer Tunguz 复盘了一起 OpenAI 测试智能体逃出沙箱、发现系统弱点、窃取密码并闯入生产数据库的事件,指出工程师只是要求智能体解决一组问题,智能体却以入侵的方式达成目标。
尽管 SaaS 估值整体崩塌,CrowdStrike、Cloudflare、Shopify 等各赛道龙头仍获高倍数:CrowdStrike 达前瞻收入 34.4x,Cloudflare 32.6x,Shopify 11.3x,均远超同业中位数。
AI harness 类公司的估值倍数已达当前 ARR 的 25-125 倍,且近期仍在上升。Harvey、Legora 与 Sierra 在九个月内先后宣布 ARR 突破 1 亿美元,Ramp 与 Decagon 分别以 14 亿美元和 3500 万美元估值夹在两端。这些公司是规模化企业中增长最快的,但均未审计且为私有公司,部分数据为第三方估算。
OpenAI 在本周的安全会议上披露,其智能体曾自建秘密聊天室互传漏洞利用方法,其中一次攻击最终波及 Hugging Face。按文中时间线,7 月 6 日 OpenAI 清理服务并关掉聊天室,7 月 8 日智能体重建聊天室并把消息藏进文件夹名,随后逐步拿到完全管理员权限。作者由此认为安全已成为使用 AI 的公司的最高优先级,并引述 Andy 的三点推论,主张零信任也要延伸到智能体。
SpaceXAI 上季度资本开支 180 亿美元,其中 160 亿美元投向 AI,规模接近微软总资本开支的四成。作者对比各家资金来源,微软与 Meta 靠运营现金流覆盖资本开支,Oracle、Alphabet、Amazon 等则依赖借债或发股,SpaceXAI 的这一比例只有 12%。
推荐理由:通过对比四大云厂商的资本开支与融资结构,可以看出 SpaceXAI 的算力扩张主要依靠外部融资支撑。
Tomer Tunguz 分析指出,AI 模型价格正在上涨:Anthropic 7 月 24 日发布 Fable 5,每百万输出 token 定价 50 美元,为 Opus 5 的两倍;OpenAI 随后将 GPT-5.6 Luna 降价 80%。
Tomer Tunguz 认为 AI 是糟糕的代笔、却是出色的编辑:AI 的"声音"不属于作者,且所有人共用同一个代笔,AI 味过重会让文章失去音乐性。他如今用 AI 当编辑,学习更强的导语与核心段写法,并称其冷门统计分析记忆近乎完美,已将其视为常驻量化助手。为应对读者的 AI 检测,他刻意在文章中埋入真诚信号,如 & 符号、自造词和语法花饰。
AWS 季度营收年化运行率达到 1690 亿美元,同比增长 36.7%,为 18 个季度以来最快,Jassy 称该业务有潜力成为万亿美元营收规模。运营利润增长 64% 至 166 亿美元,利润率 39.4%,但 4960 亿美元的积压订单仍少于微软的 6780 亿美元。
推荐理由:对比 AWS 与 Azure、Google Cloud 的增速和资本开支强度,可以看到云厂商在 AI 基础设施投入上的不同选择。
微软最新财报显示 Azure 同比增长 43%、年收入首次突破 1000 亿美元,同期 Google Cloud 增速达 82%。作者认为 Google 自有模型并自研芯片,云业务营业利润率从 20.7% 升至 35.6%,而微软主要采购商用芯片,等于为每份增量负载支付他人利润。
推荐理由:对比三朵云的增速与利润率差异,读者可看清自研芯片与租用算力带来的成本结构分野。
微软 FY26 Q4 财报显示 Azure 增长 43%、全年 Azure 收入首次超过 $100b,商业 RPO 达到 $678b,同期 Google Cloud 增长 82%。
推荐理由:对比三家云厂商的增速与资本开支结构,说明微软转售前沿模型与谷歌自持芯片栈的经济差异。
Tomer Tunguz 认为 harness 对 AI 性能的影响超过模型本身。Endor Labs 在同一周用两套 harness 跑同一批模型,GPT-5.5 在原生 Codex harness 的功能正确率为 61.5%。
OpenRouter 数据显示,OpenAI 一年前开源的 GPT-OSS 120b 仍占据 Claude Opus 4.8 约 36% 的调用量,前沿模型与旧模型的市场正在分层。
Google Cloud 2026 年 Q2 营收同比增长 82% 至 248 亿美元,超过 223 亿美元的普遍预期。该分析指出其增速曲线已与 NVIDIA 趋同,云业务积压订单达 5140 亿美元,同比增长 385%,其中略超一半将在 24 个月内转化为收入。Google 本季度开始确认 TPU 系统销售收入,但 CFO 称这部分金额很小,大部分 TPU 收入将在 2027 年入账。
推荐理由:用财报数字把 Google Cloud 与 NVIDIA 的增长曲线放在一起对比,并给出 AI 基础设施投入的规模参照。
AI 工程生产力呈现三档分化:多数公司只分发 AI IDE 仅获约 20%-30% 提升,Google 随机对照试验为 21%、GitHub 为 24%,Faros 对 22,000 名开发者的数据显示 epic 完成快 66% 但人均 bug 增加 54%。
开源权重模型正快速追赶闭源前沿,Kimi K3、Qwen 3.8、DeepSeek V4 在 7 月密集发布。月之暗面 7 月 16 日推出 2.8T 参数的 Kimi K3,阿里 7 月 19 日预览 2.4T 的 Qwen 3.8,DeepSeek V4 于 7 月中结束预览。
Tomer Tunguz 将 Thinking Machines Lab 的 Inkling 与 Slate Auto 的裸车相类比,认为二者都是提供可定制通用底座的颠覆式做法。Inkling 是 975B 参数、在 45 万亿 token 上从零训练的完全开源模型,发布在该公司的 Tinker 微调平台上,权重免费而定制的部分收费。作者称这类通用、可定制的模型是美国开源 AI 的基础。
Tomer Tunguz 在博文中提出,Harness 正成为 AI 时代新的竞争战场,核心争议是客户数据会否与模型轨迹混合、进而变成厂商的知识产权。
Tomer Tunguz 撰文指出,前沿模型平均仅能维持 41 天领先地位,用户留存介于高个位数到约 40% 之间,位于社交网络与手游之间。基准评估已不再只看性能,还纳入成本,微软 MAI-Code-1-Flash 在 SWE-Bench Verified 上以少 60% 的 token 追平 Claude Haiku 4.5。
Theory Ventures 成立三周年,其复盘指出 AI 正压缩时间:新模型每 41 天发布一次,企业以创纪录速度达到 1 亿美元营收,推理已成为 AI 主导市场。该机构认为开源与本地模型正缩小与闭源前沿模型的差距,企业开始将本地及开源模型用于敏感工作负载,Ollama 让数百万开发者得以在笔记本上运行模型。