Ollama 用户突破 890 万,每周新增近百万开发者
Ollama 已有超 890 万开发者使用,每周新增近百万,用户在 Ollama 之上运行 Claude Code、Codex、OpenClaw、Hermes 等 65000 多个应用与集成。
tomtunguz.com · 网站与博客
Ollama 已有超 890 万开发者使用,每周新增近百万,用户在 Ollama 之上运行 Claude Code、Codex、OpenClaw、Hermes 等 65000 多个应用与集成。
一种智能体记忆架构在每次任务前执行"预检":先检索约 90 个磁盘索引的技能工作流文件,按意图匹配后只把相关技能加载进上下文窗口,再由本地 Ornith 35B 模型执行,约 80% 的常规任务留在本地,难题才路由到前沿模型。系统会记录每次预检决策,夜间用异步推理决定新增哪些技能、哪些部分改写成确定性代码,形成自我改进循环。
AI 公司在 12 个月内向前向部署工程(FDE)投入 97.5 亿美元,相当于 Accenture 年度服务成本的约五分之一。文中归纳出三种模式,Microsoft 与 Amazon 用既有编制组建团队,OpenAI 与 Anthropic 成立由外部私募支持的独立实体,Google Cloud 则投入 7.5 亿美元做合作伙伴基金。
推荐理由:文中把 FDE 投入拆成三种结构模式,读者可借融资与人员数字判断这套模式为何被各实验室采用。
AI 公司在 12 个月内承诺投入约 100 亿美元用于前置部署工程(FDE),其中五家公司合计约 97.5 亿美元。OpenAI 的 Deployment Company 融资 40 亿美元、投后估值 140 亿美元,Anthropic 合资公司募资 15 亿美元;微软、亚马逊和 Salesforce 则用内部团队推进。
《经济学人》用世界价值观调查问卷测评了 25 个前沿 AI 模型,多数模型落在自我表达一侧,但彼此差异明显。GPT-4o 与 DeepSeek R1 价值观接近,同一实验室的 DeepSeek R1 与 DeepSeek V4 Flash 却在世俗与传统轴上分处两端。作者认为,当模型用于特定市场的商业决策时,其世界观会成为一项实际输入,但目前企业采购评分并不包含这一维度。
Tomer Tunguz 发布了一篇题为《Search》的文章,正文仅包含版权声明,未披露具体技术内容或产品信息。
构建 AI 智能体的团队常先选模型再定架构,但模型选择应是最后一步,真正关键的是决定每类请求由哪层模型处理的路由器。路由做对后,70-80% 的流量可跑在本地模型上、每次调用零成本,或走异步模型将 AI 支出降低 90% 以上。Brian Armstrong 上周也提到 Coinbase 靠更好的默认值、路由与缓存,在 token 用量增长的同时把 AI 支出削减近一半。
公开软件板块过去一年呈现两极分化:Infrastructure & Dev Tools 以 +68.5% 领涨,Security 以 +17.6% 成为唯一另一个上涨板块,而 Business Applications 下跌 -36.2%。
Anthropic 的算力支出约为其薪资支出的 2.3 倍,按约 5000 名员工和 2026 年约 $10b 的推理与训练花费计算,相当于每名员工每年约 $2m 算力成本,而其全包薪酬约 $500k 以上。
Theory 宣布与 Kleiner Perkins、Redpoint、Sequoia 共同投资 Sail Research 的 A 轮。Sail 将请求分发到 DeepSeek、Qwen、Kimi、GLM 等开源模型并按任务挑选最便宜可用的模型,其 GLM-5.1 每 token 成本比 Anthropic 的 Haiku 低 6 倍。
Glean CISO Sunil Agrawal 将于 7 月 9 日太平洋时间上午 9 点做客 Office Hours,讨论 AI 时代的安全防御准备。议题包括 AI 压缩了攻击者理解目标、绘制攻击面和个性化首次攻击的时间,曾用于识别攻击的语法、语气和上下文线索正在消失,深度伪造通话与合成媒体改变了审批、支付和信任的控制面。
AI 领域增长最快的公司要么在卖推理,要么在转售推理,但按成本转售是零毛利生意。Tomer Tunguz 提出三条保住 30% 以上毛利的路径:成本加成受制于推理成本。
Databricks 年化经常性收入突破 69 亿美元,同比增长 80%,与 Snowflake 约 53 亿美元 ARR 的差距从今年 3 月的 4.9 亿美元扩大到 16 亿美元。其 AI 产品年化收入 17 亿美元,约占总 ARR 的 25%,六个月前为 10 亿美元,增速高于公司整体。作者认为处在 token 路径或其衍生环节的公司增长尤为迅猛。
Tomer Tunguz 梳理了一篇 Hacker News 热帖的 500 多条评论,勾勒出本地编码栈的现状:Qwen 3.6 35B-A3B 以 33% 的提及率居首,27B 变体占 20%,DeepSeek Pro 与 Gemma4 31B 进入前四;智能体框架方面 Pi 以 49% 领先,OpenCode 紧随其后达 45%。
推荐理由:帖子数据勾勒出本地编码模型与智能体工具的占比,并与 Claude 做能力对比,便于判断本地替代的可行边界。
Tomer Tunguz 认为,Anthropic 发布 Fable 后 AI 已触及能力上限,强护栏形成了玻璃天花板。他提到 Stripe 用 Fable 在一天内迁移 5000 万行 Ruby 代码库、45 分钟完成数万行重构;在他自己的测试中,Fable 让本地模型推理性能翻倍,关键基准提升 10-15 个百分点。
推荐理由:借 Stripe 的代码迁移案例与作者自测数据,可了解强护栏限制下当前最强模型的实际能力边界。
Tomer Tunguz 汇总 Coinbase、Lindy、Harvey 和 Cursor 的做法,认为 AI 买家正把流量替换到更便宜的开源模型。
一位开发者让 Mac 上的本地模型承担 78% 的 AI 任务,复杂任务才路由到云端,近七天峰值达 88%。双通道设计使吞吐量提升约 25%,平均任务时长从 47 秒降至 19 秒,队列等待从 73 秒降至 4 秒。他将此比作 Nucor 的迷你钢厂模式,认为未来数百万台边缘设备将各自成为本地推理的"迷你钢厂"。
原文正文仅为订阅推广信息,未包含任何关于模型、产品或技术的实质内容,无法提取有效摘要。
微软在模型发布卡中新增“平均 token 用量”指标,其新编码模型 MAI-Code-1-Flash 在 SWE-Bench Verified 上得分 71.6,token 消耗约为 Claude Haiku 4.5 的三分之一。
OpenRouter 的模型级快照显示,开源权重模型贡献了命名开源与闭源模型 69.1% 的 token 用量,闭源模型为 30.9%。
一种名为 skill distillation(技能蒸馏)的做法正被用于让前沿模型编写 SKILL.md 技能文件、由本地小模型执行:Opus 4.7、GPT-5.1、Gemini 3 Pro 负责撰写与迭代技能,Qwen 35B 或 Gemma 26B 在本地运行。
Lemonade CISO Jonathan Jaffe 在 Office Hours 中提出,安全团队正在变成工程团队,Lemonade 每位安全人员都是工程师,并自建了带智能体的 AI 平台,其中一个智能体读取威胁情报,另一个核查有漏洞的方法是否在生产代码中被调用。他强调每个智能体都需要身份标识,并由策略在行动点进行管控,现有身份与访问管理系统难以胜任这种复杂度。
AI 让固定工作流的 SaaS 托管数据库过时,软件时代终结、harness 时代开启。作者提出驾驭 AI 的七个部分:上下文与记忆、工具与行动、编排与循环、状态与持久化、沙箱与算力、可观测性与治理、成本与工作流优化,其中 MCP 已成为连接组织。当每家公司都能用同一模型时,赢家是最会驾驭它的人。
继数据引力之后,智能体引力将成为智能体时代最重要的力量。Databricks 在微软平台上线的新功能,让 Power BI 客户更容易在 Databricks 而非微软 Fabric 中管理数据并构建 AI 智能体。智能体可抽取语义层知识、迁移数据并发布到其他 BI 系统,用户可能在不知不觉中把智能体与数据仓库负载迁移到新平台。
Salesforce 已实现无头化,销售人员无需登录 salesforce.com 即可通过 AI 更新交易表,许多公司正借助 MCP 跟进。Airbnb CEO Brian Chesky 与 Claude Code 工程师 Thariq Shihipar 则主张更丰富的 UI,后者称自己已更偏好用 HTML 而非 Markdown 作为输出格式。
Salesforce 已实现无头化,销售人员无需登录 salesforce.com 即可通过 AI 更新交易表,许多公司正借助 MCP 跟进。Claude Code 工程师 Thariq Shihipar 表示自己更偏好 HTML 而非 Markdown 作为输出格式,Airbnb CEO Brian Chesky 也主张更丰富的用户界面。
SpaceX 递交 S-1,披露 2025 年 187 亿美元合并营收与 66 亿美元调整后 EBITDA。文件把公司分为 Space、Starlink 和 AI 三个分部,Starlink 贡献 61% 营收、2025 年运营利润 44 亿美元,AI 分部当年投入 64 亿美元建设 COLOSSUS 数据中心并训练 Grok。
推荐理由:S-1 数据把 SpaceX 拆成卫星、发射与 AI 三块业务,读者可借此比较 AI 算力投入与收入回报的差距。
Google 的 AI 价格每年翻三倍,OpenAI 旗舰模型在经历一段补贴后重新涨价,Anthropic 则维持价格不变并对最强模型降价。三家厂商定价策略分化明显:Google 仍是低价玩家,涨价后价格仍不到竞争对手的一半;Anthropic 直到去年年底前一直维持高价。这些变化反映出策略转向——现金充裕、看重份额时降价,现金紧张、看重利润率时涨价,而如今三家都面临后者,资本开支持续创下纪录。
作家 Tomer Tunguz 测试了 10 多个 AI 系统,并让 Gemini、Claude 与 OpenAI Codex 互相编辑第四稿,结果并非优雅的拼图,而是"手指画灾难"——三个模型各有自己的声音,无法就统一的语气和风格达成一致。
AI 与软件领域增长最快的公司要么直接卖 AI,要么转售推理,Datadog 和 Twilio 是前 AI 时代公司中受益于推理需求的两个代表。Datadog 发往其 LLM Observability 产品的 span 数量环比近乎翻三倍,6,500 多家客户贡献约 80% ARR。Twilio 则因 AI 原生公司和企业通过语音与短信进入其平台而获益。
使用前沿模型处理 AI 邮件,每月成本在 22 至 130 美元之间;按 26 美元/月的中间值估算,软件公司若保持 75% 毛利率,年费约 350 美元,规模化后定价约 500 美元/年。小模型可将成本降低 10 至 20 倍,本地运行则趋近于零,配合确定性规则与模型-负载匹配,整体成本有望下降 100 倍。
知识工作者平均每天收到 121 封邮件,未来收件箱将由用户自定义技能与规则驱动,用英文编程编码个人优先级、关系与工作流,邮件一到即自动转发报销、评分入 CRM 并生成提案草稿。多年往来历史会成为个人上下文层,端侧模型私密处理敏感邮件,最终收件箱消失,只剩真正重要的 6 封邮件。
Theory 启动 2026 年度 GTM 调研,用 25 个问题追踪创业公司销售、营销、客户成功与现金管理的变化,并与 2022 至 2025 年的调研结果对比。今年聚焦五大假设:增强型销售代表优于自主 AI 与纯人工、AI 拉大 GTM 团队绩效差距、买方 AI 采用比卖方 AI 更具颠覆性、AI 效率提升被转化为裁员而非营收增长、创始人对 AI 的预期已下调。完成调研者可获得匿名原始数据。
五周实测显示,本地 35B 模型可完成约一半日常任务,其中邮件、日程、摘要与行政类共 618 项,占 41.8%。在 8 项智能体任务对比中,MacBook Pro M5 上的 Qwen 3.6 35B-A3B-4bit 与 API 调用的 Claude Opus 4.5 均正确完成任务,Opus 4.5 推理基准高约 20%,本地模型输出更简洁、常只需一半 token。
Lemonade CISO Jonathan Jaffe 将在一场 15 分钟线上对话中,探讨当攻防双方都由 AI 智能体驱动时,企业如何构建、保障和运营 AI 系统。Jaffe 自 1997 年起从事技术安全岗位,拥有超过 25 年经验。活动无幻灯片、无预设问题,支持实时来电提问,需提前注册。
Anthropic 营收在 15 个月内从 $1B 增至 $30B,但估值相对上市公司可比对象存在折价。作者估算其 EV/NTM 倍数为 17x,较 Palantir 折价 65%,并从资本密集度、盈利不确定性、增长波动性和政策风险四方面解释这一差距。其中按当前市场价计算,仅 xAI Colossus 的 GPU 交易每年成本就达 $6.2B。
当 AI/人力配比从 10/90 走向 90/10,三人团队加二十个自主智能体虽能完成生成、审查、测试、部署全流程,但一人离职即造成 33% 的人力损失,而智能体不会离职,却带走了训练、提示、验证和调试智能体集群所需的三分之一组织记忆。核心权衡不是吞吐量,而是韧性;制造业通常以 70–90% 利用率运行工厂,把编排知识集中在三个人身上等于 100% 利用率,多数初创公司还不该下这个赌注。
Tomer Tunguz 分析认为广告支撑的 AI 在经济上可行:在 4 块 B200 服务 300 名用户的假设下,用户每 3 到 39 分钟看一条广告即可覆盖算力成本。文中还给出混合方案,每月 10 美元加每天 8 条广告可覆盖每用户每天 200 万 token。但智能体编码消耗的 token 是普通对话的 10 到 20 倍,纯广告模式难以支撑这类重负载。
AI 在多个领域取得实质进展:Mayo Clinic 的研究发表于 Gut,哈佛大学一项 N=194 的随机对照试验显示 AI 辅导组学习收益中位数是主动学习课堂的两倍以上,约 70% 的 AI 辅导学生在 60 分钟内完成学习。
Google Cloud 在 Q1 2026 同比增长 63%,AWS 为 28%、Azure 为 40%,三家云厂商该季度基础设施资本开支合计 1120 亿美元。
推荐理由:文章对比三家云厂商的增速与资本开支,指出自有模型层与芯片的垂直整合是增长分化的重要原因。