a16z 分析存量软件巨头入场后垂直 AI 创业公司的机会
a16z 合伙人 Seema Amble 撰文分析,Salesforce、Docusign 等系统记录厂商正从存储信息转向用自有智能体接管更多工作,垂直 AI 创业公司仍可凭聚焦单一岗位取胜。
推荐理由:a16z 合伙人从系统记录与通用智能体的分工出发,梳理垂直 AI 创业公司在哪些具体岗位仍有切入空间。
模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。
当前仅显示精选新闻a16z 合伙人 Seema Amble 撰文分析,Salesforce、Docusign 等系统记录厂商正从存储信息转向用自有智能体接管更多工作,垂直 AI 创业公司仍可凭聚焦单一岗位取胜。
推荐理由:a16z 合伙人从系统记录与通用智能体的分工出发,梳理垂直 AI 创业公司在哪些具体岗位仍有切入空间。
Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。
推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。
推荐理由:Uber 公开了用量涨近 10 倍而账单不涨的具体工程做法,其中子 Agent 分工与工具按需挂载等杠杆可直接参考。
推荐理由:论文量化了共享技能库中恶意技能被智能体自行复制扩散的机制,并给出一种提示词缓解办法,可供搭建技能库的团队参考。
字节官宣推出豆包工作,作者在 Mac 与 Windows 上实测后发布万字上手教程。该产品提供豆包2.1 Turbo 和豆包2.1 Pro 两个模型,均为 256K 上下文,内置 100 个 Skills、130 多个连接器和 87 个工作伙伴,用飞书账号登录可打通联系人、云盘与文档,注册激活可获 30 天标准版订阅。
推荐理由:作者以第一手实测梳理了豆包工作的模型选项、100 个 Skills 与飞书打通细节,可据此判断它是否适合接入现有协作流程。
Anthropic 开放 Model Hardware Standard(MHS)研究预览,这是让 AI 智能体安全操作物理设备的标准规范,首批面向科研实验室和先进制造商,可将原本需数周至数月的硬件集成缩短到数小时或数分钟。
推荐理由:官方介绍 MHS 标准化驱动如何把硬件集成从数周缩到数分钟,并给出多家机构实测用例,对关注智能体操控实体设备的读者有参考。
推荐理由:官方说明了更新方式和调用入口,读者可据此了解网页任务交给 ChatGPT 或 Codex 自动执行的路径。
OpenRouter 发布模型选型教程,提出六步框架:定义任务、用实时使用数据和第三方基准筛选候选、对比各提供商价格与延迟、用自己的提示词测试、按每次完成任务的成本而非每 token 成本衡量,再决定或改用 openrouter/auto-beta 按请求路由。
推荐理由:OpenRouter 官方给出以成本每完成任务为核心的选型框架,并用自家 MCP 服务器让整个评测流程在编辑器内完成。
OpenAI 以 Apache-2.0 许可开源驱动 Codex 的底层执行框架 Harness,并放出三类组件:运行自动化流水线的 codex exec CLI、支持 TypeScript 和 Python 的 Codex SDK,以及通过 JSON-RPC 连接本地 Codex 进程的 app-server。
推荐理由:开源的三类组件与 Harness 调优带来的基准变化,可供开发者评估把智能体嵌入自有产品的落地方式。
推荐理由:官方说明了 Claude 在 Gmail 和 Google Drive 中的操作范围与审批控制方式,便于判断接入后的实际工作流。
xAI 通过 API 以公测形式开放编码模型 grok-build-0.1,该模型专门针对包括网页开发、调试和 MCP 支持在内的智能体编码任务训练,也是驱动 Grok Build 的同一模型。
推荐理由:模型给出 100+ tokens/秒的服务速度与每百万 token 1 美元输入、2 美元输出的定价,便于评估智能体编码场景的成本与速度取舍。
xAI 发布 Voice Agent Builder 测试版,这是在 Grok Voice 上配置生产级语音智能体的无代码平台,内置电话、知识库检索、工具、护栏、MCP 和可观测性。
推荐理由:xAI 把电话、知识库、工具与护栏收进同一个语音接口,并给出单价和基准对比,便于判断落地成本。
xAI 发布 Grok 4 与 Grok 4 Heavy,用 20 万 GPU 集群 Colossus 把强化学习训练扩展到预训练规模,训练算力效率提升 6 倍。
推荐理由:原文给出强化学习规模化的训练细节与多项基准成绩,可了解 Grok 4 的推理与工具调用取向。
xAI 宣布把 Grok 做成 Microsoft PowerPoint 插件,可在演示文稿旁使用 Grok 研究、撰写和优化幻灯片。用户把大纲交给 Grok 即可生成完整幻灯片,内容可来自网页或 X 搜索,并包含图表和图片;也可用一条指令添加单页幻灯片、套用样式主题或调整章节结构,Grok 会反问澄清问题。
推荐理由:Grok 以免费 Microsoft 365 插件形式进入 PowerPoint,读者可了解它能如何从大纲生成整套幻灯片。
xAI 为 Grok 推出 Connectors,在 Web、iOS 和 Android 上线,可把常用应用直接接入 Grok 完成端到端操作。
推荐理由:原文列出首批接入的办公与开发工具,读者可据此判断 Grok 能覆盖哪些现有工作流。
xAI 发布 Grok Build 插件市场,插件把 skills、slash commands、agents、hooks、MCP servers 和 LSP 打包成可安装单元,可在终端内浏览、安装和更新。
推荐理由:插件把 skills、命令、agent 与 MCP server 打包成可安装单元,读者可据此判断 Grok Build 的扩展方式。
Mistral AI 发布 Mistral Large 2,具备 128k 上下文窗口和 1230 亿参数,针对长上下文应用设计,可在单节点上实现大吞吐推理。官方称其预训练版本在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 处于同一水平。
推荐理由:原文给出 128k 上下文、123B 参数与单节点部署的设定,读者可据此判断这一代模型在性能与成本之间的取舍。
Agent Plugins 1.0.0 是一项厂商中立的目录规范,由 Google、Amazon、Microsoft 等支持,可将 Agent Skills 与 MCP server 打包成单一可移植单元。
推荐理由:规范统一了 Agent Skills 与 MCP server 的打包方式,读者可据此判断跨 IDE 兼容的成本。
MCP 第五个规范版本 MCP 2026-07-28 发布,协议核心从有状态双向模型改为请求/响应无状态模型,并纳入 MCP Apps 与 Tasks 标准化扩展,授权对齐生产环境的 OAuth 2.0 与 OIDC。
推荐理由:MCP 2026-07-28 把协议核心改为无状态并引入扩展框架,读者可据此判断服务器部署与扩展方式的变化。
Claude Code 官方博客解释了会话的 token 成本构成,输出 token 单价约为输入的 5 倍,缓存读取按输入价的 0.1 倍计价、写入最高为 2 倍。
推荐理由:官方拆解了 prompt 缓存与上下文如何影响会话成本,并给出可直接照做的会话管理方式。