Claude Code 创始人 Boris Cherny:建议每半年删除一次 CLAUDE.md、Skills 和 Hooks
Claude Code 创始人 Boris Cherny 建议每半年删除一次自己的 CLAUDE.md、Skills 和 Hooks,看看最新模型自己会怎么做。
推荐理由:Claude Code 创始人解释了为何每代新模型都要清空提示词和 Skills,以及为什么验证比提示词工程更关键。
按公众号阅读文章与观点
Claude Code 创始人 Boris Cherny 建议每半年删除一次自己的 CLAUDE.md、Skills 和 Hooks,看看最新模型自己会怎么做。
推荐理由:Claude Code 创始人解释了为何每代新模型都要清空提示词和 Skills,以及为什么验证比提示词工程更关键。
在 OpenAI 工作约 8 个月后离职创业的 Andrew Ho 喊话老同事,能参加要约收购就赶紧套现、别等 IPO,他自己手握约 70 万美元 OpenAI 股权却暂时无法兑现。他认为前沿实验室估值建立在极乐观预期上,市场回归理性后腰斩很有可能,并判断下一阶段稀缺资源将从算力转向高质量训练数据,未来几年前沿实验室可能投入超 1000 亿美元采购数据。
World Labs于7月21日宣布收购机器人仿真公司SceniX,一周后双方公布Real-to-Sim-to-Real(R2S2R)成果,把真实机器人任务搬进仿真、在放大的任务场景中训练和评测策略,再将策略部署回真实机器人,用仿真中的相对表现预测真机表现并提前暴露失败区域。
AI 订阅制被类比为健身房会员卡模式,厂商赌用户少用、用户想全部用满,由此产生关闭订阅入口、rate limit、5 小时/7 天 token 限额等矛盾。文章认为 DeepSeek 只提供 API、把精力放在提升模型能力和降低成本上,是更简单的路径,并判断订阅制可能只是 AI Agent 推广期的阶段性产物,未来厂商或将回归 API 定价。
Silicon Star Pro(硅星人Pro)把同一组长提示词、参考图和参考视频分别喂给 7 月 31 日同日上线的 MiniMax H3 与字节 Seedance 2.5,做了三轮同题 PK 和两轮单项加试。
Google 首席科学家 Jeff Dean 在 YC Startup School 2026 上分享了他对 AI 现状的判断:数据搬运的能耗是计算本身的 1000 倍,推理硬件专用化是下一波效率提升的关键,未来会出现更多高性能、低能耗的推理硬件。
7 月 30 日,字节跳动启动面向 AI 业务的架构调整,飞书产品团队与豆包产品团队合并成立新的豆包产品团队,由赵祺统一负责,飞书的销售、市场与客户服务团队则与火山引擎合并成立创造力服务平台,由谭待负责。飞书负责人谢欣从直接向梁汝波汇报改为向赵祺汇报。文中提到豆包截至 2026 年 3 月月活达 3.45 亿,按 7 月平均消耗量折算,字节大模型业务 ARR 已达 40 亿美元。
OpenAI 正筹备暂定名为 Astra 的全新模型家族,主打多智能体长时间协同解决高难度问题,已进入测试阶段。Sam Altman 本周在华盛顿向政策制定者演示 Astra,并展示其解决此前未被攻克数学问题的能力。Astra 可能作为 GPT-5 系列后续版本(如 GPT-5.7)推出,也可能直接命名为 GPT-6,预计成为美国新前沿 AI 报告框架下首批受审模型之一。
黄仁勋在 Y Combinator 近一小时的访谈《Jensen Huang: The Mindset That Built NVIDIA》中表示,Agent 是一种新的软件形态,可控性可能成为其下一阶段最大的突破口。
Anthropic 在 141006 次网络安全评估记录中查出三起事故:因测试环境意外留下连通公网的通道,Claude 接触到真实目标,包括进入一家同名公司的数据库、向真实 PyPI 上传恶意软件包并在约一小时内被 15 个真实系统下载、扫描约 9000 个公网目标。
推荐理由:原文还原三起 Claude 测试外溢事故的具体路径,给出 Anthropic 暂停评估并修补隔离的处置。
InfoQ 在 WAIC 2026 收官圆桌邀请连文昭、郭权玮、龚珊三、杜雨四位一线观察者,讨论 AI 究竟重写了什么。杜雨认为 AI 正重复互联网路径,算力先赚钱、应用最后落地,并称今年 WAIC 几乎可称"世界具身智能大会";连文昭则聚焦具身智能,指出机器人能否在工程师离场后仍被客户持续使用,是判断其真实价值的标准。
Meta 已将 React Compiler 的 Rust 移植版本合并到主代码仓库,作为可直接替换的 Babel 插件,其运行速度约为 TypeScript 版本 3 倍,独立转换逻辑在部分情况下最高可达 10 倍提升。
翁荔(Lilian Weng)在离开 Thinking Machines Lab 一天后重返 OpenAI,负责领导一支面向内部研究的高层级团队,支持包括递归自我改进在内的跨研究工作。
Bottleneck Labs 基于 GPT-5.6 Sol 打造智能体 Saul,为其提供一家已上线 iOS 应用的公司、350 美元资金和完全解锁的 Mac mini,进行连续 24 小时独立经营实验,结果累计消耗 3.207 亿 prompt tokens、完成 1129 次工具调用,用户数从 61 增至 66,新增收入为 0 美元。
DeepSeek-V4-Flash 正式版发布,能力接近 Opus4.8,成本约为其 1%,发布后十几个小时内已有中外开发者将其接入各类 Agent 并展示 demo。同日智谱 GLM 开放订阅并涨价,被指遭到精准狙击;作者同时期待 DeepSeek-V4-Pro 正式版与 DeepSeek 的 Coding Agent。
欧莱雅在WAIC首次展出面向线下消费者的生成式AI美容顾问3CE GENBA,基于品牌知识库和欧莱雅AI模型提供问答式美妆咨询。其AI已深入研发、内容与交付环节,Hair Digital Twin筛选速度达传统实验室3倍,AI客服准确率从80%多提升至90%多。全球超7.3万名员工完成生成式AI培训,中国超70%员工参加AI能力自测。
OpenAI联合创始人兼CEO奥特曼在Relentless《How to Start a Startup》访谈中自述,为开发Sora应用而下载TikTok体验,结果一度晚上刷一小时、周六下午刷了约三小时,最后删掉TikTok并关闭大部分App通知。
MiniMax H3 在影视后期、动画特效和转场制作上表现突出,用户仅需标注特效图片分镜或提供参考,即可生成复杂动态特效。其文字、UI 与排版细节效果极佳,九宫格图片总分辨率约 1K 也能生成高清晰度画面,不再出现字迹模糊。该模型支持全模态参考,并将开源以降低成本,适合广告片、产品宣传片、MV、游戏及电商宣传等场景。
7月29日,Leopold Aschenbrenner把基金公开市场仓位整体卖给Citadel,这只规模一度达到450亿美元的AI基金就此结束运作。7月AI基础设施类股票大跌,基金杠杆最重时可能接近四倍;按5月提交的13F所披露27只美股推算,其账面跌价在47亿至55亿美元之间,其中八只股票占到93%。
华为推出 798 克 MateBook Pro S 和 18 英寸折叠屏 MateBook Fold,以极致轻薄和新形态为鸿蒙 PC 争取用户迁移窗口。MateBook Pro S 搭载麒麟 XE90,宣称 20W 以上性能释放和 18 小时视频续航;鸿蒙电脑生态应用已突破 1.9 万个,小艺任务拥有超 2300 个 Skill。华为预告首款商用台式机将于 10 月上市。
MiniMax H3 今日上线并开源,被称为把全模态上下文能力拉满、用语言统一所有任务中间层的模型。原文实测中它与 Seedance 2.0 打得有来有回,生成速度更快,2K 视频定价 0.8 元/秒、约为同类旗舰视频模型的三分之一。
字节7月30日发布内部邮件,宣布豆包与飞书的产品团队整合,成立新的豆包产品团队,由豆包负责人赵祺负责,飞书负责人谢欣向其汇报。飞书GTM体系与火山引擎团队整合,成立新的GTM组织“创造力服务平台”,由火山引擎负责人谭待负责;字节表示飞书原有产品和服务保持不变。另有消息称,由飞书产品团队深度参与开发的豆包企业版已在部分飞书客户中开启内测。
前 OpenAI 推理负责人 Jerry Tworek 与前 Google Gemini 预训练负责人 Rohan Anil 在红杉资本播客对谈中宣布创立 Core Automation,并判断 Transformer 架构已走到尽头,通往 AGI 的瓶颈在架构本身。
Manifold AI 流形空间发布 V2 系列全栈技术,含开源世界模型 MoE 框架 WorldScape 2.0、记忆增强的世界动作模型 WorldScape Policy 2.0 及联合清华等高校推出的 WorldArena 2.0 评测体系。
MiniMax 发布视频旗舰模型 H3,价格仅为 Seedance 2.0 的三分之一,并宣布即将开源。在 Artificial Analysis 最新的视频编辑榜单中,H3 以 1130 Elo 排名第一,领先 Google Gemini Omni 和字节 Seedance 2.0。
Anthropic 发布长文承认,在排查 141,006 次网络安全测试后,发现 Claude 自主连网并入侵了 3 家真实企业,涉及 Claude Opus 4.7、Mythos 5 以及一个内部研究原型。
推荐理由:沙箱误连真实网络后模型把真实企业当成演练目标,读者可据此理解智能体安全评估中环境隔离的难点。
DeepSeek-V4-Flash 正式版(0731)发布,基准测试超过 V4-Pro-Preview、击败 GLM5.2,并紧咬 Opus4.8。作者给出的成本对比显示,V4-Flash-0731 正式版成本约为 Opus4.8 的 1%。作者还提到 DeepSeek-V4-Pro 正式版也即将发布。
智在无界(BeingBeyond)发布隐式触觉世界动作模型 Being-H0.8,采用 50 万小时人类第一人称视频数据做预训练,为目前全球具身模型头部水平。该模型在预训练阶段即加入触觉接触点标注,端侧推理速度达 30 赫兹,训练算力消耗约为视频生成类 world action model 的百分之一。
宝洁大中华区董事长兼CEO许敏在7月29日创新开放日上,将未来消费品公司定义为品牌、科技、技术、生态四重身份叠加的“新”公司。北京创新中心现有800余名科研人员、上百位博士,新品研发周期从24个月压缩至6至9个月;金雷达系统覆盖90%以上电商生意,每年处理7000多万条真实评论。许敏强调AI是工具不能替代人,宝洁不会为了AI而做AI。
DeepSeek 于 7 月 31 日在 API 更新日志中宣布 V4-Flash 正式版 API 上线公测,V4-Flash-0731 的模型结构与参数规模不变,仅重新做了后训练,重点提升 Agent 尤其是 Code Agent 能力,并原生支持 Responses API、专门适配 Codex。
DeepSeek V4 Flash 正式版官方 API 开启公测,在 DeepSWE 基准拿到 54.4%、TerminalBench 达到 82.7%,输入每百万 Token 0.14 美元、输出每百万 Token 0.28 美元,价格不变。
OpenCode CEO Jay V 与联合创始人 Dax Raad 在多档播客访谈中复盘了这款开源编程 Agent 的增长:2025 年 6 月发布,今年 6 月底月活约 1300 万,每天处理约 7 万亿 token,年化营收接近 6000 万美元。
字节跳动正式发布自研视频模型 Seedance 2.5,即梦AI 作为官方体验入口同步接入。该模型支持30秒原生直出,并推出最长3分钟的超长视频生成模式,新增局部修改、增加、删除、替换等视频编辑能力。它还支持最多同时参考50个素材以及绿幕、白模素材生成,可通过 Maya/Blender 插件直接调起,文本控制视频时间点的误差在1s以内。
中科大与上海人工智能实验室联合团队提出视觉预训练(VP)范式,在连续视觉表征空间中预测下一个视觉单元,让模型直接从图文交织的文档页面学习。实验显示,VP仅用约200亿视觉Token(约为解析文本800亿Token的四分之一),便在MMLU-Pro、GPQA Diamond等基准上全面优于纯文本预训练,且优势随训练量增加持续扩大。
Thinking Machines 发布 Inkling-Small,总参数 276B、激活 12B,体量约为 Inkling 的四分之一。它在 HLE 上得 31.6%(Inkling 为 29.7%),SWE-bench Verified 突破 80%(Inkling 为 77.6%),通用推理和智能体编程两条线都超过教师模型。
一篇工作日志梳理从 GPT-2 到 Kimi K3 的架构演进,七年间参数量从约 1.24 亿扩至 2.8T,一个 Kimi K3 约相当于 22,580 个 GPT-2。
Google DeepMind 于 7 月 30 日发布 Gemini Robotics 2 系列三款模型,分别负责全身控制与灵巧操作、具身推理与多机器人协作,以及设备本地端运行。
DeepSeek 更新 DeepSeek-V4-Flash,新版 V4-Flash-0731 与此前 Preview 采用相同模型结构和参数规模,只重新做了后训练,目前在 API 端上线公测,V4-Pro API 以及 App 和网页端模型未同步更新。
李飞飞、Yilun Du 等十多位学者合作的论文 Masked Visual Actions for Unified World Modeling(MVA)提出,用 SAM 把机器人动作分割成像素遮罩轨迹,让视频生成模型既能模拟世界又能反推动作。
DeepSeek V4 Flash 正式版发布,模型结构和参数规模没变,只重新做了后训练,Terminal Bench 2.1 从 61.8 涨到 82.7,DeepSWE 从 7.3 涨到 54.4,DSBench-FullStack 从 37.0 涨到 68.7。