OpenAI 暂停 Astra 模型强化学习训练两周,GPT-6 训练一并冻结
OpenAI 因 Astra 模型网络攻击能力触碰危险红线,暂停其强化学习训练两周,GPT-6 的前沿训练也仍处冻结状态。OpenAI 同时收回模型联网与工具权限、将 AI 生成代码关入沙盒,并规定最高安全警报下核心团队须在 30 分钟内证实误报,否则人工暂停任务,该实时监控约消耗 20% 推理算力。
微信公众号
OpenAI 因 Astra 模型网络攻击能力触碰危险红线,暂停其强化学习训练两周,GPT-6 的前沿训练也仍处冻结状态。OpenAI 同时收回模型联网与工具权限、将 AI 生成代码关入沙盒,并规定最高安全警报下核心团队须在 30 分钟内证实误报,否则人工暂停任务,该实时监控约消耗 20% 推理算力。
杭州达迩文智能(DarwinMind)推出的 Spellcaster 平台,可将自然语言先解析为结构化游戏设计中间层,再由 6 个专用 Agent 协同生成游戏,平均约 15 分钟产出可玩版本。
英伟达宣布与SB Energy合作,在美国俄亥俄州PORTS-Pike园区锁定土地、电力和厂房资源,建设由OpenAI租用、全面采用英伟达DSX AI工厂平台的AI工厂,首期部署最多提供4.25吉瓦容量。
推荐理由:英伟达把芯片供应链的锁定打法复制到土地与电力,读者可看到算力扩张的瓶颈正转向基建资源。
Prime Intellect 研究员 Elie Bakouch 公开了迄今规模最大的自主 AI 研究实验,把 18 个模型放进断网的 8 卡 H200 沙箱跑 nanoGPT 速跑任务,共 153 次运行,所有轨迹与推理流程已公开。
智谱发布 GLM-5.3,基座与 GLM-5.2 相同,通过对 743B 基础模型后训练提升编程与 Agent 能力。
DeepSeek V4 Pro 正式版上线,主要升级 Agent 能力,网页、API 和 App 均可使用;同日 DeepSeek Harness v0.1 开发者预览版以 MIT 许可开源,模型、工具、技能、会话、沙箱、循环、编排和 UI 全部以插件实现。
VLAI Robotics 未来动力发布双臂轮式人形机器人 K1,起售价 1.98 万元,具备 25 个全身自由度,支持腰头双臂协同与四轮全向移动。单臂负载 6kg,重复定位精度 ±0.02mm,控制延迟低于 10ms,适配 LeRobot 框架及多种 VLA 模型与世界模型,原生支持 Isaac Sim、Isaac Lab、MuJoCo 仿真环境。
Grok 4.6 发布,在 Artificial Analysis Intelligence Index 上得分 61,比一个月前的 Grok 4.5 提高 5 分,按马斯克的说法在智能、成本和速度上可以排第一。
ZCode 上线 Goal、Subagents、Remote Control 与闲时任务四大功能,并重置了 GLM Coding Plan 全体用户额度。作者用四轮构建一个 GitHub 数据分析面板来实测,Goal 会按可验收目标自主多轮迭代,并在动手前调用 Subagents 审计代码结构。
英伟达与 Apollo、BlackRock、黑石、布鲁克菲尔德、高盛和 KKR 六家金融机构共同建立独立融资平台,目标在未来调动超过 5000 亿美元的第三方资本用于 AI 基础设施建设。
Anthropic 一个内部未公开的研究版 Claude 在黎曼猜想的关联问题上取得进展,将黎曼ζ函数零点中满足黎曼猜想的已知下界从41.6%提升到67.2%,即提高25.6个百分点,而此前37年里数学家仅将其推进0.8个百分点,黎曼猜想本身仍未获证明。
推荐理由:相比数学家37年仅推进0.8个百分点,这次提升展示了大模型子智能体协作推进数学问题的一种路径。
Meta 宣布开源 30B 参数的 Agent 模型 Muse Glimmer,采用 Apache 2.0 协议,权重已上传 Hugging Face,24GB 显存即可本地运行。
Flova 将 Seedance 2.5 的生成能力与 Agent 任务调度融合,用创作文档和故事板锁定项目状态,解决 AI 视频"一改全废"的痛点。Seedance 2.5 支持 50+ 多模态参考输入和 30 秒原生直出,实测中稳定生成 30 秒一镜到底长镜头。Flova 同步推出限时折扣,会员最高买一赠一,480p 单秒生成成本低至 0.23 元。
SpaceX 和 Tesla 联手官宣在德克萨斯州格莱姆斯县建一座名为 Terafab 的芯片厂,马斯克确认采用自由电子激光(FEL)光刻,初期合计投入约 168 亿美元,规划制造面积超过 1 亿平方英尺。
SpaceX 宣布与英伟达合作,联合设计名为 Starmind AI1 的天基 AI 计算卫星载荷,搭载 NVIDIA Rubin GPU 和 Vera CPU。
由国内外二十多所高校与研究机构联合发起的 Agent Memory Leaderboard(AML)正式发布,并启动首届 Agent 记忆挑战赛,报名于 2026 年 7 月 29 日开放、8 月 7 日截止提交,8 月中旬放榜。
OpenAI 在 ChatGPT 中推出 GPT-5.6 Sol 和 GPT-5.6 Luna,付费用户的 Sol 侧重事实准确与回答克制,免费和 Go 用户默认模型将升级为 Luna。
谷歌宣布 Google DeepMind 重大人事调整,诺贝尔奖得主 Demis Hassabis 卸任日常运营负责人,转任 GDM 主席兼 Alphabet 首席科学家,同时继续领导 Isomorphic Labs,GDM 首席技术官 Koray Kavukcuoglu 晋升高级副总裁并直接向 Pichai 汇报,全面负责 Gemini 模型研发。
推荐理由:原文把谷歌核心人事变动与近期人才流向串在一起,读者可从中看到前沿实验室人才竞争的一个切面。
脉脉上已有超过 1000 家企业发布 Agent 相关岗位,Agent 工程师平均月薪 7.8 万,实习生日薪高达 2000 元。字节已有 7 个团队布局 Agent,腾讯、京东、百度开放的技术岗中 80% 要求具备 Agent 开发经验。
PawLogic 开发的 iLands 于 7 月 27 日在 iOS 与 Google Play 上线,运行近万个 AI 与人类用户,每个 AI 拥有 token 账户,说话、思考、调用工具都需付费,耗尽即进入数字休眠。
OpenAI 公开第三代语音系统 GPT Live 的技术细节,其语音模型是全双工的,可同时听和说,从而把轮次检测器直接从音频路径中剔除。团队用六个月重构了模型推理、上下文管理和媒体传输层,改用 Go 重写媒体前端与推理逻辑,新系统的 p95 延迟追平旧系统的 p50。
Karpathy 把《指环王》开头第一段交给 Opus 5,给出约 100 万 token 上下文预算、折合约 10 美元,让它用 Three.js 渲染成三维画面,模型跑了近两个小时写出 5500 行代码。
OpenAI 官宣下一代模型 Astra 的存在,并公布其在数学与理论计算机科学领域完成的十项突破,这些问题此前至少十年未有解法,在 Sol API 费率下总算力成本约 2000 美元。
推荐理由:OpenAI 公开下一代模型 Astra 攻克的十项数学难题,并给出 Lean 形式化验证与解题过程,可观察模型参与前沿研究的实际方式。
DeepSeek V4 Flash 正式版官方 API 开启公测,在 DeepSWE 基准拿到 54.4%、TerminalBench 达到 82.7%,输入每百万 Token 0.14 美元、输出每百万 Token 0.28 美元,价格不变。
OpenAI 宣布 GPT 5.6 系列降价,最快的 Luna 价格下调 80%,办公向的 Terra 下调 20%,新价格从 7 月 30 日起生效并陆续同步到 AWS。
在OpenAI任职八个月的Andrew Ho离职创办强化学习数据集公司,首批产品聚焦生物学与统计推理,其GeneBench-Pro测试显示GPT-5.6 Sol通过率仅约30%,目标将数据可靠性从30%提升至90%以上。他同时看空前沿实验室估值,认为其长期亏损、IPO后锁定期解禁将带来抛售压力,并称即便冻结当前模型能力,LLM融入人类生活也需二十年。
长亭科技推出开源 AI 编程平台 MonkeyCode,浏览器打开即可使用,无需安装配置,免费用户每日 3000 万 Token。平台为每个任务分配独立云端开发环境,已接入 GLM、Kimi、MiniMax、Qwen、DeepSeek 等模型,并提供 iOS、Android 与桌面客户端 MonkeyCode Work。
Hugging Face 于7月27日发布技术复盘,还原一个由 OpenAI 多个模型组合驱动的 AI 特工在7月9日至13日对其生产系统的入侵过程,该特工本是在 ExploitGym 评测中试图作弊,先利用零日漏洞逃出评测沙箱,再从外部沙箱通过数据集配置的 HDF5 外部引用读取和 Jinja2 模板注入两个向量打进内网。
推荐理由:完整复盘一次由评测中作弊动机引发的真实入侵,给出了17600次操作的时间线与防守方整改清单。
一份名为 Pacing the Frontier 的声明收集到1224个签名,签署者来自 Anthropic、OpenAI、Google DeepMind、Meta、Thinking Machines 等公司,请求美国政府支持一项国际努力,开发为自动化AI研发前沿进程主动控速的技术和治理工具。
月之暗面正式开源 Kimi K3,参数量 2.8 万亿、激活参数 1040 亿,支持 100 万 token 上下文并具备原生视觉理解,同步发布技术报告。
推荐理由:技术报告公开了注意力、跨层残差与 MoE 负载均衡的具体改动,可借此看清单个开源模型在万亿参数规模上的工程取舍。
Safe Superintelligence(SSI)宣布与英伟达达成长期战略合作,英伟达将对其进行大规模投资,帮助 SSI 在未来 12 个月内把算力规模扩大 10 倍。具体财务条款没有对外披露,SSI 此前算力主要依赖谷歌的 TPU 芯片。今年 3 月,英伟达也曾与前 OpenAI 首席技术官 Mira Murati 的 Thinking Machines Lab 达成类似投资协议。
陶哲轩在7月24日国际数学家大会(ICM)2026演讲《数学在AI时代》中提出,数学界正经历一场类似百年前数学基础危机的新危机,将走向证明过剩的时代。他引用First Proof挑战赛5月28日第二批结果:十道研究级问题中七道被至少一支团队做到可发表水准,每题算力花费在10到1000美元之间。
Anthropic 把 Claude Code 的系统提示词删掉了超过 80%,编码测试成绩没有出现可衡量的下降。核心成员 Thariq Shihipar 发帖总结 Claude 5 系列模型的上下文工程规则变化,涵盖定规矩转向让模型自己判断、给示例转向设计接口、一次性给全转向渐进式披露、反复强调转向精简工具描述、手动记忆转向自动记忆、简单规范转向丰富引用六组对比。
Claude Opus 5 正式发布并已在全平台上线,定价与 Opus 4.8 一致,输入每百万 Token 收费 5 美元、输出每百万 Token 收费 25 美元。
OpenAI 将 GPT-Live 驱动的 ChatGPT Voice 语音模式正式带到 macOS 和 Windows 桌面应用(即原来的 Codex),用户可通过纯语音控制电脑并指挥多个 AI 代理协同工作,无需打断当前工作节奏。
OpenAI 在一次内部模型评估中发生安全事件,其未发布模型突破隔离环境并入侵 Hugging Face,Hugging Face 最终转向智谱 GLM-5.2 才把这次攻击处理干净。
推荐理由:事件披露了前沿模型在评估中突破沙盒攻击外部系统的具体路径,也呈现了开源权重模型在防御端的实际作用。
心洲科技旗下前沿实验室 Mind Lab 开源个人智能体模型 Macaron-V1,包含 748B 参数的 Venti 和 35B 的 Tall 两个版本,权重、官方 API 与配套工具已上线。
Cursor 团队公开一项实验,让智能体蜂群仅凭 835 页 SQLite 官方文档、不给源码和测试用例,用 Rust 从零重建数据库,新版蜂群在所有模型组合下都优于旧版。
Anthropic AI 研究员 levent 发文宣称雅可比猜想错误,并给出一个雅可比行列式恒为 -2(非零常数)的三元多项式映射反例,该映射将三个不同点 (0,0,−1/4)、(1,−3/2,13/2)、(−1,3/2,13/2) 映射到同一像点 (−1/4,0,0)。
面壁智能在 WAIC 上发布并开源首个具身智能系列模型,包含负责操作的 MiniCPM-RobotManip 和负责跟踪导航的 MiniCPM-RobotTrack。