菲尔兹奖得主 Gowers 称 AI 突破数学猜想主要靠找反例
1998 年菲尔兹奖得主 Timothy Gowers 在博客中复盘近几个月 AI 的数学战绩,发现这些突破大多走的是构造反例或特殊对象的路线,例如 OpenAI 内部模型解决的 Erdős 单位距离问题,以及数学家 Levent Alpöge 借助 Claude 找到雅可比猜想相关问题中的反例。
按公众号阅读文章与观点
1998 年菲尔兹奖得主 Timothy Gowers 在博客中复盘近几个月 AI 的数学战绩,发现这些突破大多走的是构造反例或特殊对象的路线,例如 OpenAI 内部模型解决的 Erdős 单位距离问题,以及数学家 Levent Alpöge 借助 Claude 找到雅可比猜想相关问题中的反例。
阿里巴巴推出 AI 音乐模型产品 HappyShrimp 1.0(快乐虾米),主打文本生成音乐,用户用日常语言描述人物、故事、情绪和场景即可生成完整歌曲,也支持纯音乐模式。
Alaya Lab、中国科学技术大学与上海创智学院联合推出视频世界模型 Alaya-EVOKE,展示连续生成 120 分钟、4800 个片段、172800 帧的一镜到底视频,并开源了项目主页、代码仓库和模型权重。
OpenAI 内部设有一个 friction@openai.com 邮箱,员工遇到技术故障、流程失灵甚至停车位不足都可上报,重要问题可能直接惊动 CEO 山姆·奥特曼或总裁格雷格·布罗克曼。
Current Robotics 发布 CurrentWorld-0,称其为全球首个将跨本体、多视角与力触觉预测整合进同一世界仿真器的物理世界模型,可建模移动机器人、双足人形与灵巧手,并处理柔性物体和流体。该模型不靠人工编写物理公式,而是从真实交互数据中学习动作后果,用于机器人策略评测,并支持人类遥操作接管失败状态、回滚生成新训练数据。
量子位面向 AI 产业、AI 财经、AI 产品三大方向招聘全职编辑作者,岗位覆盖编辑、主笔、主编各层级,社招与校招均可,工作地点为北京中关村。AI 产业方向关注芯片、AI Infra、云计算,财经方向关注创投与财报,产品方向关注 AI 应用与硬件终端落地。简历投递至 zhaopin@qbitai.com,需附科技行业代表作品。
OpenAI已正式解散负责评估灾难级社会风险的Preparedness团队,官方称安全工作已融入开发流程。该团队2023年10月成立,曾制定27页应急准备框架,按矩阵方法对前沿模型风险分级,规定只有评分为「中」或以下的模型才能部署。
Symbiosis Robotics(共生知行)发布 Direct Perception Control(DPC),取消需独立 Whole-Body Tracker 追踪的中间运动表示,直接由画面、任务和身体反馈计算关节与手部目标。
Manifold AI(流形空间)创始人武伟在访谈中表示,公司押注隐空间世界模型路线,已发布 RoboScape、WorldScape 与 WorldScape Policy,其 WorldScape 于 2026 年 4 月在 WorldScore 榜单总分居首。
清昴智能将清华朱文武团队2022年提出的自我驱动机器学习路线落地为AI Infra,其自主优化系统把复杂算子开发调优从两周压缩至约1小时,效率提升约336倍,国产芯片全链路打通从一个月缩短到1天至1周,提速约30倍。该公司已完成数十款国产芯片适配,覆盖国内超半数主流国产算力芯片,并以卖Token和卖产线两种模式交付基于国产芯片的万亿Token工厂。
Stripe 已敲定收购 OpenRouter 的协议,交易价格超过 70 亿美元,而 OpenRouter 在 5 月的 B 轮投后估值仅为 13 亿至 15 亿美元,不到三个月溢价约 5 倍。
COLM 2026 上三篇论文分别从长上下文、反向传播和推理链三个角度,重新检验 Transformer 中被当作标配、少有人质疑的架构设计。
香港大学与超维动力KAI团队组成的港大超维战队用自研SMASH 2.0系统,让两台人形机器人按11分制规则自主打完一局乒乓球,全程无遥控、无人喂球。相比1.0,SMASH 2.0把击球范围扩展到长球和短球,并加入自主发球,以支持完整对局。团队将在8月22日至26日于国家速滑馆冰丝带举行的第二届世界人形机器人运动会上,使用统一要求的智元远征A3本体参赛。
藏师傅自制的 PPT Skill 与社交媒体卡片 Skill 已上架千问「办公助理」,并与千问进行了深度合作和优化。作者用之前写的一篇文章实测,系统会先让选择主题颜色和页数,再逐页复核并修复问题,前后耗时几十分钟。使用路径为千问首页进入「办公助理」,在左侧「技能」中搜索「归藏」或「归」添加,电脑端需在官网下载最新版,手机端更新应用市场版本即可。
Bun 创建者 Jarred Sumner 启动约 50 个 Claude Code 工作流,用 11 天把 Bun 从 Zig 移植到 Rust,生成超过 100 万行 Rust 代码,按 API 定价成本约 16.5 万美元,他还称该项目在所有受支持平台上 100% 通过了 Bun 自身的测试套件。
推荐理由:11 天、约 16.5 万美元完成 50 万行代码的语言迁移,Zig 创始人的质疑让 AI 生成代码的审核边界成为讨论焦点。
Qwen3.8-27B 以 Apache 2.0 协议开源,是一个 27B 参数的原生多模态稠密模型,在 Agentic Coding、LiveCodeBench v6 等评测上得分高于 Claude Opus 4.6 Max,原生支持 262K 上下文并可通过 YaRN 扩展至 100 万 token。
RoboScience 机器科学发布首款轮式仿人形通用操作机器人 REX G1,搭载自研 VLOA 架构通用具身大模型 Visics,面向物流、工厂、零售及家庭场景。
腾讯 DataBuddy Harness 工程负责人彭锦文将在 8 月 21 日—22 日举办的 AICon 深圳站分享《DataBuddy:数据语义驱动的企业 Agent Runtime 设计与落地》,拆解 DataBuddy 如何用一套 Agent Runtime 回答执行可控、语义可信、系统可进化三个核心问题。
具身智能行业从VLA与世界模型的路线之争转向“路线混搭”,WAIC 2026上展示的模型已从去年以VLA为主变为“世界模型+VLA”占绝大多数。
openJiuwen 将旗下蜂群智能体升级为 WorkSwarm,率先上架鸿蒙 PC 应用市场,并支持 Windows、Mac 等平台。WorkSwarm 提供单 Agent 与集群两种模式,可自主组队、共享上下文并接力成果,集群模式下 20 分钟交付 200 页 PPT,还能在 Code 空间完成 ArkTS 应用开发。openJiuwen 社区官网已上线体验环境并提供海量免费 Token。
Anthropic 联合创始人兼 CEO Dario Amodei 于 8 月 16 日在 X 发文,称公众对 AI 的负面情绪根源于一场信任危机,AI 公司尚未兑现让世界变好的承诺,该帖浏览量已超 1000 万。
Prime Intellect 提出多智能体 Harness 方案,让更便宜的开源模型负责监控和具体实现,把需要判断的环节留给更强模型。
Noiz AI 联合来自香港科技大学、清华大学、CMU、Google DeepMind 等机构的研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时画面生成与 48kHz 双声道音频输出。
RoboScience 机器科学发布首款轮式仿人形通用操作机器人 REX G1,搭载自研 VLOA 架构通用具身大模型 Visics,面向物流、工厂、零售及家庭场景。
在 OpenAI 工作十年的 GPU 内核工程师 Scott Gray 把社交账号简介改为「Former GPU geek at @OpenAI」,被广泛报道为已离职,他本人和 OpenAI 均未发声。
拉格朗日具身技术自研 Agentic OS,为 Agent 提供环境状态感知、机器人技能调度、安全边界约束与人工接管机制,让任务以结果验证而非指令下发为终点。其采用分层智能架构:高层 Agent Harness 组织通用模型与 Coding Agent,现场 Agentic Runtime 负责任务编排与异常恢复,设备侧专用模型守住精度与安全。
1998年菲尔兹奖得主 Timothy Gowers 复盘近几个月 AI 的数学成果,认为其共同点是构造反例而非正面证明,OpenAI 内部模型为 Erdős 单位距离问题找到反例,数学家 Levent Alpöge 借助 Claude 找到雅可比猜想相关问题中的反例。
OpenAI 的 Tibo 公布了在 Codex 中为 GPT-5.6 Sol 开启 1M 上下文的配置方法,该能力此前仅限 API,现在 ChatGPT 和 Codex 账号也可使用。
AI科技评论把一张破碎陶罐截图和分镜文字交给本地部署的 MiniMax H3,测试它能否反向生成陶罐破裂的完整过程,并与 Seedance 2.0 Fast 做同题对比。
北京大学、阶跃星辰与北京邮电大学联合提出 TensorCast,在计算引擎、网络与存储之间引入统一可编程的张量生命周期管理抽象层,将模型权重、KV Cache 等张量状态从具体系统中解耦。
智象未来发布原生全模态交互式世界模型 HiDream-O1-World,基于自研原生全模态 UiT 架构,支持文本、图像、交互等多模态输入,可生成具长时空一致性和物理一致性的动态世界。
前 OpenAI 首席产品官 Kevin Weil 正为其新公司募资 1.5 亿美元,估值达 7.5 亿美元,公司尚未公开名称,定位是"为 AI 模型收集科学数据"的平台。
DeepSeek 于 8 月 13 日开放 DeepSeek Harness v0.1 Developer Preview,截至 8 月 14 日下午在 GitHub 已获 4.5 万星。
美国被曝计划致函6月签署《人工智能机遇伙伴关系联合声明》的30多个签署国,要求其在中美AI竞赛中选边,否则将被排除在美国主导的“AI联盟”之外。DeepSeek V4全系列正式版上线,API采用峰谷定价,高峰时段V4-Pro输出27元/百万Token,闲时减半至13.5元,8月17日0时生效。
这篇文章梳理AI基建从债务驱动到表外影子贷款的风险链条,认为第三方GPU租赁与新型算力云公司是最可能爆雷的环节。文中提到英伟达联合Apollo、BlackRock、Goldman Sachs、KKR等机构撬动超5000亿美元第三方资本投向AI计算基建,并把CoreWeave称为“AI云计算行业的恒大”,其债务股本比达13.8。
数字生命卡兹克梳理了 RealReplicaBench、DeepSWE、E-Bench、VibeLifeBench 等多套真实工作场景评测集,指出 Agent 在这些任务上的成功率远低于 Coding 场景。
大连理工大学、Alaya Lab 与东京大学团队联合提出 Vinci2,把第一人称视频助手的主动服务形式化为基于持续视频流的决策与生成联合任务,论文已被 ECCV 2026 接收。
开源项目 watermarks-remover 发布五天在 GitHub 获 11k Star,可去除 Claude、Gemini 和 OpenAI 的 AI 水印。
李飞飞在 Huberman Lab 最新访谈中表示,AI 在医疗、影视、教育等领域都不是人类的替代者,而是个人能力的放大镜。她回顾了 ImageNet 千万级图片数据集推动 2012 年现代 AI 转折、2016 年算法图像识别准确度首次超过人类,以及 2022 年 ChatGPT 问世等节点,并强调不能让少数科技企业替整个社会做决定。
奥特曼在访谈中称,ChatGPT 下一代模型预计半年内实现,可持续观察电脑屏幕、记录每场会议与通话,并在授权下接入短信、邮件、文档和协同办公软件,掌握用户完整上下文。该模型定位为主动协作者,不替用户做决策,而是整理信息、提示疏漏,首批目标用户是创业公司 CEO。