清华联合 MIT 等机构发布 ASI-Bench,用信息梯度评测 AI 科研自主性
清华大学助理教授陈勇超联合 MIT、哈佛、CMU、中科大、微软研究院等十余所机构发布 ASI-Bench,一个衡量 AI 科学自主性的基准测试,首版含 60 道覆盖数学、物理、生物等 11 个领域的项目级任务。
按公众号阅读文章与观点
清华大学助理教授陈勇超联合 MIT、哈佛、CMU、中科大、微软研究院等十余所机构发布 ASI-Bench,一个衡量 AI 科学自主性的基准测试,首版含 60 道覆盖数学、物理、生物等 11 个领域的项目级任务。
OpenAI 公布了首颗自研推理芯片 Jalapeño 的公开基准跑分,称在 SemiAnalysis 的 InferenceX 测试中,峰值吞吐量下每瓦处理的 AI 任务量是英伟达 GB200/GB300 的 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍。
网易 UU 被推荐为比向日葵、TeamViewer 等更好用的远程控制软件,支持多 APP 切换,可同时使用 Codex 和 Claude Code,也能操作 Chrome、Finder 等应用。它还支持自定义无数个快捷键、调节帧率和清晰度以省流量省电量,并可为远程电脑设置屏保,唯一不足是语音输入不太好用。
Vibe Coding 不是"傻瓜式 Coding",遇到不懂的概念应当直接向 AI/Agent 追问,直到弄懂为止。文章指出,AI/Agent 不会嘲笑提问者,会用文字、图片、视频、音乐等各种形式解释 VPS、Database、CI/CD、OAuth、K8S 等技术概念,并称目前国内外一线模型的平均能力已超过普通人需求的上限。
《华尔街日报》长文讲述中国AI追赶路径,主角是清华师生唐杰与杨植麟,二人创办的智谱和月之暗面估值均达几百亿美金。文章认为,清华五道口一带的高信任网络把"找人、认人、信人"的成本压到接近于零,这种关系靠四十年三代人积累,难以复制。中国模型在Hugging Face下载量占比过半、累计超一百亿次,OpenRouter token份额今年四月超过45%,竞争正从能力转向默认标准。
香港大学吴延晖团队与斯德哥尔摩大学 David Strömberg 团队在预印本论文《生成式人工智能学习惩罚:中国中学的证据》中追踪中国中部一县城九所中学 26811 名初高中生 30 个月的学业表现,发现使用 AI 后日常作业成绩平均提升 18%、用时缩短 30%,但六个月内月考成绩下降 20%,两年后中考、高考成绩可能分别下降多达 24% 和 18%。
聆动通用在科大讯飞孵化下推出工业具身机器人 LDB01,联合讯飞研究院打造统一多模态具身大模型 iFLYTEK-Embodied-Omni,并已拿到国内首张工业级具身机器人 CR 认证和欧盟 CE-MD 认证。其 LDB 在物流分拣场景正逼近 80-90% 工人人效,平均无故障工作时长不低于 7000 小时,2026 年预计交付约 200 台。
字节发布面向工作场景的客户端豆包工作,上线即赠送一个月标准会员,已购会员免费顺延一个月。该产品可获取飞书中的群聊信息、会议纪要和文档,管理日历、建群拉人,并内置覆盖法律、新媒体、编程等场景的 MCP 连接器与 skill,支持文档、表格、PPT 生成、网页与应用搭建及 Computer Use,其中 Computer Use 针对 Windows 做了优化。
面壁智能发布「前进四」顶尖人才计划,符合条件的顶尖技术实习生可在毕业前按当期估值提前授予期权,并担任明星项目核心技术骨干。截至今年8月,MiniCPM 系列全球下载量突破 4400 万次、GitHub 星标超 15 万,MiniCPM 已搭载三星旗舰机上市。今年5月发布的 ForgeTrain 是全球首个完全由 AI 编写、零人类代码介入的生产级大模型训练框架。
Mila、蒙特利尔大学、A*STAR、牛津、剑桥、清华等 16 家机构 22 位研究者提出 ComBodied Agents(伴身智能体),一种以人的长期状态与主体性为优化对象的 Agentic AI 新范式。论文给出人类状态感知、纵向记忆、个人世界模型(PWM)与干预规划四项能力构成的闭环框架,并提出 CombodiedBench 评测蓝图与 edge-native 本地优先部署路径。
a16z 合伙人 Martin Casado 称刚获得一个新模型访问权限,并称这将是今年最重要的模型发布。多条线索指向 Ilya Sutskever 创立的 SSI 的首款模型,Andrew Curran 提到有一家非头部实验室在持续学习上取得突破,但该消息尚未验证。SSI 于 2025 年完成 20 亿美元融资、估值 320 亿美元,7 月与英伟达达成合作并获得 Vera Rubin 硬件。
AMI Labs 创始科学家林敏与 Mind Lab 创始人 Andrew Chen 在新加坡 AGI Playground 2026 对谈持续学习:林敏主张失败轨迹与无标签信息应进入世界模型预训练,Andrew 则用 LoRA 把经验写入参数,其团队已把 LoRA 扩展到 10⁶ 百万级,发现协作性能与模型数量对数近线性相关。林敏称短期悲观、长期乐观,认为人类水平的持续学习仍需根本性突破。
Tibo 宣布 GPT-Plus 订阅($20 档)将在明天恢复 5 小时限额,Pro 订阅($100 和 $200)则继续保持无 5 小时限额状态。
腾讯研究院高级研究员王焕超撰文提出,超级个体是真概念,超级团队是伪概念,因为一切协作成立的前提是判断可以让渡。文章引用林格尔曼效应、斯坦纳的生产力公式和布鲁克斯定律,说明团队合力始终小于分力之和,沟通路径随人数平方增长。作者认为超级个体需要的是单一意志加多个执行体的编队,而 AI 作为执行体的对齐成本很低,能力因此从必须靠团队补全变为可以随时调用。
宇树科技8月19日登陆科创板,发行价150.80元、开盘报1100元,市值一度冲到4449亿元;到8月24日第四个交易日收报603.08元、市值2439亿元,较首日盘中高点回撤超过45%,蒸发约2000亿元。
黄仁勋女儿黄敏珊在2026世界机器人大会开幕当天走访北京亦庄,参观越疆、光轮智能、优必选等机器人公司,她现任英伟达物理AI平台产品与技术营销高级总监,工作覆盖Omniverse、Cosmos、Isaac及人形机器人基础模型GR00T。
Tutti · VM 于 8 月 24 日发布,官方称其为行业首个实况级多人、多 Agent 实时协作空间,目前支持 Claude Code 和 Codex。它让每个人的 Agent 继续跑在自己电脑上并沿用已有订阅与 skills,指令经多层虚拟化后由系统决定发往物理机、本地虚拟机或云端,协作者在云端共享同一运行时环境。
新加坡国立大学与牛津大学的研究者提出视频表征自编码器 V-RAE,以冻结的视觉基础模型作编码器,通过轻量级 temporal attention pooling 实现 4× 时间压缩,把预训练视觉表征直接用作视频生成的 latent space。
原方智能(Cirquar AI)正式启动,由南京大学 LAMDA 实验室博士生林浩鑫与机器人学院助理研究员唐开强共同创立,将世界模型确立为核心技术路线。公司称其技术积累源于 LAMDA 团队自 2018 年起围绕环境模型、因果世界模型和具身世界模型的八年研究,2026 年进一步提出 VLA-MBPO,在交互式世界模型中训练视觉—语言—动作模型。
8 月 23 日,奥特曼在 David Senra 的播客中谈到 OpenAI 内部资源取舍,称 Sora 本身是好产品但太吃 compute,同期 Codex 优先级更高,算力和团队投入开始向 Codex 倾斜。
字节跳动正式发布办公 AI 产品豆包工作,可用手机号或飞书账号登录,并在权限范围内读取飞书云文档、多维表格、群聊和会议纪要。8月24日,TRAE 与扣子(Coze)团队已整体并入豆包体系;豆包工作提供独立客户端、电脑版和飞书三个入口,支持操作电脑、生成应用、交付 Office 文件、Skills 与定时任务,系统另有 200 多个技能和连接器。
豆包工作作为面向生产力场景的 Agent 产品正式发布,电脑版可免费领取 30 天订阅权益,老订阅用户顺延 30 天。该产品采用独立应用与全新 Logo,支持飞书企业账号一键登录,实测中可直接读取飞书群聊与云文档梳理选题线索,并把结果同步到多维表格。
据 Axios 报道,机器人通用大脑公司 Generalist 在今年 6 月完成 4 亿美元 B 轮融资后不到三个月,又完成新一轮 2 亿美元融资,最新估值超 20 亿美元,英伟达、Bezos Expeditions 和李飞飞出现在股东行列。
Vercel 正式推出 v0 API,开发者可用提示词让 v0 生成和修改应用文件,在 Vercel Sandbox 中运行并获得可嵌入自有界面的预览 URL。
斯坦福 CRFM 的开放基础模型项目 Marin 已启动 Marin 535B-A23B 训练,总参数约 5350 亿、每 Token 激活约 230 亿,计划处理 18.75 万亿 Token,运行在 11 套 NVIDIA GB200 NVL72 上,预计持续约 3 个月。
Calendly 公开其内部 Agentic Engineering 实践:Agent 先审查 Jira 需求、拆解任务,再并行写代码、跑测试并做 QA,人类只负责最终 Review 和 Merge。
得物推荐团队在 AICon 分享如何把 AI Coding 扩展为覆盖需求、开发、验收与复盘的 PDCA 全链路方法,涉及 TPRD、七阶段护栏、三层知识体系和 Highway + ATV 混合 Agent 架构。
Codex 团队 Tibo 在 Matthew Berman 播客中首次公开解释额度重置的做法,称其并非营销策略,而是在产品出问题或体验不达预期时补偿用户,由他个人判断决定。
Vercel 发布 Next.js 16.3,为 16.0 之后最大的一次更新,Turbopack 在 next dev 下的内存占用最高减少 90%,CI 环境中重复构建速度最高提升 5.5 倍。
OpenAI Codex 产品负责人 Tibo 在播客中确认,用于全局重置用户额度的按钮是真实存在的物理实体,他可在认为合适时随时按下。他透露 ChatGPT 与 Codex 将因未来模型需求而合并,不再区分技术用户与普通用户。他还称常规推理速度较三个月前提升约 60%,工具调用少的场景可获十倍以上提速。
前剪映中国负责人 Kiki 张琪智创办的 AI 产品原型设计工作台 OJO 完成近亿元人民币首轮融资,由顺为资本、联想创投联合投资,并于 2026 年 8 月 18 日面向海外上线。
北京两名16岁高中生张睿修与冯子上在校内成立炼丹社,把自购的RTX PRO 6000、Mac studio和争取到的API额度搭成FreeAPI共享服务,供全校同学免费使用。该API站点目前提供三个对话模型,以及文本向量、联网搜索和视频生成能力,社团已有30多名成员。两人还计划为学校重建校园网站,并加入可检索全站内容的AI助手。
小米发布三颗玄戒芯片。玄戒 O3 是将在今年 9 月率先量产上机的旗舰 SoC,玄戒 O100 面向端侧大模型,玄戒 D100 面向智能驾驶与本地高算力设备,后两颗已完成回片验证、计划 2027 年正式商用。
英伟达向AI初创公司Poolside投资10亿美元,并另付60亿美元买下其模型工厂技术的非独家使用权,还希望将该公司100多名工程师招致麾下。该交易采用非独家许可加核心人才招揽的结构,不构成直接收购,因而无需接受反垄断审查。Poolside由GitHub前CTO Jason Warner等人于2023年创立,其模型工厂体系可在70人以内团队规模下,用5至8周把一个模型从训练推进到发布。
字节跳动已入股家庭通用机器人公司未来不远最新一轮融资,该公司半年内完成3轮融资、累计超10亿元,投资方还包括汇川产投、国方创投、德宁资本、纳爱斯等近10家机构。其第二代全栈自研机器人本体F2搭载全新一代自进化WAM世界动作模型,已在WRC上完成7步肉酱意面端到端闭环烹饪,目前机器人已进入全国500多个家庭商业化使用。
量子位面向 AI 产业、AI 财经、AI 产品三个方向招聘编辑、主笔、主编,岗位均在北京中关村全职,校招接受实习且可转正。产业方向关注芯片、AI Infra、云计算,财经方向关注创投与财报,产品方向关注 AI 应用与硬件终端落地。简历投递至 zhaopin@qbitai.com,需附代表作品。
OpenAI Codex 负责人 Tibo 在 Matthew Berman 播客中表示,ChatGPT 与 Codex 最终会融合成同一个高度个人化的 AGI,界面按每个人的任务和习惯自动调整,下一代 Agent 会因笔记本电脑的算力限制走向云端。
原力灵机通用具身基础模型 DM0.5 在 RoboDojo 评测榜以 24.90 综合得分、19.34% 平均成功率双项第一,模型权重与训练框架全面开源。该榜仿真头部模型平均成功率仅 8.80%、人类专家为 76.03%,而 DM0.5 在 Memory 维度拿到 47.44% 成功率,约为第二名 12.11% 的四倍。
字节发布办公 Agent 产品豆包工作,可直接用飞书登录并继承企业的 AI 额度、文档、多维表格、知识库、聊天、邮件以及整套飞书权限系统。产品提供本地电脑和云电脑两种任务启动方式,企业付费用户可使用豆包 2.1 Pro,未付费只能用 Turbo。作者实测把它用于小红书达人视频数据的采集与多维表格写入,替代此前接入飞书 CLI 的 Codex 流程,并把它封装成可反复调用的 Skill。
NVIDIA 首次公布基于真实芯片的 Vera Rubin 性能测试结果。在 SemiAnalysis 的 AgentX 智能体代码推理工作负载上以 DeepSeek V4 Pro 运行。