Sakana AI 宣布成立 Frontier Intelligence Group(FIG)探索下一代智能范式
Sakana AI 正式公布公司内部的 Frontier Intelligence Group(FIG),主张智能尚未被解决,即使当前范式可通过规模实现 AGI,也仍需探索数据与能耗效率更高的另类路径。
Sakana AI 正式公布公司内部的 Frontier Intelligence Group(FIG),主张智能尚未被解决,即使当前范式可通过规模实现 AGI,也仍需探索数据与能耗效率更高的另类路径。
We built high-throughput materials labs in Menlo Park to create a loop between experiments and models. The labs generate fresh data, the models learn from it, and then help us decide what to try next. Using only 1,300 H200s, plus months of our experimental data, we mid-trained and RL’d an open-source model to surpass GPT-6 Astra on our analysis benchmark. We call it Neon. This is real footage from our lab. We’re focusing first on hard problems in materials science, including superconductors, magnets, and semiconductor materials. Read our blog posts below.
Sakana AI 提出 PC-ALM,一种仅靠局部动力学、无需反向传播即可训练 1000 层神经网络的局部学习替代方案。该方法将预测编码推广为使用增广拉格朗日,引入对偶神经元(拉格朗日乘子)参与层内动力学,使每层成为 PI 反馈控制系统以最小化局部预测误差。PC-ALM 能将信号传播到近乎任意深度,在标准预测编码难以学习的深层窄网络中尤其有效,并可能为神经形态硬件上的深度学习提供参考。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 长篇对谈,逐段讨论递归自我改进(RSI)最可能失败的技术原因、中国实验室的追赶路径、自动化 AI 研究者的训练方式以及长时程 RL 能否带来 AGI。
Google 推出 autofinetune,将自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
Anthropic 威胁情报团队发布报告,披露 2025 年 12 月至 2026 年 8 月期间在七个危害领域识别并处置的 Claude 恶意使用活动,涉及疑似国家支持组织、犯罪团伙、商业间谍软件供应商等。
推荐理由:报告用具体案例和数据说明AI如何改变网络攻击的成本与速度,并揭示AI供应链本身正成为攻击目标。
Dwarkesh Patel 发布研究,在最高 1e19 FLOPs 规模下组合 2019-2025 各年度代表模型配方与公开数据语料训练,发现数据改进带来 12.0x 计算效率增益、模型改进为 3.7x,数据贡献约为模型的 3.24 倍。两者收益基本独立,88% 的 OLMES 分数方差可由模型与数据的加性效应解释;作者提醒小模型更受益于数据精选,而大模型的关键作用在于让大规模计算可用。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组约 90 亿个单核苷酸变异的分子效应预测,数据规模 1 petabyte,超过 AlphaFold Database 30 倍以上。
推荐理由:官方平台发布,覆盖 90 亿个单核苷酸变异预测并附应用案例,可用于了解基因组变异数据资源的最新规模与获取方式。
Hugging Face 发布一份完整教程,用 TRL 库的 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,在 IFStruct benchmark 上从 22.6% 提升到 29.7%。
推荐理由:原文给出完整可复现的 GRPO 微调流程和前后对比数据,读者可以照着用免费 GPU 把小模型的结构化输出提升约 7 个百分点。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,用于从 EMIT 高光谱卫星数据中自动检测甲烷羽流并定位排放源。
Pyromind 创始人兼 CEO Kevin Ding 在播客中提出,RL as a Service 只解决一半问题,真正让 Agent 在生产环境持续改进需要把训练、奖励、反馈、部署和数据回流串成自动循环管道,即公司押注的 AutoRL。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中的 7 项超过其 bfloat16 全精度版本。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量加速。多校团队提出 SPADE 自博弈框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
在捍卫 AI 开放性的斗争中,Marin 项目是模型训练开放性的一份珍贵示范——开放代码、数据、配方,甚至实验结果。公开分享 AI 研究曾是常态;我很感激 @percyliang 的开放实验室做法。
🚢 Marin 535B-A23B started training this week! As usual, the whole process is open. Voyage plan: pretraining (80%) + midtraining (20%) on 18.75T tokens on 11 x GB200 NVL72 for ~3 months (2.7e24 FLOPs). Post-training will follow. Before kicking off the run, we trained a 4-rung scaling ladder from 1.6B-A61M (48B tokens) to 27.7B-A1.2B (926B tokens) to debug issues, and to make a forecast of our hero run. This is by far our biggest run, so definitely expecting the unexpected.
An excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers by routing each token to only 1 out of 2048 experts (in retrospect, a bold choice). The model had fewer than 3B activated parameters, but 1.6T total parameters (comparable to today's frontier models). The 1.6T model achieved better C4 perplexities than the T5 models using far less compute, set a new SOTA on TriviaQA, but was dumb as bricks on reasoning tasks like SuperGLUE. The lesson was that the optimal tokens-per-parameter ratio is highly task-dependent. Or as @NShazeer had already intuited: FLOPs were intelligence; parameters were knowledge!
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Miles 是结合 SGLang 做 rollout 生成、Megatron-LM 做训练的高性能强化学习框架,其 disaggregated 架构下 rollout 数据需从推理侧传到训练侧。
LMSYS 与生态伙伴发布 Miles v0.1,一个基于 slime 设计的全栈生产级后训练系统,目标是让前沿规模 RL 训练更易用。
推荐理由:官方完整走读 Miles 的 RL 训练环路与关键数字,读者可据此评估它是否适合承担自己的前沿规模后训练任务。
Nathan Lambert 撰文分析开源 AI 的经济结构,区分附带完整训练配方的开源语言模型与仅含权重和使用代码的开放权重模型,指出 Nvidia 投入 260 亿美元打造近开源 Nemotron 模型意在让更多人自建模型、扩大其芯片需求。
Nathan Lambert 完成后训练教科书《Reinforcement Learning from Human Feedback》后撰文指出,LLM 在长篇非虚构写作上进展停滞,能校对 200-300 页书稿的细微错误、辅助编辑和同步 Markdown 与 LaTeX 版本,但组织整章内容时仍混乱并累积概念错误。
Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。
推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。
Nathan Lambert 宣布其由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》开始发售,8 月 19 日前用代码 PBLambert 在 Manning 可享五折。
Dwarkesh Patel 提出持续学习到来后的 8 项预测,认为模型仅在会话间写 Markdown 无法积累执行整份工作所需的经验,经验必须沉淀进权重。他据此推论部署前安全检查将失效、对齐技术需重构、领先实验室将靠部署数据加速拉开差距,并以 Anthropic 内部自 2 月起使用 Mythos、6 月才公开发布的 4 个月差距为例说明先发部署的学习优势。
Meta 工程博客介绍其广告排序的多阶段序列建模架构与论文 LLaTTE:离线用户模型异步处理数千长度序列并缓存嵌入,在线排序模型结合实时信号完成打分。
Miles 为 MoE 专家实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8 与逐 token NVFP4,覆盖 rollout、前向传播、权重梯度与数据梯度 GEMM,并支持检查点转换、Megatron 训练、SGLang rollout 与在线权重更新的细粒度精度控制。
SGLang 在 issue #15194 中提出量化栈重构方案,将原本由单一类承担的量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式解析与硬件后端执行解耦。
SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。
推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。
Google Research 与 Google DeepMind 在 Nature 发表研究,用强化学习智能体根据量子纠错检测事件持续调整控制参数,在计算过程中对抗漂移,无需中断计算。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并通过稀疏 student-to-teacher 打分避免 O(R²K) 的密集 payload。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的分数函数被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
UC Berkeley 的 Aditya G. Parameswaran 等人发表观点文章,认为近零推理成本时代将重塑数据系统研究。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),图像统一以 JPEG quality 92 编码。
NVIDIA 推出 ENPIRE 框架,让编码智能体自主为真实机器人开发策略,在 PushT、整理插针、用切割器剪断扎带等任务上达到 99% 成功率,测试中还尝试了往主板插 GPU。
Dwarkesh Patel 撰文认为,实验室押注的 RLVR 训练未必能泛化到无法在数据中心内复现的现实领域,因为训练样本效率低且缺少可重放模拟器。
推荐理由:作者论证 RLVR 难以泛化到不可复现的现实领域,并梳理 OPSD 与模拟训练等让模型在工作中持续学习的可能路径。
Dwarkesh Patel 撰文认为,近几年 AI 进步主要来自更宽更好的数据分布和 RL 合成数据,而非样本效率提升。他估算人类从出生到成年只接触约 2 亿 token,前沿模型却训练于数十至数百万亿 token,差距近百万倍;按 Chinchilla 常数,即使无限增加参数也只能将所需数据降低约 10 倍,说明人类处于不同的 scaling 曲线。
Import AI 460 期汇总多篇研究。KCL、复旦与 Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的制度漏洞。