跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 27 天前AI 评分45
AI 导读

一条 102 分钟视频被指标题党,实际内容是对齐斯坦福 CS336 的大模型训练硬核课,把造模型拆成 5 道工序。课程覆盖 BPE 分词、数据清洗流水线、Scaling Laws(Llama 3 405B 配 15.6T tokens、约 40 tok/param)、SFT+Reward Model+PPO 对齐,以及 bf16 计算、fp32 存权重的万卡集群系统实践。

正文

先把话挑明:原推说这视频是“两小时教你用 Claude 做自动化”,完全是误导人的标题党。

如果你只想学怎么点开网页写提示词、接个飞书脚本,这条 102 分钟的视频千万别看,你一定会觉得枯燥;
但如果你想彻底搞懂 ChatGPT、Claude 背后那台昂贵的超级发动机到底是怎么造出来的——
这是我今年看过把“大模型工厂内部流水线”讲得最透的一堂斯坦福硬核课(对齐 Stanford CS336)。

没有玄学魔法,它把造一个现代大模型拆成了 5 道带血的工业工序:

1️⃣ 分词(Tokenizer):
为什么既不能按词切、也不能按字切?BPE(字节对编码)怎么用算法把 1PB 语料压成最高频的子词词表,既防 OOV 乱码,又保住计算显存;
2️⃣ 洗数据(Data Pipeline):
“吃下全网数据”是骗外行的口号。真活是从 HTML 里剥广告、做语义去重、启发式过滤、再用 Wikipedia 引用模型当裁判,最后做退火加权;
3️⃣ 扩展定律(Scaling Laws):
为什么是 Transformer 而不是 LSTM?Llama 3 405B 为什么配 15.6T tokens?模型参数与数据量大约 40 tok/param 才能把算力压平,不是无脑堆越大越好;
4️⃣ 对齐(Alignment):
预训练出来的只是无脑续写器。SFT 教它说话格式,Reward Model 教它人类品味,PPO 把它推成听话的商业助手;
5️⃣ 系统与算力(AMP):
万卡集群为什么能跑动?算的时候用 bf16 榨干 Tensor Core,存核心权重用 fp32 防累积误差。

大模型不是神迹,它是一座极其严密的现代重工业流水线。
花两个小时把底层骨架看懂,以后全网 99% 的大模型吹水和营销号套路,你一眼就能看穿。

完整 102 分钟时间戳导航、核心公式和斯坦福原课大纲,我整理在一楼了👇 https://t.co/o2v4gTFMti

来源:@AYi_AInotes · x.com