跳到正文
@SemiAnalysis_· @SemiAnalysis_ · X·· 24 天前AI 评分33
AI 导读

这个数学描述的一个函数叫做 RoPE。它在现代 ML 中无处不在,被用于 DeepSeek 和 Qwen 等模型。我们构建了一个微型 Transformer,当我们通过 RoPE 编码给它位置信息时,它学习 Shakespeare 数据集的速度更快了。(3/7) https://t.co/fiG0srScov

正文

One function described by this math is called RoPE. It's ubiquitous in modern ML, used in models like DeepSeek and Qwen. We built a tiny Transformer that learned a Shakespeare dataset more quickly when we gave it positional information encoded via RoPE. (3/7) https://t.co/fiG0srScov

来源:@SemiAnalysis_ · x.com