当模型开始学习:Test-time training 如何改变 AI 经济学
When Models Learn
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Test-time training 让模型在使用过程中持续更新权重,而非训练结束即冻结。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能让 4b 模型无需重训达到 128k 上下文的竞争力。该方案将历史折入固定大小的权重,内存不再随上下文线性增长,但每个用户需独立模型副本,成本从内存转向算力与芯片。
来源:Tomer Tunguz · tomtunguz.com