Olmo Hybrid 与 Olmo 3 对比:混合模型在哪些 token 上预测更好?
Which tokens does a hybrid model predict better?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
艾伦人工智能研究所(AI2)用 7B 的 Olmo 3 与 Olmo Hybrid 逐 token 对比,发现混合模型在承载语义的实词(名词、动词、形容词)上损失差距约 0.04,在虚词上约 0.02,优势最大;但在闭括号和逐字重复输入内容的 token 上优势几乎消失,后者正是 transformer 的强项。
来源:Hugging Face Blog · huggingface.co