JetBrains 发布 12B MoE 模型 Mellum2,每 token 激活 2.5B 参数
Introducing Mellum2: A 12B Mixture-of-Experts Model by JetBrains
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
JetBrains 发布 12B 参数的 MoE 模型 Mellum2,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。模型在自然语言和代码上从零训练,面向路由、RAG 管线、摘要、子智能体与私有部署等高频低延迟任务,官方称其推理速度比同规模模型快 2 倍以上。模型权重已在 Hugging Face 上线,架构、训练与评测细节见其技术报告。
来源:Hugging Face Blog · huggingface.co