MiniMax 发布开放权重音乐生成模型 Music 3.0
MiniMax 发布开放权重音乐生成模型 Music 3.0,可基于创意描述和可选歌词一次性完成最长五分钟完整歌曲的作曲、编曲与制作。
推荐理由:原文给出架构细节和三方面能力升级,读者可以了解其开放权重音乐模型的技术路径。
minimax.io · 网站与博客
MiniMax 发布开放权重音乐生成模型 Music 3.0,可基于创意描述和可选歌词一次性完成最长五分钟完整歌曲的作曲、编曲与制作。
推荐理由:原文给出架构细节和三方面能力升级,读者可以了解其开放权重音乐模型的技术路径。
MiniMax 发布通用多模态生成模型 MiniMax H3,统一理解文本、图像、视频和音频上下文,可生成最长 15 秒、默认 2K 分辨率、带原生立体声的视频。
推荐理由:官方公布 H3 的统一任务设计、核心技术组件与 2K 定价对比,并预告即将开放模型权重,可了解其训练范式思路。
MiniMax 发布博客,详解 M3 数学证明能力背后的 MaxProof 技术路线:通过 Proof RL、Verifier Alignment 和 Refinement Augmentation 训练三个专家模型,再用进化搜索式测试时扩展框架将 best@K 转化为更稳定的 pass@1。
MiniMax 发布 M3 模型,采用自研稀疏注意力架构 MSA,支持最高 1M token 上下文,SWE-Bench Pro 得分 59.0%、Terminal-Bench 2.1 得分 66.0%,并原生支持图像与视频输入及桌面操作。
推荐理由:官方详解了 MSA 架构与 1M 上下文的具体实现,并给出多项基准成绩和真实任务案例,可据此评估其编码与长程智能体能力。
MiniMax 发布 Agent 整体升级并更名 Mavis,推出 Agent Teams,支持桌面端并行运行多角色 Agent 协作完成长任务,并将 TokenPlan 与 Agent Plan 合并为统一订阅,Agent 与 API 共享 Credits。
推荐理由:官方详解 Agent Team 的角色分工、状态机设计和上下文成本等工程取舍,读者可以据此理解多智能体产品化的关键问题。
MiniMax 内部调查确认,MiniMax M2 无法生成“嘉祺”等低频 token 的根因是 SFT 数据覆盖不均导致 lm_head 表示漂移,输入侧 embedding 几乎不变故理解能力保留。调查还发现日语 token 严重退化与小语种混杂同源,加入全词表覆盖合成数据后,日俄混杂率从 47% 降至 1%,定向测试通过率从 4/16 升至 13/16。
推荐理由:原文以模型方一手实验定位稀疏 token 遗忘的 lm_head 漂移机制,并给出可复用的全词表覆盖修复数据方案。
MiniMax 发布 M2.7 模型,称其为首个深度参与自身演化的 M2 系列模型,让模型构建 skills、更新记忆并改进强化学习实验流程。SWE-Pro 得分 56.22%,VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高;MLE Bench Lite 三次运行平均奖牌率 66.6%。
推荐理由:原文给出了自进化工作流细节和多维度基准数据,读者可以对照评估 M2.7 在智能体与工程任务上的实际位置。
MiniMax 发布内部 RL 框架 Forge,通过中间件解耦架构、Windowed FIFO 调度、前缀树合并和 CISPO 算法解决 Agent RL 的吞吐、稳定性与灵活性冲突。该框架在 MiniMax M2.5 训练中接入超过 10 万种真实 Agent 脚手架与环境,上下文长度达 200k,日吞吐量达百万级样本;前缀树合并带来 40x 训练加速。