AI 导读
网易有道发布子曰4全模态模型,27B参数,视觉数理方向同规模SOTA,纯文本数理难题准确率81.4%,该模型与TTS引擎同步开源,开放参数权重,支持本地部署和二次训练。TTS引擎据称只需3秒即可克隆原声,支持14种语言,克隆准确度超97%,音色还原度95%以上。作者在线录制13秒音频克隆自己的声音,用于朗读朋友写的诗。
正文
以前只知道有个乐队叫子曰,没想到网易有道大模型也叫子曰。
最新发布的子曰4是一个全模态模型,27B参数,视觉数理方向同规模SOTA,纯文本数理难题准确率81.4%。
在27B这个“甜点级”参数规模里,子曰4做到了中文学习场景下多模态+纯文本数理推理的双料极佳。
这次,子曰4全模态模型和TTS引擎同步开源,开放参数权重,支持本地部署、二次训练。
尤其是 TTS 模型,看介绍有点强:只需3秒就能克隆原声,支持14种语言,克隆准确度超97%,音色还原度 95%以上。
在线录了13秒音频,克隆我的声音,然后朗读朋友写的诗,效果如下:
Video
来源:@vista8 · x.com