@fengdu2077 用 Codex 加本地开源 TTS 跑通端到端短视频自动化流水线:Codex 负责写稿、分镜、生图和串流程,本地 IndexTTS 克隆声音生成配音,再识别字幕,最后合成输出视频。实测 4 款 TTS 模型的排序为 IndexTTS 2.0 和 voxcpm2 并列第一,qwen3-tts(1.7B) 次之,IndexTTS 2.5 表现稍逊。
不用买几百块的视频剪辑 SaaS,
也不用人肉在剪映里一秒一秒对时间线,风渡老师(@fengdu2077)今天正式把一整套端到端的短视频自动化流水线给全盘跑通了,核心只用了 Codex 加本地开源 TTS。
看他推文里放出来的这支全自动成片,声音质感挺干净自然的,一点AI味都没有, 从选题写文案、自动设计分镜、调用模型批量生图, 到本地用克隆好的声音自动生成配音、毫秒级识别字幕, 最后由 Codex 自动调度本地环境把图片、声音和字幕压制合成完整的高清视频, 整个过程一键串联到底,人完全不需要插手。
最值钱的是他帮大家肉身实测了 4 款主流开源声音克隆模型的真实梯队: IndexTTS 2.0 和 voxcpm2 并列第一梯队,声音自然度与克隆像真度最高; 阿里开源的 qwen3-tts 1.7B 紧随其后排在第二梯队; 而看似版本号更高的 IndexTTS 2.5 在实操中反而表现稍逊。
这套极简工作流之所以值得抄作业,是因为它彻底把短视频的生产门槛打到了地板上: 过去做一条图文解说视频,文案、配音、找图、剪辑四个环节要在四个软件之间来回倒腾,耗掉大半天; 现在把 Codex 当成全能调度总指挥, 让本地开源小模型解决免费配音,让代码脚本解决压制合成, 单条视频的制作边际成本直接压缩到了接近于零。
流水线一旦焊死,剩下的工作就不再是拼体力做视频, 而是把你的精力全部释放出来,每天专注去挑最抓人的选题。
这套极简架构与 4 款 TTS 模型的避坑细节全整理在一楼了,做自媒体和出海视频的兄弟建议立即收藏。
今天终于把视频自动化跑通了,只用了 Codex + 本地 TTS。 下面的就是今天跑通后输出的视频。 Codex 负责写稿、分镜、生图和串流程,本地 IndexTTS 用我的声音生成配音,再识别字幕,最后 codex 把图片和音频合成输出视频。 试了 4 个 tts 模型,IndexTTS 2.0 & voxcpm2 > qwen3-tts(1.7B) > IndexTTS2.5.在 X 查看被引用的帖子
来源:AYi · x.com