FireRedTeam 开源 FireRedAudio 通用音频语言模型
FireRedTeam 发布 FireRedAudio,一个基于共享 9B LLM 的通用音频语言模型,采用解耦连续表示,Audio Encoder 负责理解、RedAE 通路负责生成。
推荐理由:原文给出模型架构设计和多基准评测数据,并附完整开源代码,读者可据此评估其音频理解与生成能力。
api.github.com · 开发者平台
FireRedTeam 发布 FireRedAudio,一个基于共享 9B LLM 的通用音频语言模型,采用解耦连续表示,Audio Encoder 负责理解、RedAE 通路负责生成。
推荐理由:原文给出模型架构设计和多基准评测数据,并附完整开源代码,读者可据此评估其音频理解与生成能力。
FireRedTeam 发布 FireRedTTS3 的 PyTorch 代码与模型,基于语义增强连续语音表示,统一语音生成与编辑,含 Base 和 Instruct 两个变体,采用 Apache-2.0 许可。
推荐理由:仓库给出完整评测数字和安装使用入口,读者可以据此评估它在多语言克隆和语音编辑上的实际表现。
FireRedTeam 开源了入选 CVPR 2026 的多模态检索方法 ReMatch,通过在训练中加入 chat 式生成匹配目标,让多模态大模型同时从原始输入和投影嵌入判断查询-文档相关性。该方法引入多个可学习表示 token 并融合为单向量嵌入,已发布基于 Qwen2.5-VL-3B 的 ReMatch-3B checkpoint 及评测脚本。
FireRedTeam 将 FireRedVAD 作为独立仓库开源,并放出模型权重与推理代码。该方案支持非流式/流式 VAD 与非流式 AED,可检测 100+ 语言的语音、歌声和音乐,非流式 VAD 在覆盖 102 种语言的 FLEURS-VAD-102 上取得 97.57% F1,超过 Silero-VAD、TEN-VAD、FunASR-VAD 和 WebRTC-VAD。
FireRedTeam 发布 FireRed-OCR-2B 开源模型权重,基于 Qwen3-VL-2B-Instruct,在 OmniDocBench v1.5 上取得 92.94% 的端到端方案最高总分。
FireRedTeam 在 GitHub 开源 FireRedASR2S 一体化语音系统,包含 FireRedASR2(LLM 与 AED 两个版本)、FireRedVAD、FireRedLID 和 FireRedPunc 四个模块并放出权重与推理代码。
小红书智能创作团队开源 FireRed-Image-Edit 系列图像编辑模型,含 1.0、蒸馏版和优化人像一致性、多元素融合与妆造的 1.1 版本,代码与权重采用 Apache 2.0 协议。
FireRedTeam 在 GitHub 开源 FireRed-OpenStoryline,通过自然语言对话完成视频创作,2026-02-10 正式开源,采用 Apache License 2.0。
推荐理由:官方仓库给出完整功能清单、架构说明和安装方式,读者可以据此判断它是否适配自己的视频创作流程。