MiniMax 发布开放权重音乐生成模型 Music 3.0
MiniMax 发布开放权重音乐生成模型 Music 3.0,可基于创意描述和可选歌词一次性完成最长五分钟完整歌曲的作曲、编曲与制作。
推荐理由:原文给出架构细节和三方面能力升级,读者可以了解其开放权重音乐模型的技术路径。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
当前仅显示精选新闻MiniMax 发布开放权重音乐生成模型 Music 3.0,可基于创意描述和可选歌词一次性完成最长五分钟完整歌曲的作曲、编曲与制作。
推荐理由:原文给出架构细节和三方面能力升级,读者可以了解其开放权重音乐模型的技术路径。
Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。
推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。
Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。
推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。
Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
Google DeepMind 发表 Nature 论文并开源 WeatherNext 2 与 WeatherNext Cyclones 模型,单模型以 SOTA 精度预测气旋路径、强度和风结构,平均多出 24 小时提前量,相当于约十年气象学进步。
推荐理由:官方Nature论文和模型开源同时落地,读者可据此了解AI气象预报达到的精度水平并直接获取代码权重。
NVIDIA 发布 Cosmos 3 开放世界物理 AI 基础模型系列,基于 mixture-of-transformers 架构,融合视觉推理、世界生成与动作预测能力。
推荐理由:原文列出 Cosmos 3 三个尺寸的定位与多项基准排名,读者可据此判断开放世界模型在物理 AI 中的分工。
阿里巴巴 8 月 3 日正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4T、激活 95B,支持视觉理解与 1M Tokens 上下文。
推荐理由:原文列出 2.4T 总参数、激活 95B 与 API 定价,读者可据此比较旗舰模型的规模与成本取舍。
ByteDance Seed 发布原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持音视频联合理解、主动交互与流畅对话节奏。端到端人工评测显示,相比级联模型,音视频对话节奏问题减少一半。模型已在豆包 App 全量上线,用户更新后在对话框选择“打电话”进入视频通话即可体验。
推荐理由:原文给出统一架构、端到端评测数字和豆包 App 开放入口,可据此了解音视频全双工交互的能力与体验变化。
Black Forest Labs 的 FLUX 3 Video 初版正式通过 BFL API 和部分合作方开放。模型可生成最长 20 秒、带原生音频的视频,支持 HD(720p)与 Full HD(1080p),并提供文本生视频、图生视频与关键帧、视频续写(最多 4 秒素材)、单次生成多镜头、多语言对话与精确口型同步、Draft Mode 快速预览等能力。
推荐理由:官方公布了模型能力和自评基准数据,并说明后续开源权重与图像版本的路线,可帮助读者评估其在视频生成工作流中的位置。
Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。
推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。
阿里巴巴正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4 万亿、激活 95B,采用稀疏 MoE 架构与混合注意力机制,支持视觉理解,上下文长度达 1M Tokens。
推荐理由:原文给出 2.4T MoE 旗舰模型的参数规模、编程能力表现和 API 定价,便于比较其性价比定位。
MiniMax 发布通用多模态生成模型 MiniMax H3,统一理解文本、图像、视频和音频上下文,可生成最长 15 秒、默认 2K 分辨率、带原生立体声的视频。
推荐理由:官方公布 H3 的统一任务设计、核心技术组件与 2K 定价对比,并预告即将开放模型权重,可了解其训练范式思路。
DeepSeek 发布全新模型结构系列中最小尺寸的 DeepSeek-V4.1-Flash,具备原生多模态视觉理解能力,GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471。
推荐理由:DeepSeek 官方更新日志给出 V4.1-Flash 的基准成绩、API 调用方式与定价变化,可据此判断多模态小模型的落地成本。
ByteDance Seed 正式发布视频生成模型 Seedance 2.5,延续 Seedance 2.0 的多模态音视频联合生成架构,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,可生成数分钟连贯内容。
推荐理由:官方公布单次生成 30 秒、30 张图参考和时间戳编辑等具体能力变化与上线入口,读者可据此评估视频创作工作流。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。
推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。
Kimi K3 发布开放权重并公开 47 页技术报告,包含 2.8T 总参数、104B 激活参数和 100 万 token 上下文。报告重点在 KDA、AttnRes 与 Stable LatentMoE 三项架构改动,分别处理模型变长、变深、变宽后的信息流问题。
推荐理由:技术报告披露的 KDA、AttnRes 与 LatentMoE 三项架构改动,可帮读者理解长上下文和长程 Agent 训练的工程取舍。
月之暗面正式开源 Kimi K3,参数量 2.8 万亿、激活参数 1040 亿,支持 100 万 token 上下文并具备原生视觉理解,同步发布技术报告。
推荐理由:技术报告公开了注意力、跨层残差与 MoE 负载均衡的具体改动,可借此看清单个开源模型在万亿参数规模上的工程取舍。
月之暗面开源 Kimi K3 的模型权重和技术报告,2.8 万亿参数 MoE,具备原生视觉理解能力,支持 100 万 token 上下文窗口。
推荐理由:权重、技术报告与训练 Infra 一并公开,呈现 2.8 万亿参数 MoE 从架构到线上服务的工程链路。
月之暗面开源 Kimi K3 模型,参数规模 2.8 万亿,同步放出模型权重、技术报告以及 MoonEP、FlashKDA、AgentEnv 三项支撑训练的 Infra 技术。
推荐理由:2.8 万亿参数开源模型把权重、技术报告与训练 Infra 一并放出,可对照开源模型的规模上限与工程路径。