NVIDIA Nemotron 3.5 ASR 如何微调适配特定语言、领域或口音
NVIDIA 在 Hugging Face 博客给出 Nemotron 3.5 ASR 的微调流程,用约 2000 小时希腊语和保加利亚语数据微调后,在 80ms 流式设置下 WER 分别从 35 降到 24、从 22 降到 15。
推荐理由:文章概述了从基础检查点微调流式多语种 ASR 的流程,并用希腊语和保加利亚语的 WER 变化说明微调对低资源语言的效果。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
当前仅显示精选新闻NVIDIA 在 Hugging Face 博客给出 Nemotron 3.5 ASR 的微调流程,用约 2000 小时希腊语和保加利亚语数据微调后,在 80ms 流式设置下 WER 分别从 35 降到 24、从 22 降到 15。
推荐理由:文章概述了从基础检查点微调流式多语种 ASR 的流程,并用希腊语和保加利亚语的 WER 变化说明微调对低资源语言的效果。
谷歌DeepMind发布并开源Gemma 4 12B,这是一个统一、无编码器的多模态模型,只需16GB显存或统一内存即可在消费级笔记本上运行。它在标准评测基准上的成绩接近26B MoE模型,总内存占用不到后者一半,采用Apache 2.0协议,预训练与指令微调权重可从Hugging Face和Kaggle下载。
推荐理由:原文介绍了无编码器多模态架构如何降低延迟和内存占用,并列出16GB笔记本可用的本地运行入口。
推荐理由:内容列出了 Gemma 4 的下载渠道与兼容工具链,便于判断本地部署和微调的可选路径。
Boson AI 与 SGLang-Omni 团队宣布在 SGLang-Omni 上提供 Higgs Audio v3 TTS 的端到端服务。模型约 4B 参数,基于 Qwen3-4B,支持流式合成和 100 种语言的个位数 WER/CER,零样本克隆在 Seed-TTS 上 WER/CER 为 1.11%。
推荐理由:原文给出多级推理架构、控制标签目录和基准延迟数据,开发者可据此评估把 TTS 接入语音 Agent 的可行性。
MiniMax just released MiniMax-M3, their first multimodal model. It is the new open-weight SOTA on the Vals Index and the Vals Multimodal Index, and #6 overall.
推荐理由:MiniMax 的多模态模型在 Vals 两个榜单取得开源权重最佳成绩,读者可对照它与整体榜单前列的排名差距。
H 公司发布 Holo3.1 计算机使用智能体模型家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次推出 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:Holo3.1 在移动端与跨框架适配上补齐短板,量化权重把计算机使用智能体带到本地设备。
Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days
推荐理由:官方给出 M3 在编码与智能体基准上的具体分数和 1M 上下文,读者可据此对照同类开源模型的能力边界。
推荐理由:Cosmos 3 以工作站单卡和数据中心两种规格发布,并配套开放数据集与后训练脚本,读者可据此判断机器人模型的部署取舍。
🚀 @MiniMax_AI M3 is now available on OrcaRouter. One of the most anticipated open model releases, bringing next-gen sparse attention, ultra-long context handling (up to 1M tokens of context with a guaranteed minimum of 512K), faster inference, and stronger agentic workflows. Try it out here: orcarouter.ai/models/minimax…
推荐理由:MiniMax M3 首日上线 OrcaRouter,读者可据此了解其长上下文与智能体工作流的能力定位。
Congrats to the @MiniMax_AI team on the release of M3! 👉 A frontier-class open-weight model 👉 1M context window 👉 Native multimodality (image & video)
推荐理由:MiniMax M3 以开放权重、1M 上下文和原生多模态发布,读者可据此了解实时语音与视频的集成方向。
MiniMax-M3 by @MiniMax_AI is now live on Venice. The first open-weight model to deliver frontier coding and agentic performance with native multimodality. Built for long-horizon, complex workflows. Available anonymously.
推荐理由:MiniMax-M3 以开放权重同时具备前沿编码与智能体能力,支持 1M 上下文和原生多模态,面向长周期复杂工作流。
推荐理由:原文列出上下文窗口、编码、智能体和多模态四个方面,读者可据此了解这个开放权重模型的配置取向。
Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days
推荐理由:材料给出 M3 在 Ollama Cloud 的调用命令与零数据保留说明,可据此直接上手编码与智能体任务。
MiniMax 发布 M3 模型,采用自研稀疏注意力架构 MSA,支持最高 1M token 上下文,SWE-Bench Pro 得分 59.0%、Terminal-Bench 2.1 得分 66.0%,并原生支持图像与视频输入及桌面操作。
推荐理由:官方详解了 MSA 架构与 1M 上下文的具体实现,并给出多项基准成绩和真实任务案例,可据此评估其编码与长程智能体能力。
⚡️ Step 3.7 Flash is here: The new frontier is agent efficiency. #1 ClawEval-1.1 (67.1), #1 SimpleVQA Search (79.2), #2 SWE-PRO (56.3), 95.3 on V* Python. Open weights under Apache 2.0. Built for agentic, coding, search, and multimodal workflows — balancing speed, cost, and reliable execution. - 400 TPS. 198B sparse MoE, ~11B active. 256K context, 3 reasoning levels. - Understands UIs, charts, docs, images — then writes code or calls tools to act on what it sees. - Web + visual search reaches further: more sources, deeper follow-up. - Reliable tool use — less drift, fewer broken toolcalls. 98%+ on τ²-bench across all difficulty levels. - Works with Claude Code, KiloCode, Hermes Agent, OpenClaw, and protocols like MCP. - Runs locally on Mac Studio M4 Max, DGX Spark, AMD AI Max+ 395. GitHub: github.com/stepfun-ai/Step-3… HuggingFace: huggingface.co/stepfun-ai/St… GGUF: huggingface.co/stepfun-ai/St… ModelScope: modelscope.cn/models/stepfun… API: platform.stepfun.ai Blog: static.stepfun.com/blog/step…
推荐理由:从开放权重和速度成本平衡切入 agent 场景,读者可对照其编程与搜索评测及本地部署支持。
Mistral AI 发布 Search Toolkit 公测版,一个用于构建 AI 应用生产级搜索管道的开源可组合框架,统一了此前分散的数据摄取、检索与评估三个环节。
推荐理由:官方发布开源搜索框架,把 ingestion、检索和评估整合为统一接口,适合评估它能否减少 RAG 基础设施维护成本。
Artificial Analysis 与 IBM 软件创新实验室发布 ITBench-AA,这是首个面向智能体企业 IT 任务的基准系列,首批聚焦 SRE 场景,前沿模型得分均低于 50%。
推荐理由:前沿模型在这套企业IT智能体基准上全部低于50%,并给出开源权重模型的每任务成本对照,可作为能力与成本参照。
inclusionAI 发布基于 MoE 的扩散大语言模型 LLaDA2.0-Uni,在单一模型中统一多模态理解与生成,支持文生图、图像理解、图像编辑以及交错生成与推理。
推荐理由:模型把多模态理解与生成统一进扩散 LLM 框架,并公开 8 步解码与加速方案,读者可据此判断部署门槛。
Hugging Face 在 TRL 中实现 Delta Weight Sync,只把 RL 相邻优化步骤间真正变化的 bf16 权重编码为稀疏 safetensors 文件,上传到 Hugging Face Bucket 后由 vLLM 拉取。
推荐理由:TRL 通过稀疏增量同步把异步 RL 每步权重传输量压缩约两个数量级,并允许 trainer 与推理集群分离部署。
Hugging Face 发布教程,用自家 speech-to-speech 库把 Reachy Mini 的对话链路全部搬到本地,无需云服务、API key,音频不出本机。
推荐理由:给出了一条可整套照搬的本地语音链路,读者能据此把 VAD、STT、LLM、TTS 各环节换成自己的模型。