MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行
面壁智能联合 OpenBMB、清华大学 THUNLP 与 THUMAI 实验室发布 MiniCPM-o 4.5 技术报告,首次公开全双工全模态框架 Omni-Flow,并同步开放全模态全双工 API、在线 Demo、端侧安装包 Comni 与 Demo 仓库。
推荐理由:技术报告首次公开 Omni-Flow 的毫秒级时间轴对齐机制,读者可据此理解端到端全双工全模态的实现路径。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
当前仅显示精选新闻面壁智能联合 OpenBMB、清华大学 THUNLP 与 THUMAI 实验室发布 MiniCPM-o 4.5 技术报告,首次公开全双工全模态框架 Omni-Flow,并同步开放全模态全双工 API、在线 Demo、端侧安装包 Comni 与 Demo 仓库。
推荐理由:技术报告首次公开 Omni-Flow 的毫秒级时间轴对齐机制,读者可据此理解端到端全双工全模态的实现路径。
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
Google DeepMind 发布 Gemini Robotics-ER 1.6,提升机器人在空间推理、多视角理解、任务规划和成功检测方面的能力,并新增仪表读数功能。
推荐理由:官方给出了与上一代的具体能力对比和仪表读数新用例,读者可据此评估其是否适配现有机器人方案。
Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。
推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。
Mistral 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态与 Devstral 的智能体编码能力统一到单一开源模型,采用 Apache 2.0 许可证。
推荐理由:官方公布了架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的效率对比,可据此评估其开源部署价值。
Microsoft 推出 Copilot Health,这是 Copilot 内的独立安全空间,可整合健康记录、可穿戴设备数据与健康历史并生成个性化健康洞察。
推荐理由:官方宣布 Copilot Health 上线并给出数据整合规模、隐私隔离措施和分阶段开放方式,读者可以了解其功能边界与使用入口。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在初级保健就诊前与 AMIE 对话采集病史,全程由医生实时监督,未发生一次安全中止。
推荐理由:这是 AMIE 首次在真实门诊流程中开展的前瞻性可行性研究,给出安全性、诊断质量和医患体验的具体数据。
Google Gemini API 发布 Nano Banana 2,即 Gemini 3.1 Flash Image Preview,定位为面向速度和高并发场景的高效模型。同时官方宣布 gemini-3-pro-preview 将于 2026 年 3 月 9 日停用。
推荐理由:官方更新日志同时给出新模型定位和旧模型下线日期,读者可以据此安排 Gemini API 的模型切换。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 取得 74% 的整体胜率,输出支持带 HTML 表格重建的 markdown。
推荐理由:官方给出了对比 Mistral OCR 2 的胜率、价格和 API 入口,读者可以据此评估文档解析方案的替换成本。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。
推荐理由:官方给出完整基准对比和定价细节,开源语音模型在准确率与成本上的位置可以直接对比判断。
Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、成本低约 8 倍和更易部署的新级别模型。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准数字和 $0.4/$2 定价,读者可以据此评估它在企业部署中的性价比。
Mistral AI 发布 Mistral Small 3.1,相比 Mistral Small 3 提升文本性能,新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,官方称超越 Gemma 3 和 GPT-4o Mini 等同级模型。
推荐理由:官方给出了与 Gemma 3 和 GPT-4o Mini 的对比数据、部署门槛和开放下载渠道,可据此评估端侧与低成本部署选择。
Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),以图像和 PDF 为输入,输出交错的文本与图片,已作为 Le Chat 默认文档理解模型。
推荐理由:官方公布了自评基准对比、定价和部署选项,读者可以据此评估它在文档理解与 RAG 场景中的位置。
Suno 发布 v3 模型,称其首个能生成广播级音乐的模型,已在 https://app.suno.ai 向所有用户开放。v3 可在几秒内生成完整两分钟歌曲,改进包括更好的音质、更多风格流派、更少幻觉和更自然的结尾。模型不识别艺术家引用,并采用不可闻水印技术检测 Suno 生成的歌曲,v4 已在开发中。
推荐理由:Suno 官方说明 v3 在音质、风格与提示词遵循上的具体改进,读者可据此对比自己此前的生成体验。