跳到正文

#多模态

今日 26 条
8月28日周五
8月27日周四
8月26日周三
  1. Z.ai72

    智谱(Z.ai)发布 GLM-5.3-Flash,称具备有竞争力的价格与原生多模态能力,上下文窗口为 1M token,为 320B-A18B 模型并以 MIT License 开源权重。该模型此前曾以 Ox Alpha 名义预览,完全运行于中国 AI 芯片;现已在官方平台提供权重、API、Coding Plan、ZCode、Chat 和 AutoClaw 入口。

    推荐理由:官方公告同时给出价格定位、开源权重和芯片适配信息,读者可以据此评估它在现有工作流中的替换可能。

  2. Google Research44

    Google 研究 AgentHands:为 XR 中的智能体对话生成同步手势

    Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。

8月21日周五
8月20日周四
8月19日周三
8月18日周二
8月17日周一
8月14日周五
8月13日周四
  1. Google Developers Blog56

    Google 开源 C++ 库 Credentio,用于本地验证 C2PA Content Credentials

    Google 发布开源 C++ 库 Credentio,用于处理 C2PA Content Credentials,先支持规范 2.2 和 2.4 版本。该库支持完全本地验证,无需将媒体文件传到云端,零带宽开销、即时返回结果并保持数据隐私;验证大文件时内存占用较小,可配置官方或自定义 C2PA 信任列表,深入解析清单、断言、数字签名和声明结构,并给出详细的验证报告。

  2. Microsoft Research41

    MindTopo:微软推出评估多模态模型拓扑推理能力的新基准

    微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上表现明显优于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成工具仅在单帧内保留结构关系时有用,跨多步操作仍不可靠。

  3. Suno Blog65

    Suno Studio 2.0 发布,面向 Premier 订阅者新增 MIDI 编辑与自动化等功能

    Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。

    推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。

8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布手语转文本模型 SL2T,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL

    Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。

    推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。

  2. Google Research66

    Google Research 推出 AMIE (Video):实现实时音视频临床问诊,表现达到专科医生水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。

    推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。

8月10日周一
  1. Hugging Face Blog81

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。

    推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。

8月6日周四
  1. Google DeepMind83

    Google DeepMind 开源 WeatherNext 气旋预报模型,Nature 论文显示精度领先一天

    Google DeepMind 发表 Nature 论文并开源 WeatherNext 2 与 WeatherNext Cyclones 模型,单模型以 SOTA 精度预测气旋路径、强度和风结构,平均多出 24 小时提前量,相当于约十年气象学进步。

    推荐理由:官方Nature论文和模型开源同时落地,读者可据此了解AI气象预报达到的精度水平并直接获取代码权重。

8月4日周二
  1. Mistral AI64

    Mistral AI 开源 3B 多模态安全分类器 Shieldstral

    Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。

    推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。

8月1日周六
7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。

    推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。

7月28日周二
7月24日周五
  1. Runway News58

    Runway 发布 Media Router,为视频、图像和音频生成模型自动选型

    Runway 推出 Runway Media Router,称其为首个面向生成式媒体模型的路由功能,已在 Runway Dev 上线,支持视频、图像和音频模型。用户设定成本、质量、延迟偏好及价格上限、允许和拒绝列表等约束后,只调用一个端点,路由器会筛选并评分选出最优模型,返回结果及所用模型的元数据;无模型满足约束时报明确错误,生产前可用 dry-run 验证选型且不产生费用。

7月22日周三
7月21日周二
7月16日周四
7月15日周三
  1. Hugging Face Blog81

    Hugging Face 发布 Thinking Machines 多模态开源模型 Inkling 使用指南并推出 Inkling-Small

    Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。

7月8日周三
7月7日周二
  1. OpenRouter Announcements71

    OpenRouter 实测图像 detail 参数:推理模型用 low 更贵更差

    OpenRouter 在 MMMU-Pro Vision(1,730 题)上基准测试 OpenAI 和 Google 五款模型的图像 detail 设置,发现 gpt-5.5 用 low 比 auto 低 13.8 分(65.2% vs 79.0%)且每题更贵(5.1¢ vs 4.5¢),原因是模型为看清热压缩图像多花 1.6x 推理 token。

    推荐理由:基于 MMMU-Pro Vision 实测五款模型,给出推理模型保持 auto 细节、改调 reasoning effort 省钱的可操作结论。

  2. Hugging Face Blog61

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六大仿真基准

    Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。

    推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。

7月1日周三
6月25日周四