#多模态
#多模态
今日 25 条
Microsoft Research@MSFTResearchAI 评分3434
AWS Machine Learning BlogAI 评分3333 Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。
Microsoft Research精选AI 评分6161 Microsoft Research 发布生物研究领域 AI 系统 Quine
Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。
推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。
OpenBMB@OpenBMBAI 评分3030MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活的运行和构建方式。
引用Guitar Cat + LLM@GenAI_is_realHi everyone, today we released SGLang Omni v0.1.7. This release includes 75 merged PRs and welcomes 8 new contributors, with 8 first-time contributions. We added MiniCPM-o 4.5, NVIDIA PersonaPlex-7B, and OmniTyper powered by MLX streaming ASR, while further improving realtime and stateful Omni serving. 1.Performance: continued optimizations for Qwen3-TTS, Qwen3-Omni, CosyVoice3, MOSS-TTS, and AuK, covering Prefill CUDA Graph, speaker/reference encoding, kernel fusion, batching, and vocoder hot paths. 2.Serving: added Omni session lifecycle, the SGLang streaming session bridge, and a shared /v1/realtime WebSocket runtime, while further improving realtime ASR and streaming serving. 3.Models & hardware: added MiniCPM-o 4.5 multimodal input and speech output, plus PersonaPlex-7B offline speech-to-speech. MiniCPM-o and MiniMax-Music3 now support Intel XPU, with further MUSA support for Qwen3-TTS. 4.Runtime: improved breakable Prefill CUDA Graph, Talker / Code2Wav colocation, priority CUDA streams, scheduler admission, and profiling infrastructure to reduce host overhead and improve high-concurrency stability. https://github.com/sgl-project/sglang-omni/releases/tag/v0.1.7 https://github.com/sgl-project/sglang-omni
inclusionAI Hugging Face modelsAI 评分5656 inclusionAI 发布开源全模态模型 Ming-flash-omni 2.0
inclusionAI 在 Hugging Face 发布开源全模态模型 Ming-flash-omni 2.0,基于 Ling-2.0 MoE 架构,总参数 100B、激活 6B,称在开源全模态 MLLM 中达到 SOTA。
clem 🤗@ClementDelangue精选AI 评分7777引用Lisa Su@LisaSuSo excited to welcome @theworldlabs and @drfeifei to the @AMD family! I’ve always been a huge fan of Fei-Fei and her pioneering research in AI. Together, we’ll combine World Labs’ deep expertise in AI and world models with AMD’s compute leadership to power the future of AI and strengthen the open AI ecosystem. Can’t wait for all we’ll accomplish!
推荐理由:AMD 收购 World Labs 与李飞飞的消息结合 World Labs 专注世界模型与开放生态的定位,读者可了解这次结合对 AI 开源生态的影响。
OpenRouter AnnouncementsAI 评分5454 OpenRouter 横向比较 Veo 3.1、Seedance、Kling 与 Grok Imagine Video 的图生视频能力
OpenRouter 比较了自家平台四条图生视频模型线的分辨率、时长、帧控制、音频和价格,覆盖 Veo 3.1、Seedance 2.5 与 2.0 系列、Kling v3.0 和 Grok Imagine Video 1.5,价格数据核查于 2026 年 9 月 11 日。
Hugging Face Daily PapersAI 评分4747 MIST 测试揭示:无关图像会动摇 VLM 评判,而非提供信息
研究提出 MIST(Misleading-Image Stress Test),用 200 句可作比喻或字面理解的英文句子,分别配对齐图像、误导图像或无图像,要求仅凭句子作答。
Hugging Face Daily PapersAI 评分4040 PixelUMM:无编码器的统一图像与视频理解生成模型
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成,将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干。
Hugging Face Daily PapersAI 评分3535 音频-视觉大语言模型中的“问题接力”机制与 SECRET 去幻觉方法
音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。
Hugging Face Daily PapersAI 评分4040 LoopVL:循环视觉智能
LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。
Hugging Face Daily PapersAI 评分3535 Adaptive Reward Routing:面向音视频联合扩散模型的前向过程 RL 动态多奖励优化
针对音视频联合扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励组合。
Claude@claudeaiAI 评分2929一组 Claude Sonnet 5.5 的早期实验。 @_re_pete 用 Sonnet 5 与 Sonnet 5.5 制作的秋叶模拟器对比。

elsewhere articlesAI 评分4141 群核科技用空间智能重建永泰龟城,24 亿高斯点刷新全球 3D 高斯重建纪录
群核科技联合博主「特能斯」4 人 4 天在甘肃永泰龟城采集 6 万多张照片,通过 3D 高斯重建平台 Aholo Reality 生成 24 亿高斯点、60 万平方米的数字古城,刷新全球公开可查的 3D 高斯重建纪录。该数字场景已交给景泰当地文旅作为永久数字文化档案保存,并可通过 Aholo Reality 平台在线漫游;同一组 3D 场景还被用于 LuxReal 生成 AI 短剧《永泰无战事》。
Hugging Face Daily PapersAI 评分3333 视频-音频联合与跨模态生成及编辑:统一形式化与设计分类体系
一篇综述将联合生成、跨模态生成与联合编辑统一形式化为音视频对分布上的三类问题,并提出沿五个设计轴比较方法的分类体系。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各设定的方法、数据集与指标。
Hugging Face Daily PapersAI 评分3737 ReaLVR:用视觉证据监督潜空间推理,首次将潜空间视觉推理扩展至 235B 规模
针对潜空间视觉推理(LVR)中潜 token 对图像扰动响应微弱、缺乏显式监督的"潜证据信用缺口",研究者提出 ReaLVR,通过对比正确答案与模型生成的错误答案、匹配与不匹配的视觉证据,为模型自身的潜推理轨迹提供视觉证据监督。
ByteByteGoAI 评分1919 ByteByteGo 课程:用 AI 重建 YouTube,报名即将截止
ByteByteGo Live 推出「用 AI 重建 YouTube」课程,由前 YouTube 工程师授课,9 月 26 日(周六)开课,报名 24 小时后截止。
karminski-牙医@karminski3AI 评分5959
引用Meituan LongCat@Meituan_LongCatLongCat-2.5-Preview is now live. 1.6T parameters. ~48B active. A 1M-token context window. Natively multimodal. Built to take on long-horizon tasks. From terminals and browsers to GUIs, spreadsheets, and design tools. Try it now: 🚀 API: https://longcat.ai/platform/ 💬 Chat: https://longcat.ai/chat/
Latent SpaceAI 评分6161 Runway WorldPrompt 与实时世界模型的工程实践:对话 Runway CTO 与研究科学家
Latent Space 采访 Runway CTO Kamil Sindi 与研究科学家 Robin Kahlow,解读 GWM Worlds 2 新功能 WorldPrompt。
Google DeepMindAI 评分5151 Google DeepMind 推出 Gemini 3.8 Live with Live Avatar
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为对话模型加入近实时视频生成与视觉形象,今日起在 Gemini Enterprise 提供。该功能支持精确唇形同步、异步工具调用不中断对话、跨 97 种语言的语音到语音同步,并可用参考图定制头像(需企业允许名单),所有输出带 SynthID 水印。
Odyssey@odysseymlAI 评分4343推出 Agora-2,我们的新一代多智能体世界模型。 Agora-2 支持最多 20 个人类与智能体在同一共享环境中互动,全部实时模拟。 我们的多人研究预览版现已开放体验!

Hugging Face BlogAI 评分5959 Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草稿模型,解码最高提速 3.13x
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 设备端)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
NVIDIA BlogAI 评分5757 NVIDIA 联合 Google DeepMind 等机构开放 2,800 多种病毒蛋白复合物预测结构
NVIDIA 与 Google DeepMind、EMBL-EBI 等机构合作,通过 AlphaFold Database 公开超过 2,800 种病毒的蛋白复合物预测 3D 结构,数据由 AlphaFold2 结合 NVIDIA BioNeMo Inference Runtime 优化推理生成,其中约 30% 的蛋白相互作用此前未被 Protein Data Bank 记录。
inclusionAI Hugging Face modelsAI 评分5454 inclusionAI 开源 Ming-UniVision-16B-A3B 统一图像理解与生成模型
inclusionAI 在 Hugging Face 开源 Ming-UniVision-16B-A3B,基于 MingTok 连续视觉 token,在单一自回归 NTP 框架内统一图像理解与生成,官方称联合训练收敛速度提升 3.5 倍。
inclusionAI Hugging Face modelsAI 评分5757 inclusionAI 发布原生多模态模型 Ling-3.0-flash-VL
inclusionAI 发布 Ling-3.0-flash-VL,基于 Ling-3.0-flash 扩展原生图像与视频理解,总参数 124B,每 token 激活 5.5B,上下文窗口最高 256K tokens。
inclusionAI Hugging Face models精选AI 评分6161 inclusionAI 发布 Ming-flash-omni Preview 多模态模型
inclusionAI 在 Hugging Face 发布 Ming-flash-omni Preview,基于 Ling-Flash-2.0 稀疏 MoE 架构,总参数 100B、每 token 激活 6B。
推荐理由:原文给出稀疏 MoE 架构、生成式分割和方言语音识别等具体改进与评测数字,读者可对比其多模态能力变化。
Tencent Hy@TencentHunyuanAI 评分4646
AI at Meta@AIatMetaAI 评分4141
Ant Ling@AntLingAGIAI 评分2828
Karina@karinanguyenAI 评分3131
引用Rehan Sheikh@rehan_sheiinteractive media will be huge in the next year or two! this is incredible
Epoch AI@EpochAIResearchAI 评分4242AI 能看出你把宜家家具装错了吗?我们的新基准——家具组装基准(FAB)——把说明书和一张组装到一半的家具照片交给模型,让它们找出错误。 最高分在短短 10 个月内从 28% 升到了 80%。

Karina@karinanguyenAI 评分3131推出 ACTx486,一种全新交互式媒介的研究演示。 如果你能和任何视频对话,想问什么就问什么,会怎样? 我们的系统将一档现有播客变成了能倾听、能回应、能适应的东西。 研究来自 @jakubzeg:

Google DeepMindAI 评分5252 Google Private AI Compute 推出安全的服务端持久记忆架构
Google Private AI Compute 团队宣布为 Private AI Compute 平台引入私密的服务端持久记忆,让 AI 助手能跨设备长期保留上下文。
Ammaar Reshi@ammaarAI 评分5757作者宣布最新文本转语音与声音设计模型上线,现已在 AI Studio 中可用。新模型提供数千种可选声音,支持用提示词设计声音,可在 30 秒内复刻自己的声音,并提供表达性标签用于精细控制。

Google AI@GoogleAIAI 评分5858
Google DeepMind精选AI 评分6868 Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。
推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。
Latent SpaceAI 评分5050 Radical Numerics CEO Eric Nguyen 谈生物安全:一场 AI 军备竞赛
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为,提升生物能力的模型同样能用于防御,主张更激进地推进前沿。其团队开发的 Evo、Evo 2 基因组语言模型曾被 Arc Institute/Stanford 团队用于生成完整噬菌体基因组并合成出功能性病毒。
Qwen@Alibaba_QwenAI 评分5555千问(Qwen)推出 Qwen Intelligence,首发三个 Agent:Mobile Planner Agent 居 MobilePA-Bench 等榜单第一。

Qwen@Alibaba_QwenAI 评分6464