跳到正文

#多模态

今日 21 条
今天10月2日周五
  1. Hugging Face Daily Papers43

    视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征

    视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。

  2. Hugging Face Daily Papers47

    Omni-Embed-Mini:通过密集蒸馏绑定多模态而不遗忘文本

    Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。

  3. IT Home53

    OpenAI 为 ChatGPT 新增虚拟试穿与收藏功能

    OpenAI 升级 ChatGPT 购物功能,新增虚拟试穿和 Favorites 收藏两项功能。用户在支持的服饰和配饰商品页点击 Try on 按钮并上传照片后,ChatGPT 会生成穿着效果图,该体验大致依托 ChatGPT Images 2.5 图像生成模型;收藏的商品保存至 ChatGPT Library,可建文件夹分类,试穿图也可与购物记录一起保存。

  4. IT Home27

    奇安信盘古石取证 R8.8.0 适配 Android 17,支持微信已删除多媒体碎片重组

    奇安信盘古石手机取证 R8.8.0 完成升级,适配 Android 17 系统提权,并新增三星、小米设备 Android 16 提权提取。解析能力上可定位并重组微信已删除的图片、语音、视频碎片,重建聊天上下文关系,同时新增豆包、千问等鸿蒙平台应用解析支持。安全管控方面新增用户统一管理与分权登录、操作审计及自定义水印。

  5. IT Home62

    OpenAI 全球上线 ChatGPT 虚拟试穿与商品收藏功能

    OpenAI 于当地时间 10 月 1 日在全球推出 ChatGPT 两项购物新功能:虚拟试穿服装和配饰,以及商品收藏功能。新功能基于不久前推出的 ChatGPT Images 2.5 模型,用户可上传自拍照或全身照查看试穿效果,也可上传商品图片模拟试穿;此外还能让 ChatGPT 按风格挑出整套造型单品,或上传名人穿搭照片找出可购买的同款商品。

  6. IT Home28

    古尔曼:苹果首款智能家居中枢支持 AI 面部识别,可为家人切换专属内容

    彭博社马克 · 古尔曼在 Power On 播客中爆料,苹果首款智能家居中枢(Home Hub)将采用 AI 面部识别,识别当前家庭成员后切换显示专属的照片、音乐和日历事件。古尔曼称该产品不会采用 Face ID,但未细说具体区别。AppleInsider 推测,苹果未来智能家居摄像头也可能使用同款技术,用于识别身份并触发安防录像。

  7. IT Home44

    索尼 PlayStation 为标准版 PS5 推出 AI 超分辨率技术 QSSR

    索尼 PlayStation 为标准版 PS5 推出基于 AI 的超分辨率技术 QSSR,全称 "Quick Spectral Super Resolution",是 PSSR 的快速演进版本,也是与 AMD 合作项目 "Project Amethyst" 的一部分。该技术采用精简神经网络架构,率先在《漫威金刚狼》《羊蹄山之魂》上获得支持,在 PS5 上显著提升图像细节和稳定性。

  8. Emad54

    Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 与其实时对话的人以为是真人,此前系统通过率低于 3%,并在 NVIDIA 全双工 AI 视频基准上排名第一。Tavus 称其为首个 Human Interaction Model(HIM)。转发者 Emad Mostaque 评论称,能在屏幕另一端完成的工作 AI 能做得更好。

    引用Tavus@tavus

    Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It’s the first Human Interaction Model (HIM).

  9. TechCrunch · AI61

    ChatGPT 全球上线虚拟试穿和商品收藏功能

    OpenAI 宣布 ChatGPT 全球上线两项购物功能:虚拟试穿衣物和配饰,以及可保存商品的 Favorites 收藏功能。试穿基于新发布的 ChatGPT Images 2.5 模型,用户可上传自拍或全身照生成试穿效果,也能上传商品图片请求试穿;收藏商品会与试穿图片一同存入应用内的 Library。

  10. elvis58

    Tavus 发布 Griffin,称其为首个通过视频图灵测试的 Human Interaction Model,48% 的实时对话者认为它是真人,此前系统通过率低于 3%。它是一个 video-to-video 模型,能边看边听、被打断和打断对方,并 reacting 房间内发生的情况;在 NVIDIA Video Full-Duplex Benchmark 上生成得分 3.83/5,真人为 3.92。

    引用Tavus@tavus

    Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It’s the first Human Interaction Model (HIM).

  11. Microsoft AI News61

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 及 MAI-Voice-2.1 语音模型

    Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。

    推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。

10月1日周四
9月30日周三
  1. Hugging Face Daily Papers35

    PEARL:基于推理与反思的个性化图像生成,提出首个用户历史个性化图像生成基准

    研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。

  2. Hugging Face Daily Papers39

    LEAP:面向长音视频感知的学习式分块证据检索框架

    LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。

  3. Hugging Face Daily Papers32

    SpatialCORE:让大型视觉语言模型基于置信度进行空间推理

    SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。

  4. Hugging Face Daily Papers34

    MemLife:面向长期第一视角视频记忆的整理与推理系统

    MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。

9月29日周二
  1. Microsoft Research61

    Microsoft Research 发布生物研究领域 AI 系统 Quine

    Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。

    推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。

  2. OpenBMB30

    MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活的运行和构建方式。

    引用Guitar Cat + LLM@GenAI_is_real

    Hi everyone, today we released SGLang Omni v0.1.7. This release includes 75 merged PRs and welcomes 8 new contributors, with 8 first-time contributions. We added MiniCPM-o 4.5, NVIDIA PersonaPlex-7B, and OmniTyper powered by MLX streaming ASR, while further improving realtime and stateful Omni serving. 1.Performance: continued optimizations for Qwen3-TTS, Qwen3-Omni, CosyVoice3, MOSS-TTS, and AuK, covering Prefill CUDA Graph, speaker/reference encoding, kernel fusion, batching, and vocoder hot paths. 2.Serving: added Omni session lifecycle, the SGLang streaming session bridge, and a shared /v1/realtime WebSocket runtime, while further improving realtime ASR and streaming serving. 3.Models & hardware: added MiniCPM-o 4.5 multimodal input and speech output, plus PersonaPlex-7B offline speech-to-speech. MiniCPM-o and MiniMax-Music3 now support Intel XPU, with further MUSA support for Qwen3-TTS. 4.Runtime: improved breakable Prefill CUDA Graph, Talker / Code2Wav colocation, priority CUDA streams, scheduler admission, and profiling infrastructure to reduce host overhead and improve high-concurrency stability. https://github.com/sgl-project/sglang-omni/releases/tag/v0.1.7 https://github.com/sgl-project/sglang-omni