OneStreamer:统一流式视频交互中的感知、记忆与主动响应
OneStreamer提出通过共享的主动生成过程,联合学习查询无关的证据记录与任务响应,其主动分层字幕记忆(PHCM)生成带时间锚定的局部细节字幕与已完成事件摘要,在不回溯历史视觉特征的情况下提供可复用的事实上下文。
OneStreamer提出通过共享的主动生成过程,联合学习查询无关的证据记录与任务响应,其主动分层字幕记忆(PHCM)生成带时间锚定的局部细节字幕与已完成事件摘要,在不回溯历史视觉特征的情况下提供可复用的事实上下文。
视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。
Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。
OpenAI 升级 ChatGPT 购物功能,新增虚拟试穿和 Favorites 收藏两项功能。用户在支持的服饰和配饰商品页点击 Try on 按钮并上传照片后,ChatGPT 会生成穿着效果图,该体验大致依托 ChatGPT Images 2.5 图像生成模型;收藏的商品保存至 ChatGPT Library,可建文件夹分类,试穿图也可与购物记录一起保存。
极米记得 AI 显示眼镜 MemoMind One 将于明日登陆全国 56 家线下门店及 INNO100 全球创新旗舰店。10 月 3 日至 14 日到店预付 100 元定金,可获赠价值 199 元墨镜夹片。该产品集极米显示、蔡司光学、哈曼声学于一体,支持 AI 记忆、导航与提词功能,配置信息暂未公布。
Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef,含 Clef 与 Clef-flash 两款,分别基于 Qwen3.8-27B 和 Qwen3.5-9B。
World Observer 通过联合生成一个 actor 视角与一个或多个全景 observer,让离开 actor 视野的物体在 observer 中持续演化,从而在重新进入视野时保留其状态与动态。
OmniSeek 是一个将 Omni-LLM 转变为具备原生工具调用能力的多轮推理智能体的框架,能动态决定看或听以及对应的时间窗口,将检索到的音视频片段回填上下文以支持后续推理。
华为 Mate XT 2 非凡大师三折叠手机在 Mate 90 系列发布会后推送 HarmonyOS 7.0.0.109 SP8 更新,锁屏新增 3D 空间壁纸,图库支持静态/动态照片生成 3D 动态照片。
余承东宣布华为移动影像升级,正式发布华为睿影 XMAGE 影像品牌。华为 Mate 90 系列首发搭载全新升级的 XMAGE「华为睿影」影像体系,围绕人像、长焦、色彩、视频、智拍五大方向创新,配备全系连续可变光圈、第三代红枫原色摄像头、超大底 2 亿像素长焦及 18EV 超高动态主摄。
奇安信盘古石手机取证 R8.8.0 完成升级,适配 Android 17 系统提权,并新增三星、小米设备 Android 16 提权提取。解析能力上可定位并重组微信已删除的图片、语音、视频碎片,重建聊天上下文关系,同时新增豆包、千问等鸿蒙平台应用解析支持。安全管控方面新增用户统一管理与分权登录、操作审计及自定义水印。
OpenAI 于当地时间 10 月 1 日在全球推出 ChatGPT 两项购物新功能:虚拟试穿服装和配饰,以及商品收藏功能。新功能基于不久前推出的 ChatGPT Images 2.5 模型,用户可上传自拍照或全身照查看试穿效果,也可上传商品图片模拟试穿;此外还能让 ChatGPT 按风格挑出整套造型单品,或上传名人穿搭照片找出可购买的同款商品。
彭博社马克 · 古尔曼在 Power On 播客中爆料,苹果首款智能家居中枢(Home Hub)将采用 AI 面部识别,识别当前家庭成员后切换显示专属的照片、音乐和日历事件。古尔曼称该产品不会采用 Face ID,但未细说具体区别。AppleInsider 推测,苹果未来智能家居摄像头也可能使用同款技术,用于识别身份并触发安防录像。
苹果正筹备推出代号 J450 的家用智能摄像头,将配合其首款智能家居中枢 Home Hub 工作。该设备采用金属圆柱造型,以低帧率运行并依赖 AI 模型分析环境,不提供可回看的视频,而是通过面部识别判断人员进出、识别宠物活动并推送文字提醒。
索尼 PlayStation 为标准版 PS5 推出基于 AI 的超分辨率技术 QSSR,全称 "Quick Spectral Super Resolution",是 PSSR 的快速演进版本,也是与 AMD 合作项目 "Project Amethyst" 的一部分。该技术采用精简神经网络架构,率先在《漫威金刚狼》《羊蹄山之魂》上获得支持,在 PS5 上显著提升图像细节和稳定性。
Google 在兼容的 Android 设备上的 Gemini Live 中推出 Guided Vision,可通过共享手机相机获得实时语音描述,用于读取小字、描述周围环境、识别和定位物体。
Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It’s the first Human Interaction Model (HIM).
OpenAI 宣布 ChatGPT 全球上线两项购物功能:虚拟试穿衣物和配饰,以及可保存商品的 Favorites 收藏功能。试穿基于新发布的 ChatGPT Images 2.5 模型,用户可上传自拍或全身照生成试穿效果,也能上传商品图片请求试穿;收藏商品会与试穿图片一同存入应用内的 Library。
Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It’s the first Human Interaction Model (HIM).
Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。
推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。
Airbnb 本周随秋季更新上线 AI 驱动的搜索,CEO Brian Chesky 在访谈中认为聊天机器人不适合旅行浏览与购物,公司未来三到六个月将探索支持多人同时使用的"multiplayer" AI 界面。
https://x.com/i/article/2105450924286353408
剩下的唯一一步,就是戴上眼镜来投射这个。 (引用推文:计算机可以创建交互式 3D 图解,帮你直观理解家具组装之类的事情。)
Computer can create interactive 3D diagrams to help you visualize things like furniture assembly.
研究者提出多模态唇形同步评判模型 Align Then Reason(ATR),先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于对齐结果推理内容与时间是否匹配。
研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
针对 LVLM 用 CoT 做空间推理时每步必须锁定单个 token、易造成过早离散化并传播错误的问题,研究者提出 Soft Spatial Reasoning 后训练框架,通过混合 token 嵌入形成连续软状态,让多个候选延续共同影响下一步推理。
Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunks,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
Simon Willison 发布实验性工具 Photo Scrubber,可自动识别照片中人脸并模糊处理,用于分享陌生人照片前保护隐私。工具基于 Google 的 MediaPipe C++ 库,经 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,由他用 GPT-6 Astra 构建产生。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。
Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。
推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。
MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活的运行和构建方式。
Hi everyone, today we released SGLang Omni v0.1.7. This release includes 75 merged PRs and welcomes 8 new contributors, with 8 first-time contributions. We added MiniCPM-o 4.5, NVIDIA PersonaPlex-7B, and OmniTyper powered by MLX streaming ASR, while further improving realtime and stateful Omni serving. 1.Performance: continued optimizations for Qwen3-TTS, Qwen3-Omni, CosyVoice3, MOSS-TTS, and AuK, covering Prefill CUDA Graph, speaker/reference encoding, kernel fusion, batching, and vocoder hot paths. 2.Serving: added Omni session lifecycle, the SGLang streaming session bridge, and a shared /v1/realtime WebSocket runtime, while further improving realtime ASR and streaming serving. 3.Models & hardware: added MiniCPM-o 4.5 multimodal input and speech output, plus PersonaPlex-7B offline speech-to-speech. MiniCPM-o and MiniMax-Music3 now support Intel XPU, with further MUSA support for Qwen3-TTS. 4.Runtime: improved breakable Prefill CUDA Graph, Talker / Code2Wav colocation, priority CUDA streams, scheduler admission, and profiling infrastructure to reduce host overhead and improve high-concurrency stability. https://github.com/sgl-project/sglang-omni/releases/tag/v0.1.7 https://github.com/sgl-project/sglang-omni
inclusionAI 在 Hugging Face 发布开源全模态模型 Ming-flash-omni 2.0,基于 Ling-2.0 MoE 架构,总参数 100B、激活 6B,称在开源全模态 MLLM 中达到 SOTA。