跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

当前仅显示精选新闻
218条精选相关主题图像生成AI 视频语音与音频

最新精选

第 1–20 条 · 共 218 条
10月5日周一
  1. AYi66

    作者转述铁柱跑通的方案:用苹果快捷指令通过 Webhook 把微信合并转发的图文记录自动喂给后端 Grok Bot,云端自动解压、读取多模态内容并分类沉淀进知识库,回传收录回执。快捷指令还支持截图、录音、输入想法等五种收录模式,可绑定动作按钮或轻敲背面触发;快捷指令和 Bot 配置提示词已全部公开,导入即可使用。

    引用铁柱AGI@cgnot996

    https://x.com/i/article/2106981384502059008

    推荐理由:原文拆解了用 iOS 快捷指令加 Webhook 把微信图文记录自动沉淀进 Grok Bot 知识库的完整流程,配置已公开可直接导入。

10月3日周六
  1. 硅星人Pro · 微信公众号65

    Tavus 发布实时视频交互模型 Griffin,48% 参与者把预览版当成真人

    Tavus 发布实时视频交互模型 Griffin,在54人一分钟视频通话实验中,26人(约48%)把预览版 Griffin-Lite 当成真人,上一代系统该比例为 2.4%。模型采用全双工视频交互方案,可同时看听说并依据表情、视线和停顿回应,音频到视频生成平均延迟 0.43 秒,实时生成 720p、25 帧每秒画面;目前仅向部分可信测试者开放研究预览,团队正开发 AI 身份披露功能。

    推荐理由:原文同时给出48%的实验数字和延迟、榜单成绩,读者可以据此自行判断这轮视频交互能力的边界。

  2. DeepTech深科技 · 微信公众号67

    Tavus 发布全双工人类交互模型 Griffin,48% 受试者误认其为真人

    Tavus 于 10 月 1 日发布全双工视频到视频模型 Griffin(研究预览版 Griffin-Lite),将感知、决策和生成整合进端到端系统,替代传统级联架构。

    推荐理由:原文给出了 Griffin 的架构思路、VideoFDB 评测数据和盲测结果,读者可对比级联方案与端到端实时交互的差异。

10月2日周五
  1. AYi75

    作者推荐 KobinFlow 的万字实战教程,仅用免费的混元 3D 和 DeepSeek Flash,把一张 AI 画的坐姿小狐狸做成浏览器里可拖拽、实时眨眼、随 WebAudio 节拍点头的 3D 交互电台。

    引用Kobin@KobinFlow

    https://x.com/i/article/2105994013270847488

    推荐理由:原文拆解了用免费模型与前端代码驱动无骨骼 3D 模型动起来的可复用方法,并给出压缩数据与适用边界。

  2. Microsoft AI News61

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 及 MAI-Voice-2.1 语音模型

    Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。

    推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。

10月1日周四
9月29日周二
  1. Microsoft Research61

    Microsoft Research 发布生物研究领域 AI 系统 Quine

    Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。

    推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。

  2. AI前线 · 微信公众号70

    Manus 2.0 发布:重做智能体底层框架 Cascade,同步推出个人智能体应用 Cue

    Manus 团队 9 月 28 日发布 Manus 2.0,重做智能体执行底层框架 Cascade,推出可长期运行的云电脑和事件触发的 Automations,并将桌面应用升级为覆盖文档、视频和游戏开发的 Manus Studio。

    推荐理由:原文梳理了 Manus 2.0 三项底层更新与 Cue 的身份设计,并对比 Meta Muse 路线差异,读者可据此判断个人智能体的方向。

  3. clem 🤗77

    AMD 宣布欢迎 World Labs 和李飞飞加入 AMD,双方计划结合 World Labs 在 AI 与世界模型方面的专长与 AMD 的算力能力,推动 AI 未来并强化开放 AI 生态。Hugging Face CEO Clément Delangue 转发该消息并祝贺,期待双方未来数年的成果。

    引用Lisa Su@LisaSu

    So excited to welcome @theworldlabs and @drfeifei to the @AMD family! I’ve always been a huge fan of Fei-Fei and her pioneering research in AI. Together, we’ll combine World Labs’ deep expertise in AI and world models with AMD’s compute leadership to power the future of AI and strengthen the open AI ecosystem. Can’t wait for all we’ll accomplish!

    推荐理由:AMD 收购 World Labs 与李飞飞的消息结合 World Labs 专注世界模型与开放生态的定位,读者可了解这次结合对 AI 开源生态的影响。

  4. AI寒武纪 · 微信公众号78

    AMD 以 82 亿美金收购李飞飞的 World Labs,李飞飞出任 AMD 执行副总裁兼首席科学家

    李飞飞宣布其空间智能公司 World Labs 以 82 亿美金加入 AMD,她本人出任 AMD 执行副总裁兼首席科学家,与苏姿丰共事。World Labs 曾收购 SceniX 发力机器人仿真,并推出根据 2D 图像预测下一视角的全能模型架构 Atlas,技术已应用于机器人强化学习环境构建、医疗与娱乐场景生成、房地产与建筑现实重建。

    推荐理由:原文引用李飞飞公开信与苏姿丰的早期投资人关系,解释了从空间智能研究转向软硬件一体化的动机。

9月24日周四
9月23日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。

    推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。

9月16日周三
  1. Google Blog: AI64

    Google 公布多语言 AI 进展:Gemini 3.5 Live Translate 支持 70 种语言实时口译,TranslateGemma 可离线运行

    Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。

    推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。

9月12日周六
9月10日周四
  1. @WorkBuddy_AI75

    DeepSeek V4.1-Flash 上线 DeepSeek API 并在 WorkBuddy 开放,原生支持多模态,WorkBuddy 提供两周免费试用。V4-Flash 与 V4-Flash-Vision-Exp 已退役,deepseek-v4-flash 等相关名称临时路由到 V4.1-Flash;多方差测显示 V4.1-Flash 在性能、成本、速度与总运行时间上超过 V4-Pro,V4-Pro 将逐步下线。自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求将按 V4.1-Flash 费率路由到 V4.1-Flash,直至 V4.1-Pro 发布;WorkBuddy(含 Codebuddy)与 opencode 等官方合作伙伴已全面支持。

    引用@deepseek_ai@deepseek_ai

    ⚡ V4.1-Flash is now live on the DeepSeek API with native multimodal support. Set your model to deepseek-flash. 🔹 V4-Flash & V4-Flash-Vision-Exp are retired. For compatibility, deepseek-v4-flash and deepseek-v4-flash-vision-exp temporarily route to V4.1-Flash. 🔹 Tests by multiple parties put V4.1-Flash ahead of V4-Pro on performance, cost, speed & total runtime. We’re phasing out V4-Pro. 🔹 Starting at 04:00 UTC on Sept 14, 2026, all deepseek-v4-pro requests will route to V4.1-Flash at V4.1-Flash rates. This will continue until V4.1-Pro launches. 🤝 Official partners @WorkBuddy_AI (including Codebuddy) & @opencode now fully support V4.1-Flash. Try it today! 4/6

    推荐理由:DeepSeek 以 V4.1-Flash 取代 V4-Pro,读者可以据此了解模型迭代在性能、成本与速度之间的取舍。

  2. @kimmonismus85

    DeepSeek 发布 V4.1-Flash,距离 7 月的 V4-Flash 更新约六周,改用 Causal Encoder–Decoder 新架构并具备原生视觉理解能力。

    引用@deepseek_ai@deepseek_ai

    🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6

    推荐理由:距上代仅六周,DeepSeek 在新架构下同时给出参数量、KV-cache 占用与 API 价格的变化,可与前代直接对照。