跳到正文

#多模态

今日 25 条
9月23日周三
9月22日周二
9月19日周六
9月18日周五
9月17日周四
9月16日周三
  1. Google Blog: AI64

    Google 公布多语言 AI 进展:Gemini 3.5 Live Translate 支持 70 种语言实时口译,TranslateGemma 可离线运行

    Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。

    推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。

9月15日周二
9月14日周一
9月11日周五
9月10日周四
  1. Ant Ling54

    Novita 与蚂蚁百灵合作,在 Hugging Face 上线 Ling-3.0-flash-VL,前 14 天免费。模型总参数 124B、每 token 激活 5.5B,原生支持图像与视频理解,面向多模态推理和智能体工作流。

    引用Novita AI@novita_labs

    🤗 Novita now supports Ling-3.0-flash-VL on @huggingface. 🎁 Free for 14 days. • 124B total parameters · 5.5B active parameters per token • Native image and video understanding • Built for multimodal reasoning and agentic workflows

  2. DeepSeek API updates78

    DeepSeek 发布 DeepSeek-V4.1-Flash,API 价格同步下调

    DeepSeek 正式发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸模型,具备原生多模态视觉理解能力,设计目标是能力上限更高、推理更快、吞吐更大。

    推荐理由:官方公布了新结构系列最小模型的多项基准成绩和 API 迁移方式,开发者可据此评估切换成本与价格变化。

9月9日周三
9月8日周二
  1. Demis Hassabis59

    DeepMind 发布 AlphaGenome Atlas,一个 AI 驱动的可搜索数据库,可预测全部 90 亿种可能单碱基 DNA 变异的影响,帮助科学家更好地理解疾病。产品面向学术研究免费开放,入口为 http://alphagenome.google/atlas。Demis Hassabis 将其类比为 AlphaFold 绘制蛋白质宇宙之后,对人类基因组的绘制。

    引用Google DeepMind@GoogleDeepMind

    We’re launching AlphaGenome Atlas: an AI-powered searchable database mapping the predicted impact of all 9 billion possible single-letter DNA changes. Here’s how it could help researchers better understand our biology 🧵

9月4日周五
  1. Google Research64

    Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。

9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布 WeatherNext 3 全球 AI 天气模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为最先进准确的全球 AI 天气模型。模型直接学习实时卫星数据和气象站观测,逐小时产出最高 5 公里分辨率预报,精度约为 WeatherNext 2 的五倍;中期降水预报 CRPS 相对 IMERG 提升最高 60%。

    推荐理由:官方介绍了新模型的分辨率、逐小时更新和降水精度提升,并说明其在 Google 各产品中的落地方式,读者可评估对天气相关业务的应用价值。

  2. elsewhere articles46

    对卷卷的3小时访谈:从抖音到AI 3D、成为制造业OS的野心、基础模型不会吞噬一切

    数美万物创始人兼CEO任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍了公司最新发布的Hi3D 3.0 2048³模型。他将公司目标从Maker OS推向制造业OS,认为基础模型不会吞噬一切,实体制造仍需能产出生产级3D资产的模型,难点在于拆件、连接结构、材料设备适配与按时交付。

9月2日周三
  1. Fei-Fei Li57

    Fei-Fei Li 宣布 World Labs 团队发布从零训练的多模态世界模型 Atlas。该模型支持像素级精准的相机控制生成帧、从单张输入图像重建大场景、通过重排视频帧模拟时空、从一或多张图像原生输出 3D 空间,以及将多张带位姿图像组合成一致的 3D 世界,潜在应用覆盖 VFX 到机器人。

    引用World Labs@theworldlabs

    Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.

  2. Google DeepMind68

    Google DeepMind 为 Gemini 推出 agentic video understanding 视频分析功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,动态检索视频片段以替代固定帧率处理,token 消耗最多降 88%,成本最多降 66%,准确率最多提升 7%。

    推荐理由:官方给出 token、成本与准确率的具体降幅和开启方式,长视频处理场景下可评估是否切换处理模式。

9月1日周二
  1. Runway News68

    Runway 发布 Interface World Model 首个模型 Solaris,实时生成可交互界面

    Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。

    推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。

8月28日周五