#多模态
#多模态
今日 25 条
-Zho-@ZHO_ZHO_ZHOAI 评分3636
inclusionAI Hugging Face modelsAI 评分5959 inclusionAI 开源全双工交互系统 Realtime-Venus,含 Omni 与 Audio 两个 9B 模型
inclusionAI(Venus Team,蚂蚁集团与清华大学)在 Hugging Face 开源 Realtime-Venus,包含基于 MiniCPM-o 4.5 的 9B 视听交互模型 Realtime-Venus-Omni 和纯音频模型 Realtime-Venus-Audio。
NVIDIA BlogAI 评分3131 NVIDIA 与合作伙伴在新加坡 AI Day 展示东南亚 AI 进展
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 进展,新加坡 HTX 将研究使用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI。
Google Gemini@GeminiAppAI 评分2222
Google AI Developers@googleaidevsAI 评分2727
Google AI Developers@googleaidevsAI 评分2727
Google Blog: AIAI 评分3131 Google 用 Flow 为纽约时装周设计师定制 AI 工具
Google Envisioning Studio 与设计师 Jane Wade、Sergio Hudson 合作,在 Google Flow 中打造 Styling Suite 和 Runway Visualization 两款定制工具,用于纽约时装周。
Google ResearchAI 评分5050 Google Research 用生成式 UI 让教师创建互动学习模拟
Google Research 公布新研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动教育模拟,并已开放 30 多个面向初高中物理、化学、生物和数学的英文学习互动示例库,均由 AI 生成、教师审核。
Google Gemini@GeminiAppAI 评分3737
OpenRouter AnnouncementsAI 评分5656 OpenRouter 解析 DeepSeek V4 各型号是否支持图像输入
OpenRouter 逐一梳理 DeepSeek V4 家族的输入模态:仅 deepseek/deepseek-v4.1-flash 和 deepseek/deepseek-v4-flash-vision-exp 接受图像,其余 V4 Pro 0813、V4 Flash 0731、两个 0423 checkpoint 和 Flash latest alias 均为纯文本。
Sundar Pichai@sundarpichaiAI 评分3333
Google AI@GoogleAI精选AI 评分7474Google AI 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音模型。

推荐理由:原文分述两款语音模型的能力差异与使用场景,读者可据此判断选型方向。
Google Blog: AIAI 评分4040 Google 发布 AI & Economy ATLAS,AI 技术已支持超 300 种语言
Google 宣布其技术现已支持超 300 种语言,覆盖 70 亿人、占全球人口 86%,并同步发布 AI & Economy ATLAS 交互洞察。同期科学进展包括开放 AlphaGenome Atlas 全基因组 90 亿个单字母变异预测,推出全球天气模型 WeatherNext 3,其提前一天以上降水预报准确率提升 50%。
Google Blog: AI精选AI 评分6464 Google 公布多语言 AI 进展:Gemini 3.5 Live Translate 支持 70 种语言实时口译,TranslateGemma 可离线运行
Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。
推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。
inclusionAI Hugging Face modelsAI 评分5353 inclusionAI 发布 MoE 块扩散视觉语言 GUI Agent 模型 LLaDA-UI
inclusionAI 在 Hugging Face 开源 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI Agent,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
Microsoft Research@MSFTResearchAI 评分2424
Google AI@GoogleAIAI 评分5757
Google DeepMind@GoogleDeepMindAI 评分3131
Ant Ling@AntLingAGIAI 评分4949Ling-3.0-flash-VL 两项更新: - 现已在 OpenRouter 上线,提供两周免费访问 - FP4 和 INT4 量化版本现已开源 可通过 API 试用或自行部署——由你选择。


Google Gemini@GeminiAppAI 评分5757Google Gemini 宣布 Gemini 应用正式支持 Windows。用户按下 Alt + Space 即可随时唤出,在常用工具旁润色文稿、总结长文档、头脑风暴以及生成自定义图像和视频。

SiliconFlow@SiliconFlowAI精选AI 评分6767
推荐理由:原文给出 DeepSeek-V4.1-Flash 的参数结构、上下文长度和开源协议,读者可据此评估其部署与成本价值。
Hugging Face Blog精选AI 评分6262 Gradio Workflow 重建 AUTOMATIC1111 大部分功能为 Workflow1111
Hugging Face 团队用 gr.Workflow 将 AUTOMATIC1111 的主要功能重建为 Workflow1111,画布包含 11 条媒体管线。
推荐理由:原文拆解了 11 条媒体管线和 73 个节点的具体构成,展示了 Gradio Workflow 混搭多模型并自动生成 REST 与 MCP 端点的做法。
Ant Ling@AntLingAGIAI 评分5454引用Novita AI@novita_labs🤗 Novita now supports Ling-3.0-flash-VL on @huggingface. 🎁 Free for 14 days. • 124B total parameters · 5.5B active parameters per token • Native image and video understanding • Built for multimodal reasoning and agentic workflows
Google Blog: AIAI 评分5555 Google DeepMind 与电影人用 AI 逐帧重建 70 年爱情往事
Google DeepMind 与 Primordial Soup 合作制作纪录短片《Love, Rendered》,用 AI 重建 Burt 和 Ethelle Shatz 结婚 70 多年来未被拍摄记录的初遇记忆。
DeepSeek API updates精选AI 评分7878 DeepSeek 发布 DeepSeek-V4.1-Flash,API 价格同步下调
DeepSeek 正式发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸模型,具备原生多模态视觉理解能力,设计目标是能力上限更高、推理更快、吞吐更大。
推荐理由:官方公布了新结构系列最小模型的多项基准成绩和 API 迁移方式,开发者可据此评估切换成本与价格变化。
Suno Blog精选AI 评分6868 Suno 发布 v6 下一代音乐模型,推出 v6、v6-wild、v6-mini 三档
Suno 发布 v6 新一代音乐模型,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,并最终以下一代模型替换旧模型。
推荐理由:原文由官方给出三档模型分工与具体编辑能力示例,读者可以据此判断新工作流是否适合自己。
Google Gemini@GeminiAppAI 评分4040借助 Gemini Live 控制杂乱。 从选购新的收纳用品到寻找当地的电池处理点,Gemini 都能帮你更聪明地整理杂物。只需打开 Gemini Live,把摄像头对准杂乱处,实时讨论如何整理。

Demis Hassabis@demishassabisAI 评分5959引用Google DeepMind@GoogleDeepMindWe’re launching AlphaGenome Atlas: an AI-powered searchable database mapping the predicted impact of all 9 billion possible single-letter DNA changes. Here’s how it could help researchers better understand our biology 🧵
SiliconFlow@SiliconFlowAIAI 评分6464
Google Research精选AI 评分6464 Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。
Google DeepMind精选AI 评分7272 Google DeepMind 发布 WeatherNext 3 全球 AI 天气模型
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为最先进准确的全球 AI 天气模型。模型直接学习实时卫星数据和气象站观测,逐小时产出最高 5 公里分辨率预报,精度约为 WeatherNext 2 的五倍;中期降水预报 CRPS 相对 IMERG 提升最高 60%。
推荐理由:官方介绍了新模型的分辨率、逐小时更新和降水精度提升,并说明其在 Google 各产品中的落地方式,读者可评估对天气相关业务的应用价值。
Hugging Face BlogAI 评分5454 H Company 发布 NeoMME 多语言多模态编码器,含 260M 与 800M 两种规格
H Company 发布 NeoMME 系列多语言多模态编码器,有 260M 和 800M 两种规格,用单个双向 Transformer 从头训练处理文本 token 和 32×32 图像 patch,不依赖预训练视觉塔或因果语言模型。
elsewhere articlesAI 评分4646 对卷卷的3小时访谈:从抖音到AI 3D、成为制造业OS的野心、基础模型不会吞噬一切
数美万物创始人兼CEO任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍了公司最新发布的Hi3D 3.0 2048³模型。他将公司目标从Maker OS推向制造业OS,认为基础模型不会吞噬一切,实体制造仍需能产出生产级3D资产的模型,难点在于拆件、连接结构、材料设备适配与按时交付。
Google AI Developers@googleaidevsAI 评分5353
Fei-Fei Li@drfeifeiAI 评分5757引用World Labs@theworldlabsIntroducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.
Google DeepMind精选AI 评分6868 Google DeepMind 为 Gemini 推出 agentic video understanding 视频分析功能
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,动态检索视频片段以替代固定帧率处理,token 消耗最多降 88%,成本最多降 66%,准确率最多提升 7%。
推荐理由:官方给出 token、成本与准确率的具体降幅和开启方式,长视频处理场景下可评估是否切换处理模式。
Runway News精选AI 评分6868 Runway 发布 Interface World Model 首个模型 Solaris,实时生成可交互界面
Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。
推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。
Hugging Face BlogAI 评分5151 Open ASR Leaderboard 新增 Monsoon 印地语与印度英语评测集
Voice Arena 与 Hugging Face 在 Open ASR Leaderboard 推出 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,共 4 个 split、4,888 名说话人、约 17 小时对话语音,印地语成为多语言标签页里第一个南亚语言。
Google ResearchAI 评分5151 Google 发布行星预测引擎 PPE,用自然语言自动完成地理空间建模
Google 在 Earth AI 体系下推出实验性研究能力 PPE(planetary prediction engine),从自然语言查询出发自主完成地理空间预测的全流程,包括数据发现、清洗、特征工程、模型训练与评估。
Google DeepMind精选AI 评分7272 Google DeepMind 发布 Gemini Omni 1.1 Flash,强化生成式视频创作控制
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供一组创意控制和生成式视频能力,可通过 Google AI Studio 中的 Gemini API 使用。
推荐理由:官方披露了场景扩展、首末帧插值、4K 放大等具体能力与可用入口,便于开发者评估是否迁移现有视频生成工作流。