跳到正文
@FutureStacked· @futurestacked · X·· 2026-05-13AI 评分25
AI 导读

大多数多模态模型仍把文本和图像当作两个独立问题。 一部分负责读取。另一部分负责推理。还有一部分负责生成。 SenseNova U1 正在尝试不同的做法:一个统一模型,让语言和视觉在同一架构内协同工作。

正文

Most multimodal models still treat text and images like separate problems.

One part reads. Another part reasons. Another part generates.

SenseNova U1 is trying something different: one unified model where language and vision work inside the same architecture.

来源:@FutureStacked · x.com