AI 导读
大多数多模态模型仍把文本和图像当作两个独立问题。 一部分负责读取。另一部分负责推理。还有一部分负责生成。 SenseNova U1 正在尝试不同的做法:一个统一模型,让语言和视觉在同一架构内协同工作。
正文
Most multimodal models still treat text and images like separate problems.
One part reads. Another part reasons. Another part generates.
SenseNova U1 is trying something different: one unified model where language and vision work inside the same architecture.
来源:@FutureStacked · x.com