跳到正文
@frxiaobei· @frxiaobei · X·· 2026-08-30AI 评分39
AI 导读

腾讯 EVIE 不走 OCR 路线,直接将整页文档作为视觉信息做 Embedding,在视觉空间完成检索;百度 PaddleOCR-VL 则以约 1B 参数模型直接理解文字、表格、公式和图表,将复杂文档结构化。

正文

最近把腾讯刚出的 EVIE 和百度 PaddleOCR-VL 放在一起看,感觉 Document AI 正在发生一个很重要的变化。

过去做 RAG,有一个几乎没人质疑的前提:

先把世界变成文字,再让 AI 理解。

PDF 先 OCR,表格转 Markdown,图片提取文字,然后切 Chunk、Embedding、进向量库。

PaddleOCR-VL 已经把这条路线做得非常极致:1B 左右的模型,可以直接理解文字、表格、公式、图表,把复杂文档结构化。

但腾讯 EVIE 走了另一条路。
它甚至不急着读文档,而是直接把整页当成视觉信息做 Embedding,在视觉空间里完成检索。

所以一个很有意思的变化出现了:
以前是 Parse Everything → Search Text。

以后可能是:
See Everything → Retrieve → Parse Only What Matters → Reason。

这不只是少做一次 OCR。

更重要的是 AI 不再要求现实世界先被压缩成文字,才能进入它的检索和推理系统。

表格的位置、图表的趋势、字体、颜色、空间关系,本来就是信息。把它们 OCR 成一串文字,本身就是一次有损压缩。

所以 EVIE 和 PaddleOCR-VL 在我看来并不是竞争关系,反而刚好拼出了下一代 Document RAG 的雏形:

Visual Retrieval → Document Parsing → LLM Reasoning

过去我们想的是怎么让 AI 读懂更多文档。

下一阶段的问题可能变成:
既然模型已经有眼睛了,为什么还要先把世界翻译成文字给它看?

https://t.co/v6qVBko62U

来源:@frxiaobei · x.com