OCR 已死,Agentic OCR 长存:LlamaParse 如何为 AI 智能体解析文档
LlamaIndex 提出 Agentic OCR 理念,即文档解析系统通过 LLM 工具调用循环自主决定阅读策略、调用专用模型并基于结果迭代,而非传统 OCR 的单次转换。该系统需满足三项要求:解析策略随文档自适应、纠错须有证据支撑、执行过程有明确时限与目标。LlamaParse 已在 "Agentic" 和 "Agentic Plus" 档位提供上述能力。
llamaindex.ai · 网站与博客
LlamaIndex 提出 Agentic OCR 理念,即文档解析系统通过 LLM 工具调用循环自主决定阅读策略、调用专用模型并基于结果迭代,而非传统 OCR 的单次转换。该系统需满足三项要求:解析策略随文档自适应、纠错须有证据支撑、执行过程有明确时限与目标。LlamaParse 已在 "Agentic" 和 "Agentic Plus" 档位提供上述能力。
LlamaIndex 发布 Extract v2.5,基于 schema 的文档抽取智能体全档位准确率提升且每页价格不变。Cost Effective 在 ExtractBench 上从 87.1 升至 93.9,Agentic 从 89.8 升至 95.8,Agentic Plus 从 95.1 升至 96.4。
LlamaIndex 发文解释 VLM 难以处理表单的原因:表单含文本框、复选框、签名等 Markdown 无法表达的结构,且复选框勾选与否会直接改变下游智能体动作。LlamaParse 将表单表示为可任意嵌套的字段与 section 树,字段含 id、label、value 与 field 类型,并以 W-2、Form 1040 为例展示 JSON 输出,称其以更低成本优于通用 VLM。
LlamaIndex 发布 LiteParse 2.14.6,通过 PDFium fork 的内存分配优化等改动,文本提取提速 20-25%,平均 2.76ms/页、markdown 渲染 3.94ms/页,并称在所测开源解析器中最快;表格提取在 opendataloader-bench 从 0.693 升至 0.818。
LlamaIndex 发文指出 AI 文档抽取中解析层已很成熟,真正拉低准确率的是未经审查的 schema 设计:required 字段逼模型编造值、同一字段在不同发行方含义不同、把重复结构坍缩成标量。
推荐理由:原文把文档抽取的失败从模型问题拆到 schema 设计,给出 required、歧义、一对多三类具体修复方案,方法可直接迁移。
LlamaIndex 发文分析 OCR 文档处理中单字段准确率与自动化率的错配,指出审核队列大小由路由用的置信信号决定而非抽取准确率。
多数智能文档处理(IDP)平台在演示中表现良好,但在生产环境中会因文档多样性而失效,演示与生产的准确率差距常达 10 到 20 个百分点,干净 PDF 上 98% 的准确率在实际收件上可能只有 82%。