机构报纸流水线:从历史报纸中提取数十亿高质量 token
Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究团队与波士顿公共图书馆联合发布 Institutional Newspapers Pipeline,从 1,473,635 份 1795 至 1930 年的公有领域报纸扫描件中提取出 83.1 million 个文本切片,OCR 输出达 16.3 billion 个 o200k_base token。
来源:Hugging Face Daily Papers · arxiv.org