视频来源 B站:探索未至之境

把 PDF、图片、扫描件变成大模型能读懂的文字,是搭知识库、做 RAG 绕不开的第一步。本期视频把 2026 年最值得关注的 OCR / 文档解析(Document AI)开源工具一次性盘点清楚。

视频推荐

横评维度

  • 中文支持
  • 表格公式识别
  • 速度 vs 精度
  • 本地 vs 云部署
  • 开源 vs 商业

三大类工具

传统 OCR 引擎
PaddleOCR、Tesseract、EasyOCR、OCRmyPDF、Surya、RapidOCR

文档解析工具
MinerU、Docling、Marker、MarkItDown、LlamaParse、Unstructured、GROBID

视觉语言模型
PaddleOCR-VL、olmOCR、MonkeyOCR、Qwen2.5-VL、InternVL、Nougat、Kosmos-2.5

转载自 B站 · 视频作者:探索未至之境 · 发布于 2026-06-12

Leave A Comment

Recommended Posts