视频来源 B站:探索未至之境
把 PDF、图片、扫描件变成大模型能读懂的文字,是搭知识库、做 RAG 绕不开的第一步。本期视频把 2026 年最值得关注的 OCR / 文档解析(Document AI)开源工具一次性盘点清楚。
视频推荐
横评维度
- 中文支持
- 表格公式识别
- 速度 vs 精度
- 本地 vs 云部署
- 开源 vs 商业
三大类工具
传统 OCR 引擎
PaddleOCR、Tesseract、EasyOCR、OCRmyPDF、Surya、RapidOCR
文档解析工具
MinerU、Docling、Marker、MarkItDown、LlamaParse、Unstructured、GROBID
视觉语言模型
PaddleOCR-VL、olmOCR、MonkeyOCR、Qwen2.5-VL、InternVL、Nougat、Kosmos-2.5
转载自 B站 · 视频作者:探索未至之境 · 发布于 2026-06-12