MinerU + PP-OCRv6 + LLM 纯 CPU 文档转 Markdown:封装 HTTP 服务实战
为什么选 MinerU + PP-OCRv6
这个项目做了什么
一键启动
HTTP 接口
源码里的几个关键设计
异步调用 MinerU CLI
文件大小与自动清理
CORS 全开
LLM 后处理:不是炫技,是真有必要
Docker 构建要点
环境变量
和之前那四个方案比,它站在哪
实测体验与适用边界
跑一遍测试
总结
本文首发地址 https://h89.cn/archives/664.html
两个月前我写过一篇 OCR 方案对比,把 PP-OCRv4、DeepSeek-OCR-2、Ollama deepseek-ocr、PaddleOCR-VL-1.5 在 RTX 4060 上跑了一圈。结论是复杂文档上 PaddleOCR-VL-1.5 最均衡,但代价也明显:CUDA 版本、DLL 缺