标签 ocr 下的文章

为什么选 MinerU + PP-OCRv6 这个项目做了什么 一键启动 HTTP 接口 源码里的几个关键设计 异步调用 MinerU CLI 文件大小与自动清理 CORS 全开 LLM 后处理:不是炫技,是真有必要 Docker 构建要点 环境变量 和之前那四个方案比,它站在哪 实测体验与适用边界 跑一遍测试 总结 本文首发地址 https://h89.cn/archives/664.html 两个月前我写过一篇 OCR 方案对比,把 PP-OCRv4、DeepSeek-OCR-2、Ollama deepseek-ocr、PaddleOCR-VL-1.5 在 RTX 4060 上跑了一圈。结论是复杂文档上 PaddleOCR-VL-1.5 最均衡,但代价也明显:CUDA 版本、DLL 缺

- 阅读剩余部分 -

一、AI 读不懂 PDF,很多时候不是 AI 的锅 二、PP-OCRv4:快是真快,坑也是真的多 跑起来之后的惊喜 但结果让我哭笑不得 代码写得我头大 三、DeepSeek-OCR-2:让 VLM 来收拾残局 效果确实好了 但速度让我回到了拨号上网时代 同模型换后端:Ollama 四、PaddleOCR-VL-1.5:两手都要抓 架构设计很聪明 体验出奇地好 五、实测数据一图看清 六、优化验证:速度提升后,质量有没有垮? 优化前后耗时对比 代码改动记录 七、那些让我想摔键盘的坑 PP-OCRv4 的五连坑 DeepSeek-OCR-2 的坑 Ollama 的坑 PaddleOCR-VL-1.5 的坑 八、到底该选谁? 九、写在最后 本文首发地址 https://h89.cn/archives/596.html 测试设备:NVIDI

- 阅读剩余部分 -

一、背景与目标 二、技术选型与依赖 三、项目结构与关键文件 四、功能实现概览(拍照 + OCR + 翻译) 五、为什么能“离线”? 六、本地运行与安装 克隆项目 构建与安装 七、项目特色与技术亮点 离线优先设计 技术实现细节 项目源码 八、常见问题(FAQ) 九、结语 本文首发地址 https://h89.cn/archives/440.html 一、背景与目标 目标:做一个“拍照翻译”App,在弱网/无网环境下也能工作。离线识别图片中的中文/英文等文字,并把识别结果翻译成中文。 方案: 使用 Google ML Kit Text Recognition v2 实现离线 OCR(中文优先,Latin 回退)。 使用 ML Kit On‑device Translation 实现离线翻译(首次联网下载语言包,下载完成后完全离线)。

- 阅读剩余部分 -