作者:@刘悦的技术博客
MinerU 3 v3.4.4:图片/PDF/Word/PPT一键解析Markdown
一句话导读:视频演示 OpenDataLab 的 MinerU 3 v3.4.4 本地文档解析流程,可把图片、PDF、Word 和 PPT 中的内容转换为可下载或直接复制的文本结果。
核心内容:
1. 作者双击启动程序后上传图片并点击转换,展示了从图片识别内容到下载结果、在右侧复制文本的完整操作路径。
2. PDF 测试使用一份约 160 页、11 万字的小说文档,视频中记录的解析时间约为 1 分钟;该结果来自作者本次设备与样本,不代表所有硬件和复杂版式的固定性能。
3. 演示设备为 4060 笔记本,视频中解析图片时观察到约 3GB 显存占用。标题同时标注兼容 GPU、纯 CPU 和约 4GB 显存设备,但视频没有逐项展示这些环境,实际兼容性应结合项目说明和本机测试确认。
4. 作者继续演示 Word 与 PPT 解析。界面无法预览微软系文档,但不影响转换;视频还介绍该版本可处理表格、公式和图像等内容,复杂图文混排效果仍建议用自己的文件核验。
5. 默认首屏评论中有人询问与 PaddleOCR 1.5 的差异,视频未做同样本对比,因此本文不推断两者的识别率或速度优劣。
适合人群:需要把论文、长篇 PDF、办公文档或图片内容整理为 Markdown/文本,并希望本地完成 OCR 与结构化提取的用户。
补充说明:本文根据授权视频完整音频转写、视频元数据和默认首屏评论整理;性能数据仅对应视频展示环境,安装方式、CPU 模式及复杂版式能力请结合原视频和项目资料进一步核对。
相关夸克网盘链接:
【MinerU-3:https://pan.quark.cn/s/153397fcc419】 |