
MinerU - 智能文档解析平台,PDF转换、表格还原与公式提取工具
MinerU 简介
MinerU是上海人工智能实验室OpenDataLab团队开源的智能文档解析平台,起源于“书生·浦语”大模型预训练过程中的数据提取需求。平台面向LLM、RAG与Agent工作流,支持将PDF、DOCX、PPTX、XLSX、图片及网页等格式转换为结构化的Markdown和JSON。其核心能力在于对复杂文档元素的精准识别——表格还原、公式转化、分子结构检测与多语言OCR,帮助开发者解决非结构化文档难以被AI有效读取的问题。平台已在GitHub获得超过8万Star,并完成10余家国产AI芯片的算力适配。
MinerU 核心功能/服务
表格智能还原与结构化:攻克旋转、跨页、合并单元格等复杂表格解析难题,输出CSV、HTML、Markdown等机器可读格式,消除AI对表格数据的阅读障碍,无缝接入RAG数据处理流。
公式精准转化与多语言OCR:强力解析长公式、多行公式与复杂嵌套数学结构,输出LaTeX/MathML标准格式。支持109种语言文字识别,为科研类Agent与数理大模型提供标准输入。
分子检测识别与化学反应提取:具备SOTA性能的分子结构图识别能力,原子和键的识别与原始图像严格对应。可精确提取化学反应过程,识别反应物、反应条件等关键要素,实现全局分子关联。
MinerU 适合谁
- AI应用与RAG系统开发者:需要将PDF、Office文档批量转换为结构化数据以构建知识库或检索增强生成系统的开发者,可利用MinerU的Markdown/JSON输出提升文档解析质量与效率。
- 科研人员与学术工作者:需要从论文、实验报告中提取公式、表格或分子结构信息的科研人员,可借助公式LaTeX转换与分子检测功能获取机器可读的科研数据。
- 关注国产算力适配的技术团队:需要在昇腾、寒武纪、海光等国产AI芯片环境中部署文档解析能力的团队,可利用MinerU完成的多家国产算力适配方案进行本地化部署。
为什么选择MinerU
MinerU的差异化在于以1.2B参数规模的MinerU2.5模型,在OmniDocBench等权威评测上全面超越Gemini2.5-Pro、GPT-4o等主流通用大模型。平台起源于大模型预训练的真实数据需求,对科研文档中公式、表格、分子式等复杂元素具备针对性优化。项目已完成昇腾、平头哥、沐曦、海光、寒武纪、昆仑芯等10余家国产算力的适配,为国内开发者提供了自主可控的文档解析方案。访问MinerU官网,下载客户端或通过在线服务体验文档解析功能。
数据统计
关于(MinerU)特别声明
本站商娱网提供的MinerU都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由商娱网实际控制,在2026-09-21 10:34收录和巡查时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,商娱网不承担任何责任。
相关导航

TinyHumans AI

Miro AI
involve.me
Cordys CRM
Gety.ai



