GLM-OCR实战:如何把一份PDF从图片变成结构化Markdown
GLM-OCR实战如何把一份PDF从图片变成结构化Markdown【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR 如果你正在找一款能快速把 PDF 变成结构化 Markdown 的 OCR 工具那么 GLM-OCR 值得放进你的工具箱。GLM-OCR 是一款面向复杂文档理解的多模态 OCR 模型它能把扫描件、拍照件甚至整份 PDF 逐页转成带表格、公式LaTeX和版式坐标的结构化 Markdown总参数量仅 0.9B支持云端 API 与本地自部署是新手上手文档结构化成本很低的高精度 × 快 × 全面方案。为什么选 GLM-OCR不止识别文字传统 OCR 往往只吐出一堆纯文本段落错位、表格散架、公式变成乱码。GLM-OCR 走的是两阶段路线版面分析基于 PP-DocLayout-V3 先找出页面上的文本、表格、公式、图片等区域并行识别把每个区域裁剪后并行送入视觉语言模型识别再按阅读顺序合并。关键特性一览 在 OmniDocBench V1.5 上取得 94.62 分综合排名第一 复杂表格、代码密集文档、印章、手写体等真实高难场景表现稳定⚡ 0.9B 参数支持 vLLM、SGLang、Ollama 部署推理成本低 全面开源提供完整 SDK 与 Web 应用一行命令即可调用原始输入文档论文页图片长这样版面元素混杂着正文与数学公式三步流水线PDF 是怎么变成 Markdown 的GLM-OCR 的核心是一条三段式异步流水线源码在 glmocr/pipeline/pipeline.py阶段模块做什么① 加载页面PageLoader读取图片PDF 先转成逐页图片② 版面检测LayoutDetector检测每页的文本/表格/公式/图片区域③ 区域识别OCRClient调用 GLM-OCR 模型服务并行识别各区域④ 结果格式化ResultFormatter按阅读顺序合并输出 JSON Markdown各模块可单独替换扩展页面加载见 glmocr/dataloader/page_loader.py版面检测见 glmocr/layout/layout_detector.py结果格式化见 glmocr/postprocess/result_formatter.py。下图是第②步的效果——版面上每个区域都被框出并标注类型最快上手四步完成配置第 1 步安装 SDK按场景选择最轻量的安装方式# 云端 API 模式无需 GPU安装最快 pip install glmocr # 本地自部署完整流水线含版面分析 pip install glmocr[selfhosted]第 2 步安装 PopplerPDF 转图片依赖PDF 输入依赖 Poppler 工具集pdftoppm等。参考 examples/example.py 中的检测逻辑macOS 可执行brew install popplerLinux 可用apt install poppler-utils。第 3 步准备 OCR 模型服务三种方式任选其一配置文件为 glmocr/config.yamlMaaS 云端 API推荐新手在config.yaml中启用pipeline.maas并填入 API KeySDK 只负责转发请求直接返回 Markdown JSON 版面详情本地无需 GPUvLLM / SGLang 自部署本地起模型服务SDK 跑完整流水线数据完全可控SDK Server ClientGPU 机器上跑服务其他机器免 GPU 远程调用第 4 步一行命令解析# 解析整份 PDF结果输出到指定目录 glmocr parse 文档.pdf --output ./results/ # 也可以直接解析目录里所有图片 glmocr parse examples/source/Python 调用同样简洁from glmocr import parseresult parse(文档.pdf)后调用result.save()即可见 glmocr/api.py。读懂结果.md、.json 和版面可视化解析完成后输出目录会生成三类产物results/ └── 文档名/ ├── 文档名.md # 结构化 Markdown正文 表格 LaTeX 公式 ├── 文档名.json # 逐元素的结构化数据 └── layout_vis/ # 版面检测可视化图片其中.json是结构化的关键。每个元素都有index、label文本/公式/表格、content和bbox_2d像素坐标例如论文页的输出节选自 examples/result/paper/paper.json{ index: 2, label: formula, content: $$\\sum_{i1}^{n} x_i \\frac{\\partial R}{\\partial x_i} d R.$$ , bbox_2d: [234, 200, 341, 234] }对应的 Markdown 版本见 examples/result/paper/paper.md——公式已转为可渲染的 LaTeX。坐标信息则让你可以反向定位原文位置比如做原文 ↔ 识别结果高亮联动。实战一份 41 页 PDF 的解析效果仓库自带了一份 41 页的真实 PDF 测试文档examples/source/GLM-4.5V.pdf解析结果完整保存在 examples/result/GLM-4.5V/包括 41 页的 Markdown、JSON 和逐页版面可视化。下图是其中一页的检测结果段落、公式、图表区域都被准确划分多元素混合页面同样不在话下比如财务报表中的大表格表格会被输出为带thead/tbody的 HTML 表格数据一个不少见 examples/result/table/table.json。覆盖更多真实场景GLM-OCR 针对真实业务痛点做了优化仓库examples/result/下有对应的效果展示✍️手写文档见 examples/result/handwritten/handwritten.md印章识别见 examples/result/seal/seal.md代码截图见 examples/result/code/code.md化学式微调还附了基于 LLaMA-Factory 的微调示例见 examples/finetune/README_zh.md进阶开箱即用的 Web 应用 不想敲命令行仓库内置了一套完整的 Web 文档处理应用FastAPI 异步后端 React 前端支持上传 PDF → 实时进度跟踪 → 页面级高亮联动 → Markdown 预览/导出还带任务队列、自动重试与多 Worker 并发架构说明见 apps/backend/README.md。# 用 Docker 一键启动前后端 bash apps/start-docker.sh # 或本地开发模式 bash apps/start-local.sh # 前端 http://localhost:5173后端 API 文档 http://localhost:8000/docs其中 PDF 转图片步骤的实现在 apps/backend/app/core/steps/pdf_to_image.py结果合并步骤在 apps/backend/app/core/steps/merge_results.py想定制流程可以从这里入手。此外GLM-OCR 还支持 Agent Skill 模式pip install glmocr 配置 API Key即可让 AI 助手直接把提取这张图片/这份 PDF 的文字这类任务委托给 GLM-OCR详见 skills/glmocr/SKILL.md。小结你的需求推荐路径快速体验、无 GPUMaaS 云端 API pip install glmocr数据不出内网vLLM/SGLang 自部署 glmocr[selfhosted]团队批量处理Web 应用apps/或 Flask 服务python -m glmocr.server接入 AI AgentSkill 模式skills/glmocr/一句话总结装好 SDK、配好模型服务、执行glmocr parse 你的文档.pdf几分钟后你就拿到一份干净的结构化 Markdown 和可定位每个元素的 JSON——这就是 GLM-OCR 把图片 PDF 变结构化文档的全部成本。【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

VL53L9CX多区ToF传感器binning适配:Transform库动态坐标映射实战

VL53L9CX多区ToF传感器binning适配:Transform库动态坐标映射实战

刚把项目从VL53L5CX迁移到VL53L9CX时,我就被binning参数折腾了一整个下午。传感器本身能输出6、8、12、24这几种binning模式,看着手册里每个模式的数据格式都标得清清楚楚,但一接到我自己维护的Transform库,点云就开始"灵魂出…

2026/8/31 17:04:52 阅读更多 →
前端面试别只会背题:底层逻辑与高频考点全解析

前端面试别只会背题:底层逻辑与高频考点全解析

认识我的人都知道,这些年我一直在带前端团队,也断断续续参与了上百场面试。后台经常有朋友发消息问我:前端面试到底该准备什么?为什么背了一堆题还是挂?面经看了一篇又一篇,感觉像在刷题库,但面…

2026/8/31 17:06:20 阅读更多 →
uBlock Origin 完整指南:4 大核心能力 + 上手 5 步,免费拦截广告与跟踪器

uBlock Origin 完整指南:4 大核心能力 + 上手 5 步,免费拦截广告与跟踪器

uBlock Origin 完整指南:4 大核心能力 上手 5 步,免费拦截广告与跟踪器 【免费下载链接】uBlock uBlock Origin - An efficient blocker for Chromium and Firefox. Fast and lean. 项目地址: https://gitcode.com/GitHub_Trending/ub/uBlock 网…

2026/8/31 17:05:52 阅读更多 →

最新新闻

SAR成像全链路解析:从点目标仿真到实测数据处理实战

SAR成像全链路解析:从点目标仿真到实测数据处理实战

简介:本资源面向雷达信号处理初学者、遥感图像处理研究者及SAR算法实践者,聚焦SAR点目标建模仿真与实测数据全流程处理,系统覆盖雷达成像原理、距离多普勒算法实现与压缩感知(CS)在SAR稀疏成像中的应用。压缩包含14个文…

2026/8/31 17:06:42 阅读更多 →
从映客春招C卷看后端高并发与系统设计核心考点

从映客春招C卷看后端高并发与系统设计核心考点

1. 写在前面:为什么一套春招笔试题值得拿出来细讲映客2020春招研发C卷,这个名字放在今天来看,多少带点“考古”的意味。但如果你把它当成一份单纯的历史资料去刷,那就浪费了。作为经历过那几年移动直播混战、也参与过不少校招笔面…

2026/8/31 17:06:42 阅读更多 →
Simulink中DMC动态矩阵控制仿真实现与调参实战

Simulink中DMC动态矩阵控制仿真实现与调参实战

简介:本资源为基于Simulink实现动态矩阵控制(DMC)算法的完整仿真教学包,面向本科及硕士阶段自动化、过程控制与智能优化方向的学习者与教研人员,解决经典预测控制算法建模难、调试门槛高、结果验证不直观等实践痛点。压…

2026/8/31 17:06:42 阅读更多 →
有限元仿真新手进阶指南:从能跑出结果到经得起追问

有限元仿真新手进阶指南:从能跑出结果到经得起追问

刚接触有限元仿真的时候,很多人以为最难的是软件操作。模型能跑起来、云图能出颜色,就觉得大功告成。直到被导师问一句“这个结果为什么是这个量级?边界条件怎么加的?网格收敛了吗?”,才发现自己除了会把按…

2026/8/31 17:06:42 阅读更多 →
保姆级论文AI使用教程✅零成本搞定整篇本科论文

保姆级论文AI使用教程✅零成本搞定整篇本科论文

论文实操教程|AI论文使用技巧|零成本定稿|零基础写论文|毕业实操干货 很多同学有好用的论文工具,却不会正确使用!白白浪费免费额度、写出来的内容空洞、查重翻车、多走超多弯路。 今天抛开虚头巴脑的测评…

2026/8/31 17:06:42 阅读更多 →
gprMax探地雷达模拟实战:从2D到3D空洞检测建模全流程

gprMax探地雷达模拟实战:从2D到3D空洞检测建模全流程

简介:本资源是一套面向地质探测、考古勘察与基础设施无损检测领域的GPR仿真教学资料包,专为科研人员、工程技术人员及高校学生设计,解决地面穿透雷达建模难、参数设置不直观、结果解读门槛高等实际问题。压缩包共133个文件,67.62M…

2026/8/31 17:05:41 阅读更多 →

日新闻

MCU无DAC如何用定时器+DMA 2D输出高保真任意波形

MCU无DAC如何用定时器+DMA 2D输出高保真任意波形

接到一个仪表类项目,要在 LAT1189 上输出几种不同波形:正弦、三角、带可调死区的脉冲,频率和幅度都得能实时改。板子上没有 DAC,就一个定时器加几个 DMA 通道。我一开始觉得在定时器中断里改比较寄存器也能应付,后来把…

2026/8/31 0:00:05 阅读更多 →
Cortex-M3 Flash下载失败?从编程错误标志到供电瞬态排查

Cortex-M3 Flash下载失败?从编程错误标志到供电瞬态排查

前两周调试一块带着Cortex-M3内核的板子,IDE里下载固件时突然弹出一行刺眼的错误: error: flash download failed - cortex-m3 。这种报错在嵌入式开发里太常见了,常见到很多人第一反应就是换根数据线、重插一下调试器,但重启三…

2026/8/31 0:00:05 阅读更多 →
STM32 TouchGFX屏幕切换Transition优化:原理、配置与排障实战

STM32 TouchGFX屏幕切换Transition优化:原理、配置与排障实战

做STM32 GUI开发的朋友应该都有体会——界面搭得再漂亮,一旦屏幕切换卡成PPT,整个产品的档次瞬间就没了。早期我在LAT1212这个基于STM32的GUI工程上用TouchGFX做二次开发,最头疼的不是画界面,而是怎么让切换动画既流畅又自然。Tou…

2026/8/31 0:00:05 阅读更多 →

周新闻

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

2026/8/31 13:13:27 阅读更多 →
数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

2026/8/31 9:02:46 阅读更多 →
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

2026/8/31 14:32:14 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/30 21:10:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/30 18:07:21 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/30 21:10:44 阅读更多 →