用 Python 把 PDF 表格批量导入 SQLite
处理 PDF 表格数据的场景很常见季度报表、对账单、业务台账业务方给一份 PDF 过来需要结构化后进数据库做后续分析。本文分享一个完整的 Python 实现覆盖从表格提取、字段清洗、动态建表到批量入库的全流程。代码依赖免费库 Free Spire.PDF 完成 PDF 解析其余全部基于标准库部署成本很低。环境与库代码语言Bash自动换行AI代码解释pip install Spire.Pdf.Free导入方式代码语言Python自动换行AI代码解释from spire.pdf import * from spire.pdf.common import *需要提前说明两个能力边界避免后面踩坑免费版单文件最多处理前 10 页超出部分不会返回。表格提取依赖 PDF 内的边框线结构扫描件或无框线表格不适用需走 OCR 方案。整体流程处理流程分三步逐页提取所有表格的原始文本矩阵对表头做规范化、去重生成合法列名每张表动态建表并批量插入这样做的好处是一份 PDF 里包含多张结构不同的表格时不需要提前预知列结构也能全部落入数据库。文本清洗先处理连字问题PDF 里常见的一类坑是连字符ligature被替换成 Unicode 私有区字符例如fi、ff会变成\ue005、\ue000之类的编码。直接入库就是一堆乱码方块所以第一步要做归一化。代码语言Python自动换行AI代码解释def normalize_text(text: str) - str: if not text: return ligature_map { \ue000: ff, \ue001: ft, \ue002: ffi, \ue003: ffl, \ue004: ti, \ue005: fi, } for k, v in ligature_map.items(): text text.replace(k, v) return text.strip()映射表不需要一次穷举实践中遇到新字符再补充即可。列名规范化与去重原始表头往往带空格、大小写混杂、甚至包含中文和符号不能直接作为数据库列名。这里做两件事用正则把非字母数字字符统一替换成下划线空表头用column_N兜底处理重复列名PDF 表格经常出现两个同名金额列代码语言Python自动换行AI代码解释def normalize_column_name(name: str, index: int) - str: if not name: return fcolumn_{index} name name.lower() name re.sub(r[^a-z0-9], _, name).strip(_) return name or fcolumn_{index} def deduplicate_columns(columns): seen set() result [] for col in columns: base col count 1 while col in seen: col f{base}_{count} count 1 seen.add(col) result.append(col) return result去重逻辑采用后缀递增方式amount、amount_1、amount_2不会互相覆盖。提取表格PdfTableExtractor是核心对象按页调用ExtractTable(page_index)返回该页所有表格对象。每张表通过GetRowCount()/GetColumnCount()遍历单元格文本用GetText(row, col)获取。代码语言Python自动换行AI代码解释pdf PdfDocument() pdf.LoadFromFile(Quarterly Sales.pdf) extractor PdfTableExtractor(pdf) all_tables [] for i in range(pdf.Pages.Count): tables extractor.ExtractTable(i) if not tables: continue for table in tables: table_rows [] for row in range(table.GetRowCount()): row_data [ normalize_text(table.GetText(row, col)) for col in range(table.GetColumnCount()) ] table_rows.append(row_data) if table_rows: all_tables.append(table_rows) pdf.Close() if not all_tables: raise ValueError(No tables found in PDF.)注意pdf.Close()的位置——批量处理多份文件时这一步很关键否则内存占用会持续累积。动态建表 批量插入不同表格的列结构不同用table_N命名并动态生成 DDL 是最省事的做法。所有列统一声明为TEXT把类型推断推迟到查询阶段处理。代码语言Python自动换行AI代码解释conn sqlite3.connect(sales_data.db) cursor conn.cursor() for table_index, table in enumerate(all_tables): if len(table) 2: continue # 只有表头没有数据行的表直接跳过 raw_headers table[0] normalized_headers [ normalize_column_name(h, i) for i, h in enumerate(raw_headers) ] normalized_headers deduplicate_columns(normalized_headers) table_name ftable_{table_index 1} columns_def , .join([f{col} TEXT for col in normalized_headers]) cursor.execute(f CREATE TABLE IF NOT EXISTS {table_name} ( id INTEGER PRIMARY KEY AUTOINCREMENT, {columns_def} ) ) placeholders , .join([? for _ in normalized_headers]) column_names , .join([f{col} for col in normalized_headers]) insert_sql f INSERT INTO {table_name} ({column_names}) VALUES ({placeholders}) batch [] for row in table[1:]: if not any(row): continue values [ row[i] if i len(row) else for i in range(len(normalized_headers)) ] batch.append(values) if batch: cursor.executemany(insert_sql, batch) print(fInserted {len(batch)} rows into {table_name}) conn.commit() conn.close() print(fProcessed {len(all_tables)} tables from PDF.)几个实现细节值得展开if len(table) 2跳过空表。PDF 中有时会提取出只有表头、甚至只有一行空字符串的伪表格提前过滤掉能避免无意义建表。列数对齐取最小值。当某行的列数少于表头时row[i] if i len(row) else 补齐空字符串。反过来如果某行列数多于表头多出的部分会被直接丢弃——这在合并单元格场景下会出现实践中建议加一条日志记录列数异常的行号方便后续人工核对。executemany批量插入。单条INSERT在一张几百行的表上就会明显变慢批量执行能显著降低 SQLite 事务开销。验证结果跑完后直接用 sqlite3 命令行看数据代码语言Bash自动换行AI代码解释sqlite3 sales_data.db .tables sqlite3 sales_data.db SELECT * FROM table_1 LIMIT 5;可以继续优化的方向类型转换。目前全部以 TEXT 入库如果后续要按数值排序或聚合可以在插入前做一次类型推断代码语言Python自动换行AI代码解释def try_parse(value: str): try: return float(value.replace(,, )) except (ValueError, AttributeError): return value把values列表在入 batch 前做一次映射能让纯数字列以 REAL 类型存储查询时就不需要CAST了。表名语义化。用table_1、table_2只是最省事的方案。如果 PDF 中每张表上方有标题文本可以提取后作为表名读起来更直观。多文件批处理。把主流程封装成process_pdf(path, conn)函数外层套一层文件遍历即可。注意每个文件都要LoadFromFile→ 提取 →Close()不要复用PdfDocument实例。

相关新闻

windows11_24h2无法安装net3.5办法

windows11_24h2无法安装net3.5办法

1.先下载ISO映像(相同版本的)2.sources目录下的sxs这个文件夹复制到C盘3.以管理员打开命令提示符4.输入dism.exe /online /enable-feature /featurename:netfx3 /Source:C:\sxs5.等待进度100%6.按照下图选中这两个点击确认即可(其他无需在意&…

2026/9/23 21:51:44 阅读更多 →
DeepSeek本地化部署与LoRA微调:三甲医院病历分析诊断模型实战

DeepSeek本地化部署与LoRA微调:三甲医院病历分析诊断模型实战

简介:这是一份面向医疗信息化从业者、数据工程师与临床科研人员的DeepSeek本地化部署实战指南,聚焦三甲医院病历分析与诊断模型构建场景。文档从医疗数据训练概述与DeepSeek模型原理入手,系统讲解环境准备、模型下载与配置、本地化部署、病历…

2026/9/23 21:51:44 阅读更多 →
DeepSeek工业误差实时修正:0.02mm级装配闭环控制方案

DeepSeek工业误差实时修正:0.02mm级装配闭环控制方案

简介:本资源是一份面向工业自动化工程师、智能制造研发人员及AI视觉应用从业者的深度技术方案,聚焦精密装配场景中累积误差的实时修正难题,创新性提出基于DeepSeek大模型的视觉伺服定位校正框架。文档共332页,含50个系统化章节&am…

2026/9/23 21:51:44 阅读更多 →

最新新闻

双目结构光三维重建:12步相移与互补格雷码全流程

双目结构光三维重建:12步相移与互补格雷码全流程

简介:这份资源是一套基于双目视觉与结构光投影的三维重建完整项目,面向计算机视觉学习者、课程设计或科研入门者,解决从相机标定到点云生成的工程落地问题。项目采用12步相移法与互补格雷码实现高精度相位解包裹,通过双目标定获取…

2026/9/23 23:18:41 阅读更多 →
GBrain 技能合规入门:用 Convention Callout 实现 Brain-First Lookup(以 compliant-callout 为例)

GBrain 技能合规入门:用 Convention Callout 实现 Brain-First Lookup(以 compliant-callout 为例)

人工智能RAGAgent 记忆MCP 服务知识管理 【免费下载链接】gbrain Garrys Opinionated OpenClaw/Hermes Agent Brain 项目地址: https://gitcode.com/gh_mirrors/gb/gbrain 点击查看 免费下载 本文以 test/fixtures/brain-first-skills/compliant-callout/SKILL.md …

2026/9/23 23:18:41 阅读更多 →
PaddleNLP AdamW 优化器实战:AdamWDL 分层学习率衰减的原理、源码解析与使用方法

PaddleNLP AdamW 优化器实战:AdamWDL 分层学习率衰减的原理、源码解析与使用方法

人工智能大模型预训练微调LoRARLHF强化学习分布式训练 【免费下载链接】PaddleNLP Easy-to-use and powerful LLM and SLM library with awesome model zoo. 项目地址: https://gitcode.com/gh_mirrors/pa/PaddleNLP 点击查看 免费下载 AdamW 优化器是 Transformer…

2026/9/23 23:18:41 阅读更多 →
机械制造企业间接采购优化:从品类盘点到供应商整合的完整指南

机械制造企业间接采购优化:从品类盘点到供应商整合的完整指南

干了十几年制造业供应链,我最怕听到同行说“我们想把间接采购好好管一管”——不是怕他们没决心,是怕他们低估了机械制造企业间接采购品类多这个现实。小到一颗钻头、一卷密封胶,大到一条产线的年度维保、一次计量校准,零件号少则…

2026/9/23 23:18:41 阅读更多 →
异步接口的状态更新:如何避免旧响应覆盖新任务

异步接口的状态更新:如何避免旧响应覆盖新任务

先看一个常见的时序问题用户打开任务列表,界面发出第一次查询。随后用户切换筛选条件,界面发出第二次查询。第二次查询先返回,页面显示了正确的新列表;第一次查询稍后返回,如果代码无条件赋值,就会把旧列表…

2026/9/23 23:18:41 阅读更多 →
555张仓库工人YOLO数据集:小而实的工业检测落地起点

555张仓库工人YOLO数据集:小而实的工业检测落地起点

简介:本资源是面向YOLO系列目标检测算法研究与工程实践的专用仓库工人场景数据集,适用于计算机视觉初学者、算法工程师及工业质检项目开发者,可直接用于YOLOv5/v7/v8/v9/v10/v11等主流版本的模型训练、验证与测试。压缩包共含1666个文件&…

2026/9/23 23:17:40 阅读更多 →

日新闻

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A…

2026/9/23 0:00:23 阅读更多 →
2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我 刚把开发环境的显示器从1080P换到2K,跑老项目直接报错,版本升级后 API…

2026/9/23 0:01:25 阅读更多 →
3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点 官方文档翻了三遍还是云里雾里?别急,美眉图在实战项目中常被用来做数据可视化,但它的原理比你想的简单。今天咱们直接上手,用一个完整的小项目把美眉图跑通,不再死磕那些冗长的理论说明。…

2026/9/23 0:01:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →