文档元素智能提取:NVIDIA-Nemotron-Parse-v1.1-TC实现表格与公式精准识别
文档元素智能提取NVIDIA-Nemotron-Parse-v1.1-TC实现表格与公式精准识别【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TCNVIDIA Nemotron Parse v1.1 TC是一款基于Transformer的视觉编码器-解码器模型专为文档语义理解和文本表格元素提取而设计。它能够将非结构化文档转换为可操作的机器可用表示克服了传统OCR技术在处理复杂文档布局时的局限性。核心功能与优势文档结构智能解析该模型能够对文档进行全面的文本理解和结构分析可识别标题、章节、图表标题、索引、脚注、列表、表格、参考文献和图片等多种元素并提供带坐标的边界框。这种精准的元素识别为后续的文档处理和分析奠定了坚实基础。高效的表格提取能力NVIDIA Nemotron Parse v1.1 TC擅长提取复杂表格支持多行列和多列合并的格式并以LaTeX格式输出。这一功能大大简化了从文档中提取和利用表格数据的过程提高了工作效率。公式与格式提取支持除了表格该模型还能提取文本样式和数学公式通过markdown和LaTeX格式的组合来呈现。这使得学术论文、技术文档等包含大量公式的文档能够被准确解析和处理。速度与准确性的平衡作为NVIDIA Nemotron Parse v1.1的增强版本v1.1-TC通过在视觉编码器表示之上应用额外的4倍视觉令牌长度压缩TC实现了20%的速度提升。同时它还能保留表格、标题、图片、脚注等无序元素的页面顺序确保了处理结果的准确性和可用性。快速上手指南环境准备首先克隆仓库并安装所需依赖git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC cd NVIDIA-Nemotron-Parse-v1.1-TC pip install -r requirements.txt基本使用示例以下是一个简单的使用示例展示如何加载模型并处理图片import torch from PIL import Image from transformers import AutoModel, AutoProcessor # 加载模型和处理器 model_path nvidia/NVIDIA-Nemotron-Parse-v1.1-TC # 或使用本地路径 device cuda:0 model AutoModel.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch.bfloat16 ).to(device).eval() processor AutoProcessor.from_pretrained(model_path, trust_remote_codeTrue) # 加载图片 image Image.open(path/to/your/image.jpg) task_prompt /sspredict_bboxpredict_classesoutput_markdown # 处理图片 inputs processor(images[image], texttask_prompt, return_tensorspt).to(device) # 生成结果 outputs model.generate(**inputs) generated_text processor.batch_decode(outputs, skip_special_tokensTrue)[0]结果后处理生成的文本可以通过后处理提取出元素类别、边界框和文本内容from postprocessing import extract_classes_bboxes, transform_bbox_to_original, postprocess_text classes, bboxes, texts extract_classes_bboxes(generated_text) bboxes [transform_bbox_to_original(bbox, image.width, image.height) for bbox in bboxes] # 指定后处理的输出格式 table_format latex # latex | HTML | markdown text_format markdown # markdown | plain texts [postprocess_text(text, clscls, table_formattable_format, text_formattext_format) for text, cls in zip(texts, classes)]模型架构与技术细节网络架构NVIDIA Nemotron Parse v1.1 TC采用了先进的Transformer架构主要包括视觉编码器ViT-H模型适配器层1D卷积和规范化层用于压缩潜在空间的维度和序列长度解码器mBart 10个块令牌器遵循CC-BY-4.0许可证模型参数数量小于10亿在保证性能的同时保持了较高的运行效率。输入输出规格输入类型图像RGB 提示字符串最大输入分辨率1664×2048最小输入分辨率1024×1280输出类型文本以字符串形式编码文本内容、边界框和类属性部署与兼容性该模型可以在多种环境中部署包括运行时引擎TensorRT-LLM支持的硬件微架构NVIDIA Hopper/NVIDIA Ampere/NVIDIA Turing支持的操作系统Linux应用场景与价值数据提取与处理NVIDIA Nemotron Parse v1.1 TC可用于从PDF和PPT文档中提取文本为数据挖掘、信息检索等应用提供高质量的输入数据。文档理解与分析通过对文档结构的深入理解该模型可以提高检索器和管理器解决方案的效率增强文档理解流程。模型训练支持其文本提取数据集和能力有助于LLM和VLM的训练同时提高VLM的运行时推理准确性。总结NVIDIA Nemotron Parse v1.1 TC为文档处理提供了强大的智能解决方案通过精准的元素识别和提取将非结构化文档转换为结构化数据。无论是学术研究、商业分析还是日常办公这款工具都能显著提高文档处理的效率和准确性是处理复杂文档的理想选择。参考资料模型架构细节hf_nemotron_parse_modeling.py处理器配置hf_nemotron_parse_processor.py后处理脚本postprocessing.py【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

机器人控制数据集从零上手:三步让 1.7 米人形机器人学会超市补货

机器人控制数据集从零上手:三步让 1.7 米人形机器人学会超市补货

机器人控制数据集从零上手:三步让 1.7 米人形机器人学会超市补货 【免费下载链接】LET-Body-Dataset LET全身运控数据基于VR套装与全身动捕遥操技术,实现了机器人对操作员动作的实时重定向,涵盖行走、下蹲、转腰及双足全向跟随等高拟人化全身…

2026/10/4 0:55:25 阅读更多 →
DouK-Downloader 抖音TikTok数据采集终极上手指南:从零安装到进阶玩法的完整路线

DouK-Downloader 抖音TikTok数据采集终极上手指南:从零安装到进阶玩法的完整路线

DouK-Downloader 抖音TikTok数据采集终极上手指南:从零安装到进阶玩法的完整路线 【免费下载链接】TikTokDownloader TikTok 发布/喜欢/合辑/直播/视频/图集/音乐;抖音发布/喜欢/收藏/收藏夹/视频/图集/实况/直播/音乐/合集/评论/账号/搜索/热榜数据采集…

2026/10/1 18:00:39 阅读更多 →
快速上手vit_tiny_patch16_224.augreg_in21k:3行代码实现图像分类

快速上手vit_tiny_patch16_224.augreg_in21k:3行代码实现图像分类

快速上手vit_tiny_patch16_224.augreg_in21k:3行代码实现图像分类 【免费下载链接】vit_tiny_patch16_224.augreg_in21k 项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_tiny_patch16_224.augreg_in21k vit_tiny_patch16_224.augreg_in21k是一款基于…

2026/10/3 2:30:41 阅读更多 →

最新新闻

隔离内网AI Agent落地方案:从模型选型到并发压测全指南

隔离内网AI Agent落地方案:从模型选型到并发压测全指南

把 AI Agent 推进隔离内网的时候,我最直观的感受是:网上那些 Agent 演示项目,到了内网几乎没有一个能直接跑起来。这不是代码写得不行,而是它们默认的世界里什么都有——模型权重从 HuggingFace 拉、Python 依赖从 PyPI 装、搜索工…

2026/10/5 14:40:16 阅读更多 →
本地部署大模型:Token自由与数据主权的成本交叉点

本地部署大模型:Token自由与数据主权的成本交叉点

1. 从一张显卡账单说起:为什么企业开始重新算这笔账去年底帮一家做工业质检的客户做技术选型,他们的场景很典型:每天要处理大约两万张缺陷样本图,每张图都要过一遍多模态模型做描述生成和分类打标。一开始走的是公有云API&#xf…

2026/10/5 14:40:16 阅读更多 →
Windows下TensorFlow GPU版安装指南:CUDA与cuDNN版本匹配全解析

Windows下TensorFlow GPU版安装指南:CUDA与cuDNN版本匹配全解析

1. 写在动手之前:TensorFlow GPU版本没那么玄,坑全在版本匹配TensorFlow装GPU版本,十个新手九个在环境上翻车。这活儿本身不复杂,但坑全藏在版本匹配里:显卡驱动、CUDA、cuDNN、Python、TensorFlow本体,五个…

2026/10/5 14:40:16 阅读更多 →
Windows安装TensorFlow GPU版全攻略:CUDA/cuDNN版本匹配与报错排查

Windows安装TensorFlow GPU版全攻略:CUDA/cuDNN版本匹配与报错排查

Windows上装TensorFlow GPU版,说实话不算难,但坑是真的多。很多朋友卡在最后一步,pip install成功,import的时候直接报错,日志里全是什么cudart64_110.dll、cublas64_11.dll找不到,一看就是CUDA和cuDNN版本…

2026/10/5 14:40:15 阅读更多 →
Python登录接口实战:从密码加密到Session/Token登录态保持

Python登录接口实战:从密码加密到Session/Token登录态保持

做登录接口,算是Python后端入门里最典型、也最容易被低估的一个练习。项目名里带着“携程登陆”,说明不少人是想拿真实网站当靶子练手,这个思路没错,但我的建议是:先别急着去模拟别人家的登录,先自己用Pyth…

2026/10/5 14:40:15 阅读更多 →
零售数仓实战:促销敏感度与评论敏感度建模全解析

零售数仓实战:促销敏感度与评论敏感度建模全解析

做了不少零售行业的数仓项目,说实话,像“促销敏感度”和“评论敏感度”这类需求,几乎每个做电商或品牌方数据团队都会接到。老板们通常不会直接说“我要建个模型”,而是扔过来几个很现实的问题:为什么这波满减发出去&a…

2026/10/5 14:39:14 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:06:42 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →