文档理解新高度:NVIDIA-Nemotron-Parse-v1.1-TC视觉token压缩技术原理解析
文档理解新高度NVIDIA-Nemotron-Parse-v1.1-TC视觉token压缩技术原理解析【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TCNVIDIA-Nemotron-Parse-v1.1-TC是一款基于Transformer的视觉编码器-解码器模型专为文档语义理解和文本表格元素提取而设计。该模型通过视觉token压缩技术实现了20%的速度提升同时保持了对复杂文档布局的精准解析能力是文档理解领域的突破性解决方案。视觉token压缩技术的核心优势视觉token压缩TC技术是NVIDIA-Nemotron-Parse-v1.1-TC的核心创新点通过4倍视觉token长度压缩实现了显著的性能提升速度提升20%相比上一代模型处理相同文档的时间减少五分之一保留页面元素顺序能正确维持表格、标题、图片、脚注等无序元素的页面顺序保持解析精度在压缩过程中不损失文本提取和语义理解的准确性优化资源占用降低显存使用需求使模型能在更多硬件环境中高效运行技术原理从像素到语义的智能压缩整体架构概览NVIDIA-Nemotron-Parse-v1.1-TC采用编码器-解码器架构主要由三部分组成视觉编码器基于ViT-H模型C-RADIO构建负责将图像转换为视觉特征适配器层通过1D卷积和归一化实现维度和序列长度压缩从13184 tokens到833 tokens文本解码器采用mBart架构10个blocks将视觉特征转换为结构化文本输出图NVIDIA-Nemotron-Parse-v1.1-TC对复杂文档布局的解析效果展示了不同语义元素的边界框识别压缩机制详解视觉token压缩通过以下关键步骤实现特征提取视觉编码器生成高维视觉特征1280维卷积降维使用1x1卷积将特征维度从1280降至1024空间重排通过像素洗牌pixel shuffle技术重组特征空间维度序列压缩应用 stride4 的卷积操作实现4倍序列长度压缩特征融合将压缩后的视觉特征与全局摘要特征融合核心压缩代码实现如下# 特征压缩与重组 output self.conv1(feature.permute(0,2,1)).permute(0,2,1) output self.layer_norm1(output) # 空间维度重排 output rearrange(output, b (h w) d - b d h w, hpixel_values.shape[-2] // patch_size, wpixel_values.shape[-1] // patch_size) # 4倍序列长度压缩 output self.conv2(output) output rearrange(output, b d h w - b (h w) d) output pixel_shuffle(output)实际应用效果展示表格提取能力NVIDIA-Nemotron-Parse-v1.1-TC能精准提取复杂表格结构包括多层表头、合并单元格等复杂格式并输出LaTeX格式的表格数据图模型对复杂表格的提取效果支持多行列合并的复杂表格结构公式与格式提取模型能识别并转换数学公式为LaTeX格式同时保留文本的原始格式信息图模型对数学公式和特殊格式文本的提取效果快速上手指南环境准备首先克隆仓库并安装依赖git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC cd NVIDIA-Nemotron-Parse-v1.1-TC pip install -r requirements.txt基础使用示例import torch from PIL import Image from transformers import AutoModel, AutoProcessor # 加载模型和处理器 model_path nvidia/NVIDIA-Nemotron-Parse-v1.1-TC device cuda:0 model AutoModel.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch.bfloat16 ).to(device).eval() processor AutoProcessor.from_pretrained(model_path, trust_remote_codeTrue) # 加载图像并处理 image Image.open(path/to/your/image.jpg) task_prompt /sspredict_bboxpredict_classesoutput_markdown inputs processor(images[image], texttask_prompt, return_tensorspt).to(device) # 生成结果 outputs model.generate(**inputs) generated_text processor.batch_decode(outputs, skip_special_tokensTrue)[0]后处理与结果解析from postprocessing import extract_classes_bboxes, transform_bbox_to_original, postprocess_text # 提取语义类别和边界框 classes, bboxes, texts extract_classes_bboxes(generated_text) bboxes [transform_bbox_to_original(bbox, image.width, image.height) for bbox in bboxes] # 格式化输出 table_format latex # 支持latex|HTML|markdown text_format markdown # 支持markdown|plain texts [postprocess_text(text, clscls, table_formattable_format, text_formattext_format) for text, cls in zip(texts, classes)]性能优化使用VLLM加速推理对于大规模部署可以使用VLLM进行推理加速# 安装VLLM及依赖 uv venv --python 3.12 --seed source .venv/bin/activate uv pip install githttps://github.com/amalad/vllm.gitnemotron_parse uv pip install timm albumentationsVLLM推理代码示例from vllm import LLM, SamplingParams sampling_params SamplingParams( temperature0, top_k1, repetition_penalty1.1, max_tokens9000, ) llm LLM( modelnvidia/NVIDIA-Nemotron-Parse-v1.1-TC, max_num_seqs64, limit_mm_per_prompt{image: 1}, dtypebfloat16, trust_remote_codeTrue, ) image Image.open(YOUR-IMAGE-PATH) prompts [{ prompt: /sspredict_bboxpredict_classesoutput_markdown, multi_modal_data: {image: image} }] outputs llm.generate(prompts, sampling_params)总结文档理解的新范式NVIDIA-Nemotron-Parse-v1.1-TC通过创新的视觉token压缩技术在保持高精度文档解析能力的同时实现了显著的性能提升。其核心优势包括高效压缩4倍视觉token压缩实现20%速度提升精准解析复杂布局、表格、公式的高精度提取灵活输出支持Markdown、LaTeX等多种格式输出易于部署兼容VLLM等推理加速框架无论是构建企业级文档处理系统还是为LLM/VLM提供高质量训练数据NVIDIA-Nemotron-Parse-v1.1-TC都展现出卓越的性能和广泛的应用前景为文档理解领域带来了新的技术范式。该模型已准备好商业使用遵循nvidia-open-model-license许可协议。如需更多支持可以通过NVIDIA企业支持渠道获取帮助。【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

APKParser高级技巧:自定义解析规则与多语言支持实现指南

APKParser高级技巧:自定义解析规则与多语言支持实现指南

APKParser高级技巧:自定义解析规则与多语言支持实现指南 【免费下载链接】APKParser APK parser for Android 项目地址: https://gitcode.com/gh_mirrors/apk/APKParser APKParser是一款功能强大的Android APK解析工具,它能帮助开发者轻松提取APK…

2026/8/17 15:42:01 阅读更多 →
SQL Server数据迁移这件事,远比你想的复杂——但也远比你想的简单(下)

SQL Server数据迁移这件事,远比你想的复杂——但也远比你想的简单(下)

文章目录那个让我震撼的BI报表场景标量子查询到底为什么慢,又是怎么快的100并发下的压力测试细节兼容性:不只是"能跑"运维侧的体验变化智能调优:不改应用也能优化写在最后的一些思考兼容是对前人努力的尊重是确保业务平稳过渡的基石…

2026/8/17 17:01:21 阅读更多 →
VPTQ与传统量化技术对比:为什么向量量化是LLM压缩的未来?

VPTQ与传统量化技术对比:为什么向量量化是LLM压缩的未来?

VPTQ与传统量化技术对比:为什么向量量化是LLM压缩的未来? 【免费下载链接】VPTQ VPTQ, A Flexible and Extreme low-bit quantization algorithm 项目地址: https://gitcode.com/gh_mirrors/vp/VPTQ VPTQ(Vector Product Quantization…

2026/8/16 15:29:25 阅读更多 →

最新新闻

Coze工作流实战:从零构建智能简历筛选助手,掌握AI应用工程化核心

Coze工作流实战:从零构建智能简历筛选助手,掌握AI应用工程化核心

如果你最近关注AI应用开发,可能会发现一个现象:很多教程都在讲“零代码搭建AI应用”,但当你真正上手时,却发现要么是功能过于简单,要么是遇到复杂逻辑就束手无策。问题出在哪里?核心在于,大多数…

2026/8/18 1:02:31 阅读更多 →
Coze工作流智能体实战:从零构建三端打通AI应用

Coze工作流智能体实战:从零构建三端打通AI应用

1. 背景与核心概念:为什么需要工作流智能体?在AI应用开发领域,一个长期存在的矛盾是:大模型虽然能力强大,但单次对话的上下文有限,难以处理复杂、多步骤的业务逻辑。例如,一个简单的“查询天气并…

2026/8/18 1:02:31 阅读更多 →
未来STEM教育:从技能培训到计算思维与系统认知的转向

未来STEM教育:从技能培训到计算思维与系统认知的转向

1. 从“热闹”到“门道”:STEM教育的现状与迷思最近几年,STEM(科学、技术、工程、数学)课程在国内可以说是火得一塌糊涂。从一线城市的国际学校到县城的课外兴趣班,从乐高机器人到少儿编程,似乎不给孩子报个…

2026/8/18 1:01:30 阅读更多 →
基于微服务架构的在线学习平台设计与实现(源码+讲解视频+LW)

基于微服务架构的在线学习平台设计与实现(源码+讲解视频+LW)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/18 1:01:30 阅读更多 →
基于微信小程序的高校浴室预约系统(源码+讲解视频+LW)

基于微信小程序的高校浴室预约系统(源码+讲解视频+LW)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/18 1:01:30 阅读更多 →
基于微信小程序的智慧旅游服务平台的设计与实现(源码+讲解视频+LW)

基于微信小程序的智慧旅游服务平台的设计与实现(源码+讲解视频+LW)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/18 1:01:30 阅读更多 →

日新闻

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF 【免费下载链接】extract-video-ppt extract the ppt in the video 项目地址: https://gitcode.com/gh_mirrors/ex/extract-video-ppt 如果你还停留在"看网课 不停暂停 截图 …

2026/8/18 0:00:57 阅读更多 →
思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 你是不是也经历过这种时刻:设计稿里…

2026/8/18 0:00:58 阅读更多 →
华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, …

2026/8/18 0:00:59 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/17 2:58:27 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/17 2:58:30 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/17 2:58:32 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →