手语识别及翻译项目实战系列--数据转换
text转为npz格式CSL数据集中的pose-gloss中text 文件一行数据实例-0.01646529 -0.6482327 1.502301 -0.02531151 -0.3631941 1.570885 -0.02312568 0.04488507 1.634066 -0.03375742 -0.08601215 1.62303 -0.1698013 -0.2011915 1.549954 -0.1945323 -0.3977987 1.495995 -0.1950186 -0.5810784 1.407555 -0.1900637 -0.6325662 1.390355 0.1222058 -0.2088086 1.575616 0.1466089 -0.4060238 1.525056 0.162049 -0.582612 1.441606 0.1556938 -0.6228903 1.418582 -0.07448247 -0.6340373 1.46204 -0.09610306 -1.00437 1.446867 -0.1176976 -1.363221 1.457754 -0.1110597 -1.39173 1.339637 0.04221528 -0.6352441 1.479441 0.03347063 -1.007394 1.431241 0.02595523 -1.36769 1.41056 0.03370204 -1.384942 1.28791 -0.0317168 -0.1542985 1.612552 -0.1869177 -0.6876513 1.365173 -0.1652057 -0.6285808 1.371044 0.1484023 -0.6751753 1.395068 0.1230987 -0.6076492 1.428954原来的.txt是 CSL2018 已经提取好的姿态关键点数据不是普通文本语料。我们把它转成.npz主要是为了让 PyTorch 训练更方便、更快、更稳定。原来的 TXT 是什么以这个文件为例P01_01_00_0._body.txt它表示一个手语样本的视频姿态序列。文件名大致可以这样理解P01 第 1 个表演者 / signer 01_00_0 这个类别下的某个样本编号 _body 身体姿态关键点这个.txt里每一行是一帧视频的姿态数据。每一行有75个数字x1 y1 z1 x2 y2 z2 ... x25 y25 z25也就是25 个关键点 × 每个关键点 3 个坐标 75 个数所以一个 TXT 文件本质上是一个三维数组[T, 25, 3]其中T 这个样本的视频帧数 25 每帧有 25 个身体关键点 3 每个关键点的 x、y、z 坐标比如一个文件有 80 行那它就是[80, 25, 3]为什么转成 NPZ.txt是给人看或跨平台保存方便的格式但训练模型时不太适合直接用。转成.npz的原因主要有几个读取更快.txt每次都要一行一行读字符串再把字符串切开、转成浮点数。训练时会反复读很多样本这样很慢。.npz里直接保存的是 NumPy 数组加载后马上就是数值矩阵。数据形状更明确原始 TXT 只是很多数字。转成.npz后我们明确保存为keypoints.shape[T,25,3]训练代码就不用猜每一行怎么拆。和现有 Dataset 代码匹配你现在项目里的CSLIsolatedDataset期望读取的是np.load(path)[keypoints]也就是说.npz里必须有一个叫keypoints的数组。为了接入现有训练代码所以要转成.npz。避免训练时重复预处理如果每次训练都从.txt开始解析会重复消耗时间。现在转换一次以后训练、评估都直接读.npz。更适合深度学习流水线PyTorch 训练需要的是张量.npz比.txt更接近模型需要的输入格式。转换前后关系原始 TXT一行 一帧 一行 75 个数 25 个点 × 3 维坐标 整个文件 一个手语动作样本转换后的 NPZ{keypoints:array([T,25,3],dtypefloat32)}manifest 文件负责告诉训练程序{keypoint_path:keypoints/000/P01_01_00_0_body.npz,label:0,video_id:P01_01_00_0}含义是这个样本的数据文件在哪里 它属于第几个类别 它的视频/样本编号是什么所以可以理解为TXT 是原始姿态序列文本格式 NPZ 是训练用的数值数组缓存格式 manifest 是训练样本索引表核心不是改变数据内容而是把同一份姿态数据整理成模型更容易读取的格式。.npz 文件1. 本质结论.npz 不是 NumPy 专属格式但它是 NumPy 标准的数组存储格式原生设计就是配合 NumPy 使用。底层结构.npz本质是一个zip 压缩包里面每个文件对应一个单独的.npy文件.npy单个数组二进制存储格式NumPy 自定义二进制.npz多个.npy打包压缩的 zip 包2. 谁能读写它① 原生最优NumPyimportnumpyasnp# 保存多个数组np.savez(data.npz,aarr1,barr2)# 读取datanp.load(data.npz)print(data[a],data[b])这是官方标准用法读写最简单、无额外依赖。② 其他 Python 库也能读取只要库支持解析 zip 解析.npy二进制就能打开 npzPyTorch可以先用np.load()读出 numpy 数组再转 tensor无直接 load npz APITensorFlow同理依赖 numpy 中转SciPy完全兼容底层复用 NumPy 的 savez/loadzipfile numpy.lib.format纯底层手动解析不用np.load示例手动拆解 npz证明它是普通zipimportzipfile,numpy.lib.formatasnpyfmtwithzipfile.ZipFile(data.npz)aszf:fornameinzf.namelist():withzf.open(name)asf:arrnpyfmt.read_array(f)③ 非 Python 语言很难直接读C/Matlab/Java 没有原生 npz 解析器需要自己实现.npy二进制解析 zip 解压工业跨语言通用方案一般不用 npz改用hdf5、csv、二进制raw、protobuf3. 关键区分逻辑用途设计初衷就是批量保存多个 NumPy 数组科研、数值计算场景几乎只配合 numpy 使用文件封装底层是通用 zip不是私有加密格式任何能解压 zip 的工具都能打开看到内部.npy数组编码内部单个文件是.npy这是 NumPy 独有的二进制编码别的语言/库不能直接解析裸.npy必须实现对应解码逻辑。4. 总结日常使用场景可以认为它是专门给 NumPy 配套的格式几乎只有做数值计算、操作 ndarray 时才会用到技术底层只是 zip 包裹 NumPy 私有数组文件不是完全封闭专属格式能手动拆解但脱离 NumPy 会非常麻烦。补充对比格式归属适用场景.npyNumPy单个数组.npzNumPy多个数组打包压缩.h5 / .hdf5通用科学存储跨语言、大数据、复杂数据集

相关新闻

企业网络运维实战:如何通过交换机配置防御私接路由器导致的网络故障

企业网络运维实战:如何通过交换机配置防御私接路由器导致的网络故障

在企业网络运维中,你是否遇到过这样的场景:办公室网络突然变得异常缓慢,部分员工无法获取IP地址上网,或者内网服务器间歇性无法访问?经过一番排查,最终发现“罪魁祸首”竟是某个员工工位下私接的一个家用无…

2026/8/8 14:59:48 阅读更多 →
电能表正序分量、负序分量、零序分量及不平衡度计算

电能表正序分量、负序分量、零序分量及不平衡度计算

写在前面 参考书籍《现代电能质量测量技术》何学农 一、理解 (1)正序分量是指分解为A-B-C-A,幅值相同、相位差120的分量;(标准的正相序工况基本只有正序分量) (2)负序分量是指分解为…

2026/8/8 16:20:53 阅读更多 →
免费AI背景移除插件:obs-backgroundremoval完整使用指南

免费AI背景移除插件:obs-backgroundremoval完整使用指南

免费AI背景移除插件:obs-backgroundremoval完整使用指南 【免费下载链接】obs-backgroundremoval An OBS plugin for removing background in portrait images (video), making it easy to replace the background when recording or streaming. 项目地址: https:…

2026/8/8 16:16:11 阅读更多 →

最新新闻

AI时代的获客革命

AI时代的获客革命

获客,是所有生意的命脉。过去二十年,中国企业的获客方式经历了从线下到线上、从搜索到信息流、从公域到私域的数次迭代。每一次迭代,都催生了一批抓住红利的企业,也淘汰了一批固守旧路的企业。而今天,我们正站在又一次…

2026/8/9 5:07:18 阅读更多 →
办公AI助手优缺点分析——以TRAE Work为例

办公AI助手优缺点分析——以TRAE Work为例

随着人工智能技术对办公场景的深度渗透,办公AI助手正在重新定义日常工作的效率边界。从文档撰写、PPT生成到数据分析、市场调研,这类工具能够帮助职场人节省大量重复劳动的时间,但同时也存在一些需要注意的局限性。本文以TRAE Work为例&#…

2026/8/9 5:07:18 阅读更多 →
数据分析AI软件推荐:怎么选适合你的数据处理工具

数据分析AI软件推荐:怎么选适合你的数据处理工具

随着企业数字化转型深入,每天产生的业务数据量持续增长,但大多数分析师仍在重复数据清洗、格式转换和基础报表生成工作。AI工具的介入正在改变这一现状——从表格自动计算到洞察提炼,合适的AI软件能将分析师从重复性劳动中解放出来&#xff0…

2026/8/9 5:07:18 阅读更多 →
国资监管14个领域报送要求全梳理:字段、频率与截止时间

国资监管14个领域报送要求全梳理:字段、频率与截止时间

国资监管涉及14个领域的定期报送,每个领域有不同的字段要求、频率和截止节点。混用一个节点,就可能面临通报批评。 本文把14个领域的报送义务拆解清楚,帮你建立一份可执行的报送日历。 一、财务与投资监管报送 1.1 月度财务快报 主要财务指标…

2026/8/9 5:07:18 阅读更多 →
Rust编译器Polonius Alpha借用检查器将在nightly版测试,有望让更多合规代码编译

Rust编译器Polonius Alpha借用检查器将在nightly版测试,有望让更多合规代码编译

【导语:Rust团队宣布将在nightly版本中启用Polonius Alpha借用检查器进行测试,并计划在今年晚些时候使其完全稳定。该检查器自2018年开始研发,此次测试旨在发现潜在问题。】Polonius Alpha借用检查器开启测试 8月4日,Rust团队在博…

2026/8/9 5:07:18 阅读更多 →
炸裂!SpaceX 600 亿收购 Cursor,编程独角兽品牌将逐步淘汰,AI 格局生变?

炸裂!SpaceX 600 亿收购 Cursor,编程独角兽品牌将逐步淘汰,AI 格局生变?

据 The Information 爆料,SpaceX 拟 600 亿美元收购 AI 编程独角兽 Cursor,最快下周五完成交易。Cursor 品牌将逐步淘汰,公司也将被拆分并入 SpaceXAI。 天价收购,品牌消逝 这 600 亿美元是史上最大的初创公司收购案。交易最迟 8 …

2026/8/9 5:06:18 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/8 17:02:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/8 17:02:44 阅读更多 →