hive数组巨详细解析
一、Hive 数组是什么Hive 的数组ARRAY用于在一个字段中保存多个同类型元素类似 Java 的List或 Python 的list。例如user_id | tags --------|---------------------- 1 | [java, hive] 2 | [spark, flink]数组中的元素必须是相同类型例如ARRAYSTRING ARRAYINT ARRAYDOUBLEHive 还支持复杂类型ARRAYSTRUCTname:STRING, age:INT ARRAYMAPSTRING, STRING二、创建数组1. 使用array()函数SELECTARRAY(java,hive,spark)AStags;结果逻辑上是[java, hive, spark]数值数组SELECTARRAY(10,20,30)ASnumbers;字符串和数字不能直接混合成普通数组-- 不建议或可能报类型错误SELECTARRAY(java,10);2. 使用split()把字符串转换成数组如果表中保存的是逗号分隔字符串user_id | tags --------|---------------- 1 | java,hive,spark 2 | flink,spark可以使用SELECTuser_id,SPLIT(tags,,)AStag_arrayFROMuser_tags;结果user_id | tag_array --------|---------------------- 1 | [java, hive, spark] 2 | [flink, spark]注意split()的第二个参数是正则表达式。如果分隔符是竖线需要转义SELECTSPLIT(tags,\\|)FROMuser_tags;三、创建包含数组字段的表CREATETABLEuser_tags(user_idBIGINT,tags ARRAYSTRING)STOREDASPARQUET;数组也可以作为分区表中的普通字段CREATETABLEuser_profile(user_idBIGINT,interests ARRAYSTRING,scores ARRAYINT)PARTITIONEDBY(dt STRING)STOREDASORC;建表时常见复杂类型写法CREATETABLEexample(idBIGINT,names ARRAYSTRING,attributes MAPSTRING,STRING,users ARRAYSTRUCTname:STRING,age:INT)STOREDASPARQUET;四、访问数组元素Hive 数组下标从0开始SELECTuser_id,tags[0]ASfirst_tag,tags[1]ASsecond_tagFROMuser_tags;例如tags [java, hive, spark]访问结果tags[0] java tags[1] hive tags[2] spark下标超过数组范围时通常返回NULLSELECTtags[100]FROMuser_tags;可以先判断数组长度SELECTuser_id,SIZE(tags)AStag_count,CASEWHENSIZE(tags)0THENtags[0]ENDASfirst_tagFROMuser_tags;五、常用数组函数1.size()获取数组长度SELECTuser_id,SIZE(tags)AStag_countFROMuser_tags;结果user_id | tag_count --------|---------- 1 | 3 2 | 2对于NULL数组结果通常为NULL对于空数组长度为0。2.array_contains()判断数组是否包含元素SELECTuser_id,ARRAY_CONTAINS(tags,hive)AShas_hiveFROMuser_tags;也可以用于过滤SELECTuser_idFROMuser_tagsWHEREARRAY_CONTAINS(tags,hive);3.sort_array()数组排序升序排序SELECTSORT_ARRAY(ARRAY(5,2,8,1))ASsorted_numbers;结果[1, 2, 5, 8]降序排序可以使用第二个参数SELECTSORT_ARRAY(ARRAY(5,2,8,1),FALSE)ASsorted_numbers;不同 Hive 版本对排序参数的支持可能存在差异生产环境中应以当前集群版本为准。4.array_join()或concat_ws()数组转字符串如果需要把数组拼接成字符串可以使用SELECTuser_id,CONCAT_WS(,,tags)AStag_stringFROMuser_tags;结果user_id | tag_string --------|---------------- 1 | java,hive,spark 2 | flink,spark某些 Hive 版本支持array_joinSELECTARRAY_JOIN(tags,,)FROMuser_tags;通常使用CONCAT_WS兼容性更好。5.concat()拼接数组SELECTCONCAT(ARRAY(java,hive),ARRAY(spark,flink))ASall_tags;结果[java, hive, spark, flink]用于表字段时SELECTuser_id,CONCAT(tags,ARRAY(new_tag))ASnew_tagsFROMuser_tags;六、数组转行explode()这是 Hive 中最常用的数组操作之一。原始数据user_id | tags --------|---------------------- 1 | [java, hive] 2 | [spark, flink]使用explode()SELECTuser_id,tagFROMuser_tags LATERALVIEWEXPLODE(tags)tAStag;结果user_id | tag --------|------ 1 | java 1 | hive 2 | spark 2 | flink数据变化为一行数组 ↓ explode 多行普通字段explode()是一个 UDTF通常需要配合LATERAL VIEW使用。七、保留数组位置posexplode()如果还需要知道元素在数组中的下标可以使用posexplode()SELECTuser_id,pos,tagFROMuser_tags LATERALVIEWPOSEXPLODE(tags)tASpos,tag;结果user_id | pos | tag --------|-----|------ 1 | 0 | java 1 | 1 | hive 2 | 0 | spark 2 | 1 | flink适合以下场景保留原始数组顺序获取数组元素的位置两个数组按照下标一一对应需要重新排序或进行位置匹配。八、空数组和LATERAL VIEW OUTER普通的explode()在数组为空或为NULL时可能不会输出原始行SELECTuser_id,tagFROMuser_tags LATERALVIEWEXPLODE(tags)tAStag;如果希望保留数组为空的用户可以使用OUTERSELECTuser_id,tagFROMuser_tags LATERALVIEWOUTEREXPLODE(tags)tAStag;此时没有数组元素的用户仍会保留展开出来的tag通常为NULL。这在统计用户数、订单数时很重要否则空数组对应的主表记录可能被过滤掉。九、数组中保存结构体Hive 数组的元素也可以是STRUCT。例如用户购买商品数组[ {product:apple, price:5}, {product:banana, price:8} ]表结构CREATETABLEuser_orders(user_idBIGINT,orders ARRAYSTRUCTproduct:STRING,price:DOUBLE)STOREDASPARQUET;先展开数组再访问结构体字段SELECTuser_id,order_item.productASproduct,order_item.priceASpriceFROMuser_orders LATERALVIEWEXPLODE(orders)tASorder_item;结果user_id | product | price --------|---------|------ 1 | apple | 5.0 1 | banana | 8.0也可以直接访问数组中某个结构体元素的字段SELECTuser_id,orders[0].productASfirst_product,orders[0].priceASfirst_priceFROMuser_orders;十、数组与collect_list、collect_set1. 多行聚合成数组原始订单商品表order_id | product ---------|-------- 1001 | apple 1001 | banana 1001 | orange 1002 | milk使用collect_listSELECTorder_id,COLLECT_LIST(product)ASproductsFROMorder_productGROUPBYorder_id;结果order_id | products ---------|---------------------- 1001 | [apple, banana, orange] 1002 | [milk]collect_list会保留重复值。2. 使用collect_set去重SELECTorder_id,COLLECT_SET(product)ASproductsFROMorder_productGROUPBYorder_id;如果原始数据为apple apple banana结果逻辑上是[apple, banana]需要注意collect_set不保证数组元素顺序。分布式执行下也不要默认依赖collect_list的最终顺序除非业务明确处理了排序逻辑。3. 同时保留多个字段不建议分别聚合多个字段后再依赖数组下标对应-- 需要谨慎使用SELECTorder_id,COLLECT_LIST(product)ASproducts,COLLECT_LIST(price)ASpricesFROMorder_productGROUPBYorder_id;更稳妥的方式是先构造结构体SELECTorder_id,COLLECT_LIST(NAMED_STRUCT(product,product,price,price))ASproduct_infoFROMorder_productGROUPBYorder_id;这样商品名和价格会被保存在同一个结构体元素中不容易出现字段错位。十一、数组与字符串的相互转换字符串转数组SELECTSPLIT(java,hive,spark,,)AStags;数组转字符串SELECTCONCAT_WS(,,ARRAY(java,hive,spark))AStags;完整示例WITHsourceAS(SELECT1ASuser_id,java,hive,sparkAStag_string)SELECTuser_id,SPLIT(tag_string,,)AStag_array,CONCAT_WS(|,SPLIT(tag_string,,))AStag_textFROMsource;结果逻辑上是user_id | tag_array | tag_text --------|------------------------|---------------- 1 | [java,hive,spark] | java|hive|spark十二、两个数组按位置匹配假设一行中有两个数组user_id | subjects | scores --------|-------------------|-------- 1 | [math, english] | [90, 85]目标是得到user_id | subject | score --------|---------|------ 1 | math | 90 1 | english | 85可以分别使用posexplode()再按数组位置关联WITHsubject_dataAS(SELECTuser_id,pos,subjectFROMuser_score LATERALVIEWPOSEXPLODE(subjects)tASpos,subject),score_dataAS(SELECTuser_id,pos,scoreFROMuser_score LATERALVIEWPOSEXPLODE(scores)tASpos,score)SELECTa.user_id,a.subject,b.scoreFROMsubject_data aJOINscore_data bONa.user_idb.user_idANDa.posb.pos;这里的关键是不能只展开两个数组否则容易产生笛卡尔积 应该使用 pos 把相同位置的元素对应起来。十三、数组常见应用1. 判断用户是否拥有某个标签SELECTuser_idFROMuser_tagsWHEREARRAY_CONTAINS(tags,vip);2. 统计用户标签数量SELECTuser_id,SIZE(tags)AStag_countFROMuser_tags;3. 展开标签进行统计SELECTtag,COUNT(*)ASuser_countFROMuser_tags LATERALVIEWEXPLODE(tags)tAStagGROUPBYtag;4. 统计数组中不同元素如果数组内部可能有重复值可以先展开后去重SELECTuser_id,COUNT(DISTINCTtag)ASdistinct_tag_countFROMuser_tags LATERALVIEWEXPLODE(tags)tAStagGROUPBYuser_id;5. 数组为空时保留用户SELECTuser_id,tagFROMuser_tags LATERALVIEWOUTEREXPLODE(tags)tAStag;十四、使用数组时的注意事项1. 数组元素类型必须统一例如应该使用ARRAYSTRING ARRAYINT不要在同一个数组中混合保存完全不同类型的数据。2. 不要让数组无限增长如果一个用户的数组可能包含数百万个元素使用collect_list可能造成Reducer 内存不足单行数据过大查询性能下降数据倾斜任务失败。这种情况下应该考虑拆成明细表而不是把所有明细塞进一个数组字段。3.explode会放大数据量一行数组展开后可能变成很多行100 万行 × 每行 100 个元素 ≈ 1 亿行输出因此展开前需要评估数据量和下游计算成本。4. 注意NULL、空数组和空字符串这几种值的语义不同NULL 没有数组值 [] 数组存在但没有元素 [] 数组中有一个空字符串数据清洗时需要根据业务分别处理。5. 不要默认依赖聚合数组的顺序以下函数的结果顺序需要谨慎处理COLLECT_LIST()COLLECT_SET()尤其是collect_set明确不应该依赖其元素顺序。6. 文件格式影响复杂类型性能数组、Map、Struct 等复杂类型通常更适合保存到Parquet ORC相比 CSV、JSON列式格式通常更适合 Hive 查询和压缩。十五、快速记忆创建数组ARRAY(a,b,c)字符串转数组SPLIT(str,,)访问数组元素arr[0]获取数组长度SIZE(arr)判断是否包含元素ARRAY_CONTAINS(arr,a)数组转行LATERALVIEWEXPLODE(arr)tASitem数组转行并保留下标LATERALVIEWPOSEXPLODE(arr)tASpos,item多行聚合成数组COLLECT_LIST(value)COLLECT_SET(value)数组转字符串CONCAT_WS(,,arr)总结Hive 数组主要用于保存一组同类型的数据常见操作可以概括为创建数组ARRAY() 字符串转数组SPLIT() 访问元素arr[index] 获取长度SIZE() 判断元素ARRAY_CONTAINS() 数组转多行EXPLODE() 数组转多行并保留下标POSEXPLODE() 多行聚合成数组COLLECT_LIST() / COLLECT_SET() 数组转字符串CONCAT_WS()最核心的使用模式是-- 多行聚合成数组SELECTuser_id,COLLECT_LIST(tag)AStagsFROMuser_tag_detailGROUPBYuser_id;-- 数组展开成多行SELECTuser_id,tagFROMuser_tags LATERALVIEWEXPLODE(tags)tAStag;可以把 Hive 数组理解为用一列保存多个相关值再根据查询需要进行访问、过滤、聚合或展开。

相关新闻

转行做无人机维修,值得投入一个月去学吗?

转行做无人机维修,值得投入一个月去学吗?

最近,“低空经济”彻底火了,无人机维修这个曾经低调的硬核技术赛道,突然成了转行求职者眼中的“香饽饽”。面对网上满天飞的“人才缺口大”、“月入过万”等标签,很多想寻求新出路的朋友都在问:现在转行做无人机维修&a…

2026/8/25 5:04:24 阅读更多 →
AI 使用愈发分散与失控,企业如何重新拿回掌控权?

AI 使用愈发分散与失控,企业如何重新拿回掌控权?

一家企业接入第一个大模型时,一个地址、一把 API Key,通常就能完成调用。此时,企业关注的主要问题是模型能不能用、接口能不能接通。但当 AI 从局部试验进入生产环境,企业需要管理的很快变成四类 AI 能力:不同团队使用…

2026/8/26 7:07:01 阅读更多 →
从语音识别到声音事件检测:构建AI音频分类器的核心技术与实践

从语音识别到声音事件检测:构建AI音频分类器的核心技术与实践

1. 项目概述:当AI开始“听”懂沉默与喧嚣在视频内容审核、影视后期制作乃至智能家居的日常场景里,我们早已习惯了AI识别语音内容——将“说了什么”转换成文字。但你是否想过,一段视频中,除了清晰的人声对白,那些背景里…

2026/8/25 5:03:24 阅读更多 →

最新新闻

特征值与特征向量:从几何直观到PCA降维与矩阵对角化实战

特征值与特征向量:从几何直观到PCA降维与矩阵对角化实战

1. 项目概述:为什么特征值与特征向量是线性代数的“灵魂”如果你学线性代数,学到矩阵乘法、行列式、秩这些概念,感觉还像是在处理一堆数字的排列组合,那么从特征值和特征向量开始,这门课的味道就彻底变了。我第一次真正…

2026/8/26 7:07:16 阅读更多 →
基于YOLOv8的车道抛洒物检测:从数据标注到边缘部署实战解析

基于YOLOv8的车道抛洒物检测:从数据标注到边缘部署实战解析

简介:目标检测作为计算机视觉的核心任务,在智慧交通、自动驾驶和道路安全监控等领域有着广泛应用。实际场景中,目标尺度小、背景复杂、光照变化剧烈,传统检测算法难以兼顾精度与实时性。YOLOv8作为高效的一阶段检测器,…

2026/8/26 7:07:16 阅读更多 →
用PIC32打造纯MCU迷你街机:从硬件到游戏开发的完整实践

用PIC32打造纯MCU迷你街机:从硬件到游戏开发的完整实践

最近把吃灰半年的一块PIC32开发板翻出来,做了一个能玩俄罗斯方块、贪吃蛇和打砖块的小型街机。先说明一下,不是那种跑Linux的高大上模拟器方案,而是纯MCU实现的“硬核”迷你街机。整个项目从选型、画板到写游戏逻辑,折腾了大概三周…

2026/8/26 7:07:16 阅读更多 →
基于树莓派的救援机器人实战:从硬件选型到代码实现

基于树莓派的救援机器人实战:从硬件选型到代码实现

做救援机器人这件事,我折腾了差不多大半年,从最开始用Arduino加几个超声波模块的小玩具,到最后用树莓派(Raspberry Pi)做主控、带着摄像头和一堆传感器能在废墟模拟场里穿行的完整原型机,中间踩过的坑真不少…

2026/8/26 7:07:16 阅读更多 →
Claude Code权限模式详解:从文件编辑到终端命令的精细化AI协作管控

Claude Code权限模式详解:从文件编辑到终端命令的精细化AI协作管控

1. 从“助手”到“协作者”:Claude Code权限模式的核心价值如果你和我一样,长期在VSCode里和各种AI编程助手打交道,从早期的GitHub Copilot到后来的Cursor,再到如今风头正劲的Claude Code,一个最直观的感受是&#xff…

2026/8/26 7:07:16 阅读更多 →
基于YOLOv5的手部X光骨骼检测:从数据工程到模型部署实战

基于YOLOv5的手部X光骨骼检测:从数据工程到模型部署实战

1. 项目缘起:从一张X光片说起作为一名长期混迹于计算机视觉和医疗影像交叉领域的技术人,我经常被问到:“你们搞AI的,到底能不能帮医生看片子?” 这个问题背后,是临床医生每天面对海量影像数据时&#xff0c…

2026/8/26 7:06:16 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →