ClickHouse跳数索引的设计与应用:Bloom Filter与MinMax在查询加速中的效果
ClickHouse跳数索引的设计与应用Bloom Filter与MinMax在查询加速中的效果一、全表扫描40亿行ClickHouse也扛不住在一个数据分析场景中表user_events按小时分区存储了40亿条用户行为事件查询找出过去一周所有通过utm_sourcewechat且event_typepurchase的事件耗时18秒。表上已经建了排序键ORDER BY (event_date, user_id)但这个查询中utm_source和event_type都不在排序键前缀中ClickHouse不得不扫描所有粒度的数据块——这就是缺少跳数索引的代价。ClickHouse的稀疏主键索引primary.idx基于排序键只记录每N个粒度默认为8192行的排序键最小值。对于非排序键列的过滤条件主键索引完全用不上。跳数索引就是为了解决这个问题的——在非排序键列上建立轻量级的统计摘要让查询在执行时能够跳过不满足条件的数据块避免不必要的IO和计算。二、跳数索引的过滤原理MinMax、Set与Bloom Filter的代价模型ClickHouse支持多种跳数索引类型核心都是在每个粒度块上存储该列的统计摘要信息。flowchart LR subgraph Granules[数据粒度 (Granules)] G1[Granule 0br/8192 rowsbr/event_type: [click, view, click...]] G2[Granule 1br/8192 rowsbr/event_type: [purchase, purchase...]] G3[Granule 2br/8192 rowsbr/event_type: [view, share, view...]] end subgraph IndexMinMax[MinMax索引] M1[Minclick, Maxview] M2[Minpurchase, Maxpurchase] M3[Minshare, Maxview] end subgraph IndexBloom[Bloom Filter索引] B1[Bloom: {click, view}] B2[Bloom: {purchase}] B3[Bloom: {share, view}] end G1 -- M1 G2 -- M2 G3 -- M3 G1 -- B1 G2 -- B2 G3 -- B3 Q[WHERE event_typepurchase] -.-|MinMax检查| M2 Q -.-|Bloom检查| B2 M2 -.-|匹配| G2[只读取 Granule 2] B2 -.-|匹配| G2 style G2 fill:#c8e6c9 style M2 fill:#bbdefb style B2 fill:#bbdefbMinMax索引存储每个粒度块中列的最小值和最大值。查询时检查WHERE条件是否与MinMax区间有交集如果WHERE price 1000且某个粒度块的Max price是500那么这个粒度块可以直接跳过。MinMax在列值分布与物理存储顺序相关时效果最好——这就是为什么排序键对跳数索引也至关重要。Set索引存储每个粒度块中该列去重后的所有值。对于低基数列最有效——event_type可能只有10个不同的值Set索引可以精确判断某个值是否出现。但如果基数为10万Set索引本身的大小可能超过原始数据得不偿失。Bloom Filter索引使用概率数据结构可以快速判断一个值可能在或一定不在该粒度块中。空间效率远高于Set索引但有假阳性——Bloom Filter返回可能在但实际值不存在时需要实际读取数据块而无用功。假阳性率可以通过调整Bloom Filter的bit数来控制默认设置误差率约1%。三、针对不同查询模式的索引组合策略-- ClickHouse跳数索引创建示例 -- 场景1: 高基数列的等值过滤 → Bloom Filter ALTER TABLE user_events ADD INDEX idx_utm_source_bloom utm_source TYPE bloom_filter(0.01) GRANULARITY 4; -- 场景2: 低基数列的等值过滤 → Set ALTER TABLE user_events ADD INDEX idx_event_type_set event_type TYPE set(100) GRANULARITY 4; -- 场景3: 范围过滤列值与排序键相关 → MinMax ALTER TABLE user_events ADD INDEX idx_amount_minmax amount TYPE minmax GRANULARITY 1; -- 场景4: 时间范围枚举值过滤 → 组合索引 ALTER TABLE user_events ADD INDEX idx_composite (event_type, platform) TYPE bloom_filter(0.01) GRANULARITY 4; -- 场景5: 模糊匹配/前缀匹配 → ngrambf_v1或tokenbf_v1 ALTER TABLE user_events ADD INDEX idx_title_ngram title TYPE ngrambf_v1(3, 512, 2, 0) GRANULARITY 1;跳数索引的性能效果受三个参数影响GRANULARITY控制索引粒度每个索引条目覆盖多少个granuleTYPE决定索引类型和精度索引的物理排序决定了MinMax的有效性。在生产环境中测试过一组真实数据效果如下# 索引效果的简化评估脚本 import time from clickhouse_driver import Client import logging logger logging.getLogger(__name__) class SkipIndexBenchmark: ClickHouse跳数索引效果评估 def __init__(self, client: Client): self.client client def test_query_performance(self, table: str, query: str, with_index: bool True) - dict: 测试查询性能并收集指标 try: # 获取查询统计信息 stats_query f SELECT query, read_rows, read_bytes, query_duration_ms, memory_usage FROM system.query_log WHERE type QueryFinish AND query LIKE %{table}% ORDER BY event_time DESC LIMIT 1 # 先清除缓存 self.client.execute(fSYSTEM DROP MARK CACHE) start time.time() result self.client.execute(query) elapsed time.time() - start return { query: query[:100], with_index: with_index, elapsed_sec: elapsed, rows_returned: len(result), } except Exception as e: logger.error(fBenchmark failed: {e}) return {error: str(e)} def compare_index_effect(self, table: str, column: str): 对比有无跳数索引的查询效果 base_query fSELECT count() FROM {table} WHERE {column} target_value # 无索引测试 self.client.execute(fALTER TABLE {table} DROP INDEX IF EXISTS idx_{column}) no_index self.test_query_performance(table, base_query, with_indexFalse) # 有索引测试 self.client.execute(f ALTER TABLE {table} ADD INDEX idx_{column} {column} TYPE bloom_filter(0.01) GRANULARITY 4 ) self.client.execute(fALTER TABLE {table} MATERIALIZE INDEX idx_{column}) with_index self.test_query_performance(table, base_query, with_indexTrue) return {no_index: no_index, with_index: with_index}四、索引维护成本与查询加速比的非对称博弈跳数索引的维护成本集中在写入路径每次INSERT数据时ClickHouse需要为每个跳数索引更新对应粒度块的统计信息。对于Bloom Filter需要计算新增数据的哈希并更新bit数组对于MinMax需要比较并可能更新边界值。这个开销在批量写入场景下几乎不可见因为一批数据对应少数几个粒度块但在高频小批次写入场景下可能成为瓶颈。GRANULARITY参数是成本和收益的调节旋钮。GRANULARITY 1表示每个粒度块8192行建一个索引条目查得最细但索引体积最大GRANULARITY 4表示每4个粒度块约32K行建一个索引索引体积缩小4倍但可能多读一些不需要的数据。实践中GRANULARITY 4是较好的默认起点。索引物化的时机必须谨慎。MATERIALIZE INDEX会全表扫描构建索引在大于1TB的表上可能运行数小时期间的IO压力会影响在线查询。建议在业务低峰期执行或使用ALTER TABLE ... UPDATE ... WHERE分批构建。五、总结ClickHouse的跳数索引是在排序键索引之外的第二层过滤通过MinMax、Set和Bloom Filter等轻量级统计摘要在查询执行前过滤掉大量不相关的数据块。Bloom Filter是高基数列的最佳选择Set索引适合低基数列MinMax在有序列的范围过滤上效果显著。实践中建议为一个表创建2-4个跳数索引覆盖最高频的过滤条件。记住一个核心原则跳数索引的效果取决于数据在物理存储上的局部性——好的排序键设计能让跳数索引事半功倍。

相关新闻

DMA控制器原理与实战:嵌入式系统数据搬运优化指南

DMA控制器原理与实战:嵌入式系统数据搬运优化指南

1. DMA控制器:嵌入式系统的“数据搬运工”在嵌入式系统开发中,尤其是涉及雷达信号处理、高速数据采集或实时图像处理的场景,我们常常会遇到一个核心矛盾:CPU的计算能力是宝贵的,但大量、频繁的数据搬运工作&#xff08…

2026/7/27 12:43:02 阅读更多 →
杭州积分落户加分攻略:学历提升如何为你的城市生活加分

杭州积分落户加分攻略:学历提升如何为你的城市生活加分

一、杭州积分落户政策:新市民的安居之路作为长三角地区最具吸引力的城市之一,杭州以其优美的自然环境、蓬勃的经济活力和开放包容的城市氛围,每年吸引着大量外来人口前来就业和定居。为了更好地服务外来常住人口,杭州实行了积分落…

2026/7/25 5:38:55 阅读更多 →
搜索场景的大模型推理优化:多阶段召回的精排融合与 Query 理解延迟压缩

搜索场景的大模型推理优化:多阶段召回的精排融合与 Query 理解延迟压缩

搜索场景的大模型推理优化:多阶段召回的精排融合与 Query 理解延迟压缩 一、搜索的全链路延迟分解:从 Query 输入到结果返回的三级跳 搜索系统的一个完整请求链路包含三个阶段:Query 理解(意图分类、实体识别、纠错、改写&#xf…

2026/7/21 15:46:35 阅读更多 →

最新新闻

GitHub热门AI学习资源精选与高效使用指南

GitHub热门AI学习资源精选与高效使用指南

1. 为什么AI学习资源如此难找? 作为一名在AI领域摸爬滚打多年的从业者,我深刻理解初学者寻找优质学习资料的痛苦。AI技术发展日新月异,每天都有新论文、新框架、新工具涌现,而GitHub作为全球最大的开发者社区,虽然资源…

2026/7/27 12:44:43 阅读更多 →
BQ28Z610-R1 AFE硬件保护配置实战:从原理到电流阈值计算

BQ28Z610-R1 AFE硬件保护配置实战:从原理到电流阈值计算

1. 项目概述:为什么AFE硬件保护是BMS的“安全卫士”? 在锂离子电池包的设计中,安全永远是第一位的。电池管理系统(BMS)就像电池的“大脑”和“神经系统”,而其中的模拟前端(AFE)硬件…

2026/7/27 12:44:43 阅读更多 →
Citra 3DS模拟器终极指南:5个简单步骤在PC上完美运行任天堂3DS游戏

Citra 3DS模拟器终极指南:5个简单步骤在PC上完美运行任天堂3DS游戏

Citra 3DS模拟器终极指南:5个简单步骤在PC上完美运行任天堂3DS游戏 【免费下载链接】citra A Nintendo 3DS Emulator 项目地址: https://gitcode.com/gh_mirrors/cit/citra 想在个人电脑上重温《精灵宝可梦》、《塞尔达传说》等经典3DS游戏吗?Cit…

2026/7/27 12:44:43 阅读更多 →
如何在普通PC上构建完整的macOS系统:OpenCore黑苹果配置深度解析

如何在普通PC上构建完整的macOS系统:OpenCore黑苹果配置深度解析

如何在普通PC上构建完整的macOS系统:OpenCore黑苹果配置深度解析 【免费下载链接】Hackintosh Hackintosh long-term maintenance model EFI and installation tutorial 项目地址: https://gitcode.com/gh_mirrors/ha/Hackintosh 你是否想过在非苹果硬件上运…

2026/7/27 12:44:43 阅读更多 →
Comsol双温方程模拟激光烧蚀的工程实践

Comsol双温方程模拟激光烧蚀的工程实践

1. 项目概述:激光烧蚀模拟的工程价值激光烧蚀技术在微纳加工、薄膜沉积、医疗手术等领域具有广泛应用,但实际加工过程中存在热影响区控制难、烧蚀形貌预测不准等痛点。通过Comsol Multiphysics的双温方程耦合固体传热模块,我们可以精确模拟激…

2026/7/27 12:44:43 阅读更多 →
TPS6131x LED驱动芯片:从高效升压到智能保护的完整设计指南

TPS6131x LED驱动芯片:从高效升压到智能保护的完整设计指南

1. 项目概述与核心价值在智能手机、便携相机乃至各种工业设备的开发中,给高亮度LED(尤其是闪光灯)供电一直是个既基础又充满挑战的活儿。你肯定遇到过这些问题:相机开闪光灯拍照时手机突然卡顿甚至重启;补光灯用一会儿…

2026/7/27 12:43:43 阅读更多 →

日新闻

【JAVA毕设源码分享】基于SpringBoot的社区智能垃圾管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于SpringBoot的社区智能垃圾管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:00:54 阅读更多 →
SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

1. 项目概述:从寄存器手册到实战指南 如果你手头有一份类似德州仪器(TI)TMS320x240xA系列DSP的SPI模块技术手册,看着里面密密麻麻的寄存器位定义、时序图和公式,是不是感觉头大?这份资料虽然权威&#xff0…

2026/7/27 0:00:54 阅读更多 →
【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:00:54 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/27 4:33:59 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/27 6:31:56 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/27 4:01:12 阅读更多 →

月新闻