MacroBase革命性Fast Data搜索引擎入门指南 — 从安装到首份异常检测报告【免费下载链接】macrobaseMacroBase: A Search Engine for Fast Data项目地址: https://gitcode.com/gh_mirrors/ma/macrobaseMacroBase是一款专注于Fast Data分析的革命性搜索引擎它利用机器学习技术从大规模数据中快速识别和优先展示关键信息帮助用户高效发现数据中的异常模式和重要趋势。 什么是MacroBaseMacroBase是一个数据 analytics 工具它使用机器学习在大型数据集中优先关注重要信息。作为一款Fast Data搜索引擎它特别擅长处理流式数据和时间序列数据能够快速发现数据中的异常值和有趣模式为用户节省大量的数据筛选和分析时间。 快速安装MacroBase1. 克隆仓库首先你需要将MacroBase的代码仓库克隆到本地。打开终端执行以下命令git clone https://gitcode.com/gh_mirrors/ma/macrobase2. 构建项目进入项目目录并使用Maven构建项目cd macrobase mvn package提示首次构建后后续可以使用mvn compile命令来加快构建速度。如果更新了pom.xml文件也可以运行mvn dependency:copy-dependencies来仅更新依赖。3. 准备演示数据MacroBase需要一些数据来进行分析。我们可以使用提供的Python脚本加载演示数据到PostgreSQL数据库中。首先确保你的本地PostgreSQL服务器已启动并且有一个名为postgres的数据库。然后执行python tools/load_demo.py你可以通过以下方式手动检查数据psql postgres # 然后在psql中执行 \d sensor_data_demo; SELECT * FROM sensor_data_demo LIMIT 10;4. 启动MacroBase服务器数据准备好后启动MacroBase服务器bin/frontend.sh5. 访问GUI界面打开你的浏览器访问以下地址http://localhost:8080/ 配置数据源成功启动服务器并访问GUI后第一步是配置数据源。MacroBase通过“Base Query”字段定义的数据视图来拉取数据。对于我们的演示数据在“Base Query”字段中输入SELECT * FROM sensor_data_demo;然后点击“submit”按钮。图MacroBase数据库配置和模式选择界面显示了如何连接数据库并输入基础查询。 探索样本数据配置好数据源后你可以通过点击“sample”按钮来探索数据样本。图MacroBase数据探索界面展示了传感器数据的样本包括reading_id、device_id、state、model、firmware_version、temperature和power_drain等列。你可以通过点击列标题来隐藏列或者通过“Hidden Columns”列表中的列名来取消隐藏。点击“mark all”可以隐藏所有列点击“clear”可以取消隐藏所有列。图隐藏部分列后的数据探索界面只显示了device_id、temperature和power_drain列。 选择分析列接下来我们需要选择要分析的列。假设我们想要找出高功耗的传感器我们需要选择“power_drain”列并点击对应的向上箭头将其标记为“Hi”高目标指标。选择“device_id”、“state”、“model”和“firmware_version”列作为聚类属性点击对应的“”按钮。设置完成后你的界面应该如下所示图选择分析列后的界面显示“power_drain”被选为高目标指标device_id、state、model和firmware_version被选为聚类属性。注意目前聚类属性仅限于分类数据即适合枚举类型的数据而不是连续值例如某个数据点50英里范围内的任何点。 执行分析点击“Analyze”按钮开始分析。几秒钟后你应该会看到分析结果图MacroBase分析结果界面显示找到了1012个高功耗异常值并列出了与高功耗相关的属性组合。结果显示我们找到了1012条高功耗读数记录。下面的列表显示了与高功耗读数高度相关的属性值组合在这个场景中我们只发现了一个组(device_id 2040, model M204, state AR, firmware_version 0.3.1)。结果统计指标解释Support支持度被标记为异常值的记录中包含此属性组合的比例。理论最小值为0没有异常值具有此模式最大值为1所有异常值记录都匹配。Ratio Out/In异常值/正常值比率包含此属性组合的异常值记录比例与包含此属性组合的正常值记录比例之比即异常值中的支持度除以正常值中的支持度。比率为1表示此模式在正常值和异常值中出现的频率相同。比率为无穷大表示此模式在正常值中不存在。Records记录数匹配此模式的异常值记录的实际数量即支持度 * 异常值数量。 探索匹配记录你可以通过点击相应的“Explore”链接来探索匹配每个组合的记录图探索匹配特定属性组合的记录界面显示了device_id为2040的设备的温度和功耗数据。 尝试自己分析重复上述分析步骤找出低温读数的记录。你也可以尝试同时查找多个感兴趣的指标。 命令行工具除了GUI界面MacroBase还提供了命令行工具来执行批处理和流分析。运行批处理分析bin/batch.sh此命令使用预配置的表和列集重复上述GUI操作。配置存储在conf/batch.yaml中。你可能需要编辑batch.yaml以适应sensor_data_demo数据集。提示你可以更改配置文件batch.sh只是macrobase.MacroBase batch CONFIG_FILE的一个简单包装。运行流分析bin/streaming.sh此命令使用单程流算法执行类似的任务。这里有更多的参数可供探索。提示同样你可以更改配置macrobase.MacroBase streaming CONFIG_FILE 更多资源官方文档项目的完整文档可以在docs/目录下找到其中包括高级配置和参数说明。配置文件MacroBase的配置文件位于conf/目录包括macrobase.yaml、batch.yaml和streaming.yaml等。核心代码MacroBase的核心分析功能实现位于core/src/main/java/edu/stanford/futuredata/macrobase/pipeline/目录。通过本指南你已经了解了MacroBase的基本安装、配置和使用方法。现在你可以开始使用这个强大的Fast Data搜索引擎来分析自己的数据发现隐藏的模式和异常了【免费下载链接】macrobaseMacroBase: A Search Engine for Fast Data项目地址: https://gitcode.com/gh_mirrors/ma/macrobase创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考