凌晨 3 点被 200 条告警轰炸?用 Keep 三步控住你的 AIOps 告警
凌晨 3 点被 200 条告警轰炸用 Keep 三步控住你的 AIOps 告警【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨三点值班手机又震了Prometheus、Datadog、CloudWatch 里堆了两百多条告警真正的原因淹没在噪音里。AIOps 告警管理平台 Keep 就是为这种局面准备的它把各家监控工具的告警拉进同一个库里先去噪、再关联、然后自动处置让你看到的是 12 个值得处理的 incident而不是一屏幕通知。一条告警的旅程从接入到自动处置不按功能模块平铺跟着一条告警的流转顺序走一遍更直观。接入。Keep 通过 Provider 对接上百个监控、工单和协作工具告警可以走 webhook 推送也可以定时拉取。Prometheus 的规则告警、Datadog 的 monitor、CloudWatch 的 alarm格式各不相同但进 Keep 之后会被归一成统一的告警结构带上来源、服务、严重级别、指纹这些字段后面的去重和关联才有统一的操作面。告警、incident、工作流执行记录都落在同一个库里重启之后历史照样可查。去噪。去重发生在告警落库之前。部分去重用指纹字段比如 service 错误信息把同一个问题反复上报合并成一条全量去重则会丢弃完全相同的事件避免重复推送把系统压垮。每个 Provider 都自带一套默认去重规则开箱就能用指纹字段也可以按你的业务再调。配合维护窗口发布期间的告警还能直接静掉不打扰值班。关联分析。这是 AIOps 告警管理真正见效的地方。Keep 可以用 AI 自动把相关告警聚成一个 incident也可以自己写关联规则比如10 分钟内同一个服务的 critical Prometheus 告警加 high Datadog 告警算同一个事件。对自动关联结果不放心时还有半自动模式AI 只给分组建议人工点一下确认才成事。incident 名字支持用告警属性动态生成多条告警进来会自动合并不用手工改名。自动处置。关联完成后交给工作流按告警属性触发补充上下文往 Slack、Teams 发消息开 Jira 工单甚至重启服务都行。工作流就是一段 YAML可以版本管理、按代码重新部署用 AI 助手还能从一句自然语言生成初版改到满意再保存。Docker Compose 部署 Keep本地有 Docker 的话三条命令就能玩起来git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker-compose up -d等几分钟浏览器打开http://localhost:3000就能进。默认的 compose 是免登录NO_AUTH想体验账号体系可以切到带认证的版本用默认账号 keep/keep 登录。后端 API 在 8080告警、工作流、密钥这些状态都写在./state目录重启时挂同一个目录就行。玩完docker-compose down全部带走想重来直接删掉 state 再启动。几个日常用得到的配置都在docker-compose.yml里配置项说明DATABASE_CONNECTION_STRING默认本地 SQLite体验够用生产建议指到 PostgreSQLOPENAI_API_KEY开启关联分析、自然语言工作流等 AI 能力KEEP_JWT_SECRETJWT 签名密钥启用账号登录时需要设置AUTH_TYPE默认 NO_AUTH 适合试用生产建议切换账号登录想带认证跑的话仓库里现成有docker-compose-with-auth.yml可以参考想把可观测链路也搭起来otel 版 compose 可以一起拉起来。接入 Prometheus 等监控系统接自己的监控工具路径都一样选 Provider → 填凭证 → 验证连通。在 Providers 页面挑你用到的工具Prometheus、Datadog、AWS CloudWatch 是出场率最高的三个按向导填必要信息API key 或端点地址。Prometheus 的 alertmanager 模式走 webhook 就能收甚至不用填密钥跑一次连通性测试再丢一条真实告警过去看它是否进了 Keep 的告警表、字段是否对得上。接入之后告警进来就是统一字段去重和关联规则可以直接复用不用为每家工具单独适配。同一个 Provider 还能用不同凭证建多份比如生产、预发各一套 Prometheus告警不会混在一起。支持的工具清单和各家的字段说明在 docs/providers/ 里。Helm 部署 Keep 到生产环境上集群推荐走 Helmhelm repo add keep https://keephq.github.io/helm-charts kubectl create ns keep helm install keep keep/keep -n keep后端建议多副本加弹性伸缩避免单点backend: replicaCount: 3 autoscaling: enabled: true minReplicas: 2 maxReplicas: 5监控接入 OpenTelemetry让 Keep 自己的健康状态也能进同一套可观测链路backend: env: - name: OTEL_EXPORTER_OTLP_ENDPOINT value: http://otel-collector:4317 - name: OTEL_SERVICE_NAME value: keep-backend数据库记得开持久化并换成独立 PostgreSQL。要对外提供访问的话在集群里装 ingress-nginx 做 TLS 终结。上线前把默认密码改掉、HTTPS 开起来、按角色配好 RBAC 权限细节可以看 docs/deployment/。Keep 能扛住哪些场景大促容量问题——大促前 CPU、内存、数据库连接数容量告警同时炸开值班分不清先处理谁。Keep 怎么做——关联规则把这些容量告警归成同一个 incident并触发扩容与呼叫值班的工作流。结果——一整套事件对应一张工单第一响应不再靠人肉翻屏。微服务故障定位问题——核心服务挂了上下游依赖各自触发告警传播路径说不清。Keep 怎么做——服务拓扑图画出调用链并标出故障源服务关联分析指向根因组件。结果——值班能直接看到上游慢查询不用逐个服务猜。踩坑与调优速查提 issue 之前先自查这几个高频问题会更快症状排查命令容器起完但页面打不开docker-compose logs keep-backend3000 端口被占用docker-compose ps看前端容器状态某家 provider 告警不同步docker-compose logs keep-backend \| grep -i providerAI 功能没反应docker-compose config \| grep OPENAI看 key 是否传进去性能调优就抓四条数据库换成独立 PostgreSQL给常查的告警字段加索引开 Redis 缓存加速告警列表和检索查询调大告警批量入库的批次减少逐条写的数据库压力把非关键的富化动作挪到异步队列主链路保持快文档与源码去哪找官方文档在 docs/从概念、部署到各 provider 细节都有Provider 源码在 keep/providers/每家工具一个目录加新集成照着现有例子写现成的工作流 YAML 在 examples/workflows/通知、开工单类很多可以直接抄部署章节 docs/deployment/ 给了 Docker、Kubernetes 和认证三套方案Keep 用 AIOps 告警管理把几十家工具的噪音收敛成少数可处理的 incident所有配置都能写成代码、进版本库、随时回滚。接下来可以试试在测试机用 Docker Compose 部署接上 Prometheus 看统一告警表给团队噪音最大的通道加一条去重规则从 examples/workflows/ 抄一条工作流把 Slack 通知接上【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Megatron-LM 中的 Megatron Energon:面向文本、图像、视频与音频的大规模多模态数据加载器实战指南

Megatron-LM 中的 Megatron Energon:面向文本、图像、视频与音频的大规模多模态数据加载器实战指南

Megatron-LM 中的 Megatron Energon:面向文本、图像、视频与音频的大规模多模态数据加载器实战指南 【免费下载链接】Megatron-LM Ongoing research training transformer models at scale 项目地址: https://gitcode.com/GitHub_Trending/me/Megatron-LM Me…

2026/9/13 17:00:58 阅读更多 →
Java+Vue垃圾分类小程序开发实战与架构解析

Java+Vue垃圾分类小程序开发实战与架构解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/13 17:00:58 阅读更多 →
合成分析师笔记的对抗性设计:claude-quickstarts 知识维基如何捕获不可比 EBITDA 口径与来源可信度

合成分析师笔记的对抗性设计:claude-quickstarts 知识维基如何捕获不可比 EBITDA 口径与来源可信度

合成分析师笔记的对抗性设计:claude-quickstarts 知识维基如何捕获不可比 EBITDA 口径与来源可信度 【免费下载链接】claude-quickstarts A collection of projects designed to help developers quickly get started with building deployable applications using …

2026/9/13 17:00:58 阅读更多 →

最新新闻

PaddlePaddle 代码评审规则体系解析:ai-review Skill 与 base-rules 基础评审规则

PaddlePaddle 代码评审规则体系解析:ai-review Skill 与 base-rules 基础评审规则

PaddlePaddle 代码评审规则体系解析:ai-review Skill 与 base-rules 基础评审规则 【免费下载链接】Paddle PArallel Distributed Deep LEarning: Machine Learning Framework from Industrial Practice (『飞桨』核心框架,深度学习&机器…

2026/9/13 17:41:16 阅读更多 →
飞桨(PaddlePaddle)Python API 封装实战指南:从参数检查到算子调用的完整规范

飞桨(PaddlePaddle)Python API 封装实战指南:从参数检查到算子调用的完整规范

飞桨(PaddlePaddle)Python API 封装实战指南:从参数检查到算子调用的完整规范 【免费下载链接】Paddle PArallel Distributed Deep LEarning: Machine Learning Framework from Industrial Practice (『飞桨』核心框架&#xff0c…

2026/9/13 17:41:16 阅读更多 →
YOLOv5实战:替换主干网络与注意力机制部署全攻略

YOLOv5实战:替换主干网络与注意力机制部署全攻略

简介:面向计算机、电子信息工程及数学等专业学生,这份压缩包提供了基于YOLOv5的主干网络改进与部署参考资料,涵盖ResNet、ShuffleNet、MobileNet、EfficientNet、HRNet、CBAM、DCN以及TensorRT/Triton/TF Serving等方向,适合课程设…

2026/9/13 17:41:15 阅读更多 →
STM32无感FOC驱动器实战:从I/F强拖到SMO闭环调试指南

STM32无感FOC驱动器实战:从I/F强拖到SMO闭环调试指南

1. 项目概述与版本定位解析FOC-P2-DRAFT_V2.0,这个工程名刚看到的时候可能有点劝退,实际上这是我手头一个无感FOC驱动器项目的第二阶段草案第二版。拆开看就清楚了:FOC是磁场定向控制;P2代表这个项目走到了第二阶段,也就是从有霍尔…

2026/9/13 17:41:15 阅读更多 →
嵌入式软硬件协同的四大断点与破局机制

嵌入式软硬件协同的四大断点与破局机制

1. 这不是甩锅,是嵌入式开发里最真实的“时间差”现象 “嵌入式项目里,硬件工程师和软件工程师为什么经常‘互相等’?”——这句话在研发例会上出现的频率,可能比BOM清单更新还高。我干嵌入式这行十二年,带过三十多个量…

2026/9/13 17:41:15 阅读更多 →
基于MSP430小型货运机器人设计:从原理图到PCB打样全流程

基于MSP430小型货运机器人设计:从原理图到PCB打样全流程

简介:面向物流自动化与嵌入式学习者的MSP430小型货运机器人完整设计资料,涵盖设计论文、Protel99SE硬件原理图/PCB以及C语言软件源码,适用于机场行李运输、仓库货物转运等场景,可作为高校单片机/嵌入式课程设计、毕业设计或机器人…

2026/9/13 17:40:15 阅读更多 →

日新闻

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验 【免费下载链接】ai The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and ag…

2026/9/13 0:00:24 阅读更多 →
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项目地址: https://gitcode.com/GitH…

2026/9/13 0:00:24 阅读更多 →
Flutter应用改名全指南:从Android到iOS的配置与工具实践

Flutter应用改名全指南:从Android到iOS的配置与工具实践

刚接一个外包项目时,甲方要求把工程里临时用的应用名改成正式产品名。我本来觉得“改名”这种小事,打开配置文件改一行不就完了?结果真动手才发现,Flutter项目里“应用名称”根本不是一处配置,而是一整套散落在 Androi…

2026/9/13 0:00:24 阅读更多 →

周新闻

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验 【免费下载链接】ai The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and ag…

2026/9/13 0:00:24 阅读更多 →
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项目地址: https://gitcode.com/GitH…

2026/9/13 0:00:24 阅读更多 →
Flutter应用改名全指南:从Android到iOS的配置与工具实践

Flutter应用改名全指南:从Android到iOS的配置与工具实践

刚接一个外包项目时,甲方要求把工程里临时用的应用名改成正式产品名。我本来觉得“改名”这种小事,打开配置文件改一行不就完了?结果真动手才发现,Flutter项目里“应用名称”根本不是一处配置,而是一整套散落在 Androi…

2026/9/13 0:00:24 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/13 16:51:11 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/12 18:29:34 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/12 19:02:44 阅读更多 →