KingbaseES集群failover失败案例分析与解决方案
1. 案例背景与问题描述最近在维护一套KingbaseES V8R3数据库集群时遇到了一次典型的failover切换失败案例。这套集群采用标准的主备架构主库运行在node209192.168.103.209备库在node210192.168.103.210。故障发生时主库的data目录突然变为只读状态触发了自动failover流程但最终切换却失败了。问题的核心在于当主库检测到存储异常后虽然正确触发了failover流程但在切换过程中由于SSH连接问题导致VIP192.168.103.211无法成功转移到新主库最终使得整个高可用切换功亏一篑。这种故障在数据库集群运维中非常典型也极具警示意义。2. 故障时间线还原2.1 主库异常触发时间点通过分析主库的recovery.log可以清晰看到故障的起始点2023-10-15 07:57:01 recover beging... could not create/write the file /home/kingbase/cluster/clusterdb/db/data/rw_status_file_714111580 unlink: 无法清除/home/kingbase/cluster/clusterdb/db/data/rw_status_file_714111580 的链接: 只读文件系统关键点在于主库定期检查存储可写性时发现无法创建测试文件由于use_check_diskon的配置系统自动触发保护机制经过多次重试后08:01:01系统判定存储故障开始关闭数据库服务经验提示生产环境中use_check_disk参数建议保持开启虽然可能产生误报但能有效防止数据损坏。同时rw_status_file的检查间隔默认为60秒可根据业务需求调整。2.2 备库检测与failover触发备库的cluster.log记录了故障检测过程2023-10-15 07:57:21: pid 47108: LOG: failed to connect to kingbase server on 192.168.103.209:62163 2023-10-15 07:57:57: pid 47108: LOG: health checking retry count 10 2023-10-15 07:57:57: pid 47108: LOG: setting backend node 0 status to NODE DOWN这里有几个关键参数需要注意连接重试次数10次默认值检测间隔约3秒一次总检测时间约36秒从07:57:21到07:57:573. 核心故障点分析3.1 SSH连接失败的根本原因在failover.log中我们看到了最关键的报错2023-10-15 08:01:47 add VIP on 192.168.103.210 the new primary can not ssh, exit failover深入查看备库的recovery.log发现更早之前就存在SSH问题ssh -o StrictHostKeyCheckingno -l root -T localhost /sbin/ip addr | grep -w 192.168.103.211/28 | wc -l execute failed经过排查发现根本原因是备库节点的SSH服务配置存在问题导致localhost连接自身都失败集群的VIP转移机制依赖SSH执行远程命令由于长期未进行failover测试该问题一直未被发现3.2 VIP转移机制详解KingbaseES集群的VIP转移流程大致如下确认新主库身份node210通过SSH连接到旧主库node209执行停止数据库服务删除VIPip addr del通过SSH连接到新主库node210执行添加VIPip addr add启动数据库服务这个过程中的每个SSH连接都需要配置免密登录且要求root权限。在本案例中由于备库节点自身SSH连接就有问题导致整个流程在最后一步失败。4. 问题排查与解决方案4.1 诊断SSH连接问题通过以下步骤可以诊断SSH配置问题检查SSH服务状态systemctl status sshd测试本地SSH连接ssh -v rootlocalhost检查认证日志tail -f /var/log/auth.log在本案例中发现是SELinux策略阻止了root用户的本地SSH连接。4.2 解决方案实施临时解决方案不推荐setenforce 0永久解决方案# 修改SELinux策略 semanage boolean --modify --on ssh_root # 或者添加自定义策略 ausearch -c sshd --raw | audit2allow -M my-sshd semodule -i my-sshd.pp配置免密登录所有集群节点# 生成密钥对 ssh-keygen -t rsa # 分发公钥 ssh-copy-id rootnode209 ssh-copy-id rootnode2104.3 预防措施定期进行failover演练建议每月一次设置监控告警对以下情况发出警报集群节点间SSH连接失败VIP检测命令执行失败存储只读状态日志监控策略监控recovery.log中的错误信息对execute failed等关键字设置告警5. 集群配置优化建议5.1 SSH连接优化配置在/etc/ssh/sshd_config中添加PermitRootLogin prohibit-password StrictModes no UsePAM yes5.2 KingbaseES集群参数调整增加存储检测间隔减少误报ALTER SYSTEM SET use_check_disk_interval 300s;调整故障检测灵敏度ALTER SYSTEM SET health_check_timeout 5s; ALTER SYSTEM SET health_check_retry 5;5.3 VIP管理增强方案为避免SSH依赖可以考虑使用Keepalived管理VIP或者采用分布式配置存储如etcd协调VIP状态示例Keepalived配置vrrp_instance VI_1 { state BACKUP interface bond0 virtual_router_id 51 priority 100 advert_int 1 authentication { auth_type PASS auth_pass 1111 } virtual_ipaddress { 192.168.103.211/28 } }6. 故障处理流程标准化6.1 Failover失败时的应急步骤确认故障现象检查集群状态ksql -U system -d test -h vip_host -p port -c show pool_nodes;查看VIP状态ip addr show bond0手动恢复流程# 在原主库停止服务 systemctl stop kingbase # 在备库提升为主库 touch /home/kingbase/cluster/clusterdb/db/data/trigger.file # 手动转移VIP ip addr add 192.168.103.211/28 dev bond06.2 事后检查清单存储状态检查mount | grep datadmesg | grep error网络连接验证# 节点间SSH测试 for node in node209 node210; do ssh root$node hostname done # VIP连通性测试 ping -c 4 192.168.103.211集群健康检查SELECT * FROM pg_stat_replication; SELECT * FROM sys_stat_activity;7. 经验总结与最佳实践这次故障给我们几个重要启示不要忽视小问题备库的SSH连接问题在平时可能不影响业务但关键时刻会导致严重故障监控要覆盖所有关键路径包括SSH连接、VIP状态等基础设施定期演练至关重要至少每季度进行一次完整的failover测试文档和流程要完善建立详细的故障处理手册和检查清单对于数据库集群运维我建议建立以下日常检查项每日检查集群状态show pool_nodes复制延迟select * from sys_stat_replication每周检查SSH连通性测试VIP转移测试可以手动触发存储可写性测试每月检查完整failover演练备份恢复测试安全审计包括SSH配置、权限等通过这次故障分析我们不仅解决了具体问题更重要的是完善了整个集群的运维体系。数据库高可用不是简单的配置问题而是需要从架构设计、日常运维到应急处理的全方位保障。

相关新闻

Datawhale 量化入门学习笔记:理解波动率

Datawhale 量化入门学习笔记:理解波动率

本文是 Datawhale《和Yibo零基础学习量化金融》Phase 2 第五章的学习总结,包含核心概念、理论发展脉络、Python 代码实现和真实行情验证。 标签:量化交易 Python 波动率 学习笔记 Datawhale 投资组合 分类:Python / 量化投资 前言 很多新手只…

2026/9/24 20:49:45 阅读更多 →
【OpenHarmony/HarmonyOS】ArkUI Canvas 2D 游戏引擎实战:世界坐标、摄像机、HUD 与渲染管线

【OpenHarmony/HarmonyOS】ArkUI Canvas 2D 游戏引擎实战:世界坐标、摄像机、HUD 与渲染管线

【OpenHarmony/HarmonyOS】ArkUI Canvas 2D 游戏引擎实战:世界坐标、摄像机、HUD 与渲染管线Canvas 不只是“画几条线”的组件。只要建立坐标系、渲染顺序、摄像机和实体管理,它完全可以承载一款中小型 2D 游戏。本文结合迷宫坦克项目,讲清楚…

2026/9/19 1:56:30 阅读更多 →
测试文章 002209 - 请忽略

测试文章 002209 - 请忽略

这是一篇测试文章,用于验证账号状态,将立即删除。

2026/9/24 4:17:38 阅读更多 →

最新新闻

Atlas 300V 24G上部署YOLO目标检测实战

Atlas 300V 24G上部署YOLO目标检测实战

1. 项目概述:Atlas到底在解决什么问题提到Atlas这个词,近两年在AI部署圈子里出现的频率越来越高。很多刚接触的人第一反应是数据库那个Atlas,或者是英伟达出的那个数据集工具,但在国内边缘计算和推理加速这个细分领域,…

2026/9/25 12:55:25 阅读更多 →
50+营销Skill装进AI Agent:从零搭建可复用工作流

50+营销Skill装进AI Agent:从零搭建可复用工作流

1. 这个项目到底解决了什么问题第一次看到“把 50 多种营销 Skill 装进 AI Agent”这个标题,我的反应是:终于有人把营销人日常最烦的那堆重复劳动,做成了可以即插即用的模块。做过增长、投过广告、写过落地页、跑过私域的人应该都有体会——营…

2026/9/25 12:55:25 阅读更多 →
MCP协议实战:从原理到自定义Server,让Agent接入真实世界

MCP协议实战:从原理到自定义Server,让Agent接入真实世界

最近几个月,AI 开发圈里 MCP 这个词出现的频率高得吓人。全称是 Model Context Protocol,官方叫“模型上下文协议”,但在实战里,我更愿意把它理解成一句话:让 Agent 接入真实世界的工具协议。你去看 GitHub&#xff0c…

2026/9/25 12:55:25 阅读更多 →
Claude写代码实战:从接入到提PR的工程化指南

Claude写代码实战:从接入到提PR的工程化指南

1. 从“补全代码”到“交付功能”:重新理解 Claude 写代码这件事很多人第一次听说“用 Claude 写全部代码”,脑子里浮现的画面是:打开一个聊天窗口,敲一句“帮我写个登录页面”,然后复制粘贴。这种用法确实存在&#x…

2026/9/25 12:55:25 阅读更多 →
MCP Server Chart AntV 项目解析:从配置骨架到图表渲染验证

MCP Server Chart AntV 项目解析:从配置骨架到图表渲染验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 12:55:25 阅读更多 →
CPU底层原理解析:从指令周期到缓存、多核与性能优化

CPU底层原理解析:从指令周期到缓存、多核与性能优化

你有没有遇到过这种情况:写两层 for 循环时交换一下内外层顺序,程序运行时间突然差了好几倍;两个线程明明在改完全不同的变量,性能却互相拖累;面试官问“CPU 到底是怎么工作的”,你能背出“程序计数器、ALU…

2026/9/25 12:54:25 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →