服务器 free 只剩 200MB,为什么它一点事没有
监控群里昨天又炸了一次。“XX 服务内存告警free 只剩 200MB”运维同学半夜爬起来登上去敲了free -h看了一眼回群里丢了句“没事正常别慌。”新来的同学不理解200MB 也叫正常这就是 Linux 内存管理最容易被误读的地方。而且更要命的是——很多公司监控面板上的内存使用率公式本身就是错的。free 的输出只有一列值得看total used free shared buff/cache available Mem: 62Gi 18Gi 200Mi 1.2Gi 44Gi 41Gi大部分人盯着free那一列看然后开始慌。但真正决定这台机器还能不能再接活的是最后一列available。关系是这样的available ≈ free 可回收的 buff/cacheLinux 的设计哲学是空闲内存是浪费。只要还有空内存内核就拿它去缓存磁盘数据page cache因为磁盘比内存慢好几个数量级。这些缓存不是被占用了是被借用了——一旦应用要内存内核可以立刻回收还给应用。所以free只有 200MB 完全可能毫无压力available有 41Gi 才是真相。这也顺带解释了为什么内存用了 70%的服务器跑得好好的那 70% 里绝大部分是 page cache。你的监控公式可能是错的这条是我见过最普遍的问题。很多老的监控脚本、自研的采集插件内存使用率是这么算的# 错误写法used_percent(total -free)/ total *100在free200MB / total62GB的机器上这个公式会告诉你使用率99.7%然后疯狂告警。而实际上这台机器一点事没有。正确写法只有一种# 正确available 才是应用真正能拿到的内存used_percent(total - available)/ total *100或者直接读/proc/meminfogrep-E(MemTotal|MemAvailable|Buffers|Cached|Dirty|Slab)/proc/meminfo看一眼你的告警规则。如果表达式里出现的是node_memory_MemFree_bytes那你的告警大概率一直在误报正确的是node_memory_MemAvailable_bytes-alert:HighMemoryPressureexpr:(node_memory_MemTotal_bytes-node_memory_MemAvailable_bytes) / node_memory_MemTotal_bytes0.85for:5mdrop_caches千万别在生产上敲搜Linux 清理内存第一条永远是echo3/proc/sys/vm/drop_caches看着很爽free立刻给你回一大截。但这个动作的实质是把磁盘缓存全丢掉逼系统接下来重新从磁盘读一遍。后果是接下来一段时间磁盘 I/O 飙升、所有服务响应变慢。你在生产上敲这一行等于主动给自己制造一次性能事故。内核自己会回收不需要你手动掺和。这条命令的正确使用场景只有一个跑基准测试时想要可复现的冷启动环境。那什么时候才是真的危险不是free少而是回收开始跟不上分配。判断信号看这几个一、vmstat里的si/so持续不为 0。vmstat2# si: 每秒从 swap 换入的 KB so: 每秒换出的 KBsi/so一直是 0说明没有换页压力。一旦持续有值就是在拿磁盘当内存用了,应用响应会明显劣化。二、Direct Reclaim。内核有个后台线程kswapd负责提前回收内存。当分配速度超过它回收的速度分配内存的进程自己被迫停下来同步回收——这就是 Direct Reclaim表现是莫名其妙的卡顿长尾。用 eBPF 抓vmscan相关事件能直接看到。三、OOM Killer 日志。这是最后的兜底dmesg|grep-ikilled process看到Out of memory: Killed process 12345 (java)才是真正的内存不足——和free数字大小没关系。保护关键进程oom_score_adjOOM Killer 挑人下手是按oom_score打分的分越高越先被杀。而打分的一个主要权重就是进程占了多少内存——这意味着吃内存最多的数据库往往是最先被杀的。# 看某个进程的分数cat/proc/$(pidof mysqld)/oom_score# 保护它分数范围 -1000永不被杀到 1000echo-500/proc/$(pidof mysqld)/oom_score_adjsystemd 服务可以直接写进单元文件[Service] MemoryMax4G MemoryHigh3G OOMScoreAdjust-500注意MemoryMax和MemoryHigh是 cgroup v2 的MemoryHigh是软限制超过就开始回收但还能用MemoryMax是硬限制超过就直接杀。用MemoryHigh做缓冲比直接撞MemoryMax温和得多。一个反常识的参数THP 该关透明大页Transparent Huge Pages默认是开的cat/sys/kernel/mm/transparent_hugepage/enabled# [always] madvise never它的好处是减少 TLB 缺失对通用负载Web 服务、文件服务确实有收益。但对延迟敏感的数据库建议关掉或改成madviseechomadvise/sys/kernel/mm/transparent_hugepage/enabled原因在后台守护进程khugepaged——它会频繁扫描并合并小页导致不可预测的 CPU 峰值和内存锁竞争在 MySQL、PostgreSQL、Redis、Elasticsearch 这类场景下表现为查询延迟的微秒到毫秒级抖动。内存碎片严重时THP 还可能触发激进的 Direct Compaction直接造成服务超时。常用参数速查参数作用建议vm.swappiness倾向回收匿名页还是文件页数据库/缓存 010通用 60默认vm.dirty_ratio进程自己开始回写脏页的阈值写敏感调低如 510减少 I/O 抖动vm.dirty_background_ratio后台回写启动阈值通常 5vm.vfs_cache_pressure回收 dentry/inode 的积极程度读多写少降到 50内存紧张提到 200vm.overcommit_memory内存超额分配策略Redis 要设 1避免 fork 失败再补一条冷知识跑 Redis 一定要设vm.overcommit_memory1。不设的话主从同步时的 fork 可能直接失败日志里只有一句含糊的报错查半天查不出来。最后把这篇压缩成三句话看available不看free。你的告警公式最好现在就去改。drop_caches不是运维命令是压测工具。生产上敲它等于自残。内存不足的证据是 Direct Reclaim 和 OOM 日志不是free的小数字。Linux 的内存管理设计得相当聪明——它在努力让你的磁盘访问变快而不是在偷偷占你的内存。先理解它在帮你再决定要不要打断它。

相关新闻

FPGA物理实现层实战指南:跨时钟域、IO约束与定点数避坑

FPGA物理实现层实战指南:跨时钟域、IO约束与定点数避坑

1. 项目概述:这不是一个“问答平台”,而是一份FPGA工程师的实战备忘录“FPGA问答上”——看到这个标题,别急着点开网页或下载APP。它根本不是什么新上线的社区产品,也不是某个厂商推出的在线答疑系统。这四个字,是我在…

2026/9/23 7:54:26 阅读更多 →
盘点18款降AI率靠谱网站(2026实测|毕业论文AIGC降痕参考)PaperMomo牛的!

盘点18款降AI率靠谱网站(2026实测|毕业论文AIGC降痕参考)PaperMomo牛的!

一、本次测评测试样本说明 本次测评使用的测试样本是一篇由AI辅助生成的本科文科课程论文,全文大约4200字,先通过知网AIGC检测,原始AI检测占比71.2%,文本整体AI特征比较明显,句式偏规整、书面表达偏向机器腔&#xff…

2026/9/23 7:54:26 阅读更多 →
OpenSpec规格驱动开发实战:结构化规格与代码一致性落地指南

OpenSpec规格驱动开发实战:结构化规格与代码一致性落地指南

1. 为什么我们需要重新审视“规格驱动”这件事第一次接触 OpenSpec 是在一个多人协作的中型项目里,当时团队正被“需求文档和代码对不上”这件事反复折磨。产品经理在文档里写的是 A 逻辑,后端实现成了 B 逻辑,前端又按 C 逻辑渲染&#xff0…

2026/9/23 7:53:26 阅读更多 →

最新新闻

鸿蒙原生开发实战:用ArkTS+ArkUI打造本地数据管理工具Biuredis

鸿蒙原生开发实战:用ArkTS+ArkUI打造本地数据管理工具Biuredis

去年年底我在整理开发目录的时候翻出一个叫作 Biuredis 的鸿蒙工程,这是我自己拿 ArkTS 从零写的原生 app。起初只是想验证一下 ArkUI 的声明式写法能不能撑起一个稍微完整的业务,后来越写越顺手,干脆把它打磨成了一个能管理本地数据、调试缓…

2026/9/24 21:20:22 阅读更多 →
淋巴细胞目标检测数据集详解:从HE切片到YOLOv8训练

淋巴细胞目标检测数据集详解:从HE切片到YOLOv8训练

简介:淋巴细胞目标检测数据集是一份面向医学影像与YOLO目标检测任务的行业级数据集,适用于病理辅助诊断、免疫微环境评估、淋巴细胞计数等AI模型开发场景。压缩包共2000个文件,以1152个txt标注文件、846张jpg病理图像为核心,另附1…

2026/9/24 21:20:22 阅读更多 →
不靠爆款靠积累:内容创作长期主义实战指南

不靠爆款靠积累:内容创作长期主义实战指南

我做内容创作这几年,从最初的追热点、憋大招、盼爆款,到如今彻底放弃“一炮而红”的念头,改成每天踏实输入、稳定输出,心态和账号数据都发生了明显变化。这篇文章不想讲什么玄乎的爆款方法论,而是把我自己的转型过程、…

2026/9/24 21:20:22 阅读更多 →
重庆智能家居服务商怎么选?本地全屋智能口碑与避坑指南

重庆智能家居服务商怎么选?本地全屋智能口碑与避坑指南

直接看结论:重庆本地智能家居市场,没有哪家是“全网零差评”的绝对答案,但确实有一批经过市场验证、交付案例多、口碑相对稳定的服务商梯队。这篇文章不吹不黑,只讲我作为从业者实际接触过的选型逻辑、踩坑经验和可复用的筛选方法…

2026/9/24 21:20:22 阅读更多 →
网盘限速破解指南:直链提取+多线程下载器跑满带宽

网盘限速破解指南:直链提取+多线程下载器跑满带宽

先来说个真实场景:你从某个网盘页面点了下载,网页转到一半,浏览器自带下载器开始跑,速度从几MB瞬间掉到几十KB,然后就这么挂着,一夜过去还在转圈。这事儿搁谁都烦躁。后来我换成网盘直链下载助手这类浏览器…

2026/9/24 21:20:22 阅读更多 →
广东电力零售混合套餐全解析:固定+联动定价与计算实例

广东电力零售混合套餐全解析:固定+联动定价与计算实例

广东的工商业用户,现在每个月除了看电费单,基本都会收到几份售电公司的零售套餐报价。固定价格、联动价格、固定联动……第一眼看到这些词,很多人会懵,这到底是买电还是买基金?其实没那么玄,这就是一份帮你…

2026/9/24 21:19:22 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →