大文件传到 48 GiB 就断:S3 分片上传的参数怎么算,以及那些没人清的残片
一次数据库全量备份直接管道进对象存储命令大概长这样pg_dump-Fcmydb|zstd-T0|rclone rcat remote:backup/full-20260804.dump.zst跑了两个多小时传到 48 GiB 出头的位置直接退出报的是分片编号超出允许范围。网络没断磁盘没满桶也没配额限制。重跑一次还是同一个位置。问题不在链路上在一道乘法上分片上传最多 10,000 片rclone 默认分片 5 MiB5 MiB × 10000 ≈ 48.8 GiB。流式上传事先不知道总大小客户端没法替你把分片调大于是天花板就卡死在这儿。一、先把这道乘法算清楚S3 的分片上传Multipart Upload有三条硬约束绝大多数 S3 兼容实现都照着做单个分片5 MiB 到 5 GiB最后一片允许小于 5 MiB一次上传最多10,000 片单对象上限 5 TiB不走分片的单次 PUT 上限 5 GiB。推论只有一句话能传多大的对象 分片大小 × 10000。这张表最该记的是第三列。同样传一个 200 GiB 的归档5 MiB / 8 MiB / 16 MiB 三档全部会撞上 10,000 片的墙只有把分片提到 32 MiB 以上才有富余。而 8 MiB 恰好是 AWS CLI 和 boto3 的出厂默认值。二、知道文件大小时SDK 会偷偷替你改参数这里有个容易被误会的点用aws s3 cp传一个 200 GiB 的本地文件并不会报错。因为 boto3 底层的s3transfer里有一个分片调整器发现按当前分片会超过 10,000 片就自己往上调只在 debug 日志里留一行提示。froms3transfer.utilsimportChunksizeAdjuster adjChunksizeAdjuster()size200*1024**3# 200 GiBprint(adj.adjust_chunksize(8*1024**2,size))# 8 MiB - 自动放大rclone 也有类似行为本地文件已知大小时会自动抬高分片并打一行 warning。真正会失败的是大小未知的那一类上传——rclone rcat、管道流、Transfer-Encoding: chunked的上传、以及自己手写CreateMultipartUploadUploadPart循环的代码。这些路径上没人替你算乘法。已知大小的场景把参数写进配置一劳永逸aws configuresetdefault.s3.multipart_threshold 64MB aws configuresetdefault.s3.multipart_chunksize 64MB aws configuresetdefault.s3.max_concurrent_requests20未知大小的流式场景只能自己声明分片# 流式上传时显式抬高分片把上限从 48.8 GiB 提到 625 GiBpg_dump-Fcmydb|zstd-T0|\rclone rcat --s3-chunk-size 64M remote:backup/full-20260804.dump.zst或者干脆先落盘再传。多占一份临时磁盘换回可断点续传、可校验、可重试单片的能力多数备份场景里这笔账是划算的。三、并发不是越大越好先算内存分片调大之后第二个坑马上跟上来内存。分片上传的每一片在发出去之前通常要在内存里攒齐所以峰值内存大致是峰值内存 ≈ 分片大小 × 单文件并发数 × 同时传输的文件数按 rclone 的默认值--transfers 4、--s3-upload-concurrency 4如果把分片提到 64 MiB就是64 MiB × 4 × 4 ≈ 1 GiB。在一台 2 GiB 内存的备份机上跑OOM 只是时间问题。boto3 这边同样要显式约束importboto3fromboto3.s3.transferimportTransferConfig cfgTransferConfig(multipart_threshold64*1024**2,multipart_chunksize64*1024**2,max_concurrency8,# 并发线程数use_threadsTrue,)boto3.client(s3).upload_file(big.tar.zst,backup,big.tar.zst,Configcfg)调参的取舍很直白分片调大请求数少、元数据开销小、更容易跑满带宽代价是单片失败重传的成本变高内存占用线性上涨。并发调高能压满网卡代价是内存翻倍且容易把同一前缀打到限流阈值上AWS S3 的公开指标是每前缀约 3,500 次写、5,500 次读每秒自建集群的阈值取决于磁盘和 CPU。经验起点千兆网、内存充裕分片 32–64 MiB、并发 8–16内存紧张就先砍并发别砍分片。四、传失败之后那些还在计费的残片上传中断最贵的后果不是重传是残片。已经上传成功的分片会一直躺在服务端直到你显式 Complete 或者 Abort。在没 Complete 之前它们不出现在ListObjects里s3 ls看不见但空间照占、账单照算。先查有多少# 列出桶里所有未完成的分片上传aws s3api list-multipart-uploads--bucketbackup\--queryUploads[].{Key:Key,Id:UploadId,Init:Initiated}--outputtable# 手动中止某一次aws s3api abort-multipart-upload--bucketbackup\--keyfull-20260804.dump.zst --upload-idUploadId用 mc 的话是mc ls --incomplete myminio/backup和mc rm --incomplete --recursive。手动清一次治标规则挂上去才治本。给桶加一条生命周期规则让服务端自动回收超过 7 天的残片{Rules:[{ID:abort-stale-multipart,Status:Enabled,Filter:{Prefix:},AbortIncompleteMultipartUpload:{DaysAfterInitiation:7}}]}aws s3api put-bucket-lifecycle-configuration\--bucketbackup --lifecycle-configuration file://abort-mpu.json天数别设太小。7 天是个安全值既不会让残片过夜太久也不会误杀一个正在慢慢传的超大对象。如果确实有跨天的上传任务把规则改成按前缀生效别一刀切到全桶。五、校验分片对象的 ETag 不是 MD5传完之后想比对完整性很多脚本习惯拿ETag去和本地md5sum对aws s3api head-object--bucketbackup--keyfull.dump.zst--queryETag# 9c7a3f...e12-3200后面那个-3200就是提示这是分片对象ETag 是每片 MD5 拼起来再算一次 MD5还带上分片数量后缀。它跟整个文件的 MD5 天然对不上而且分片大小一变ETag 就变所以它也不能当作跨集群比对的依据。要可靠校验改用显式 checksumaws s3api put-object--bucketbackup--keysmall.bin\--bodysmall.bin --checksum-algorithm CRC32C分片上传时给每一片带上 checksumComplete 时服务端会做整体校验。这条路的代价是客户端要多算一遍哈希CPU 占用会上去一点换来的是传完就知道对不对不用事后再下载一遍比对。六、下次遇到大文件上传失败按这个顺序查先看报错里有没有 part number / part size 字样。有的话直接算乘法分片大小 × 10000 是不是够。确认这是不是流式上传。管道、rcat、chunked 编码客户端不会替你调分片必须手动指定。算峰值内存分片 × 单文件并发 × 文件并发。跟机器可用内存对一下OOM 和网络抖动长得很像。查残片list-multipart-uploads跑一遍看看历史上失败的上传攒了多少空间。挂生命周期规则AbortIncompleteMultipartUpload设 7 天这条规则应该是新桶的默认动作之一。别用 ETag 做完整性校验改 checksum。这些约束是 S3 协议层面的换成哪家实现都得遵守。自建这一侧的差别主要在两处分片的落盘与合并路径快不快以及有没有把残片回收做进生命周期管理里。RustFS 这类 S3 兼容实现走的是同一套 API 语义上面这些命令可以原样跑不用改客户端代码 —— 迁移时真正要重测的反而是分片大小和并发这组参数在新集群上的最优值因为它跟磁盘数量、纠删码配置直接相关。先跑第 4 步。大概率你会在某个桶里翻出几十 GiB 谁也不记得的残片。

相关新闻

AI Agent开发实战(九)用 LangGraph 构建有状态 Agent(实战)

AI Agent开发实战(九)用 LangGraph 构建有状态 Agent(实战)

引言:上一篇我们知道了 LangGraph 的世界观是"把 Agent 建模成一张图"。这一篇把它真正跑起来:从最小的图开始,逐步加上工具循环、检查点持久化、人在环审批、可观测性,最后得到一个完整的研究型 Agent。每一步都能独立跑通,你可以跟着敲。关于语言的说明…

2026/9/25 9:17:16 阅读更多 →
KMS_VL_ALL_AIO 上手指南:单文件搞定 Windows 与 Office 智能激活

KMS_VL_ALL_AIO 上手指南:单文件搞定 Windows 与 Office 智能激活

KMS_VL_ALL_AIO 上手指南:单文件搞定 Windows 与 Office 智能激活 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 周四晚上九点,朋友发来一张截图:桌面右下角…

2026/9/23 6:05:33 阅读更多 →
如何快速掌握PDF对比神器diff-pdf:面向新手的完整视觉差异分析指南

如何快速掌握PDF对比神器diff-pdf:面向新手的完整视觉差异分析指南

如何快速掌握PDF对比神器diff-pdf:面向新手的完整视觉差异分析指南 【免费下载链接】diff-pdf A simple tool for visually comparing two PDF files 项目地址: https://gitcode.com/gh_mirrors/di/diff-pdf 还在为PDF文档版本对比而烦恼吗?diff-…

2026/9/25 17:22:39 阅读更多 →

最新新闻

Windows下MinGW-w64完整包安装教程:从选型、配置到避坑全指南

Windows下MinGW-w64完整包安装教程:从选型、配置到避坑全指南

简介:面向Windows平台C/C开发者的MinGW mingw64完整配置包,适合刚接触GNU工具链、需要快速搭建本地编译环境的初学者。压缩包共2000个文件,约129.46MB,以h/hpp头文件和Python脚本为主,另有c源码、txt说明、shell脚本与…

2026/9/25 22:59:21 阅读更多 →
ModLens Guard 机制源码解读:如何精准嗅探模型有无视觉能力,杜绝无效图片调用

ModLens Guard 机制源码解读:如何精准嗅探模型有无视觉能力,杜绝无效图片调用

ModLens Guard 机制源码解读:如何精准嗅探模型有无视觉能力,杜绝无效图片调用 【免费下载链接】modlens The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON…

2026/9/25 22:59:21 阅读更多 →
bb SDK 编程指南:用 BBSdk 以代码驱动你的 AI 编码工作流

bb SDK 编程指南:用 BBSdk 以代码驱动你的 AI 编码工作流

bb SDK 编程指南:用 BBSdk 以代码驱动你的 AI 编码工作流 【免费下载链接】bb The agent IDE that builds itself 项目地址: https://gitcode.com/gh_mirrors/bb14/bb bb 是一款「自我构建的智能体 IDE(agentic IDE)」,而 …

2026/9/25 22:59:21 阅读更多 →
Flutter实战:AI对话App开发环境搭建与核心链路解析

Flutter实战:AI对话App开发环境搭建与核心链路解析

1. 立项复盘:这个AI对话App为什么最终选了Flutter那周产品例会开了二十分钟,需求就一句话:"我们要做一个AI对话App,手机上能用,先上Android和iOS。"听完这句话,我脑子里先闪过三个技术选型&#…

2026/9/25 22:59:21 阅读更多 →
C# + OpenVINO + 异步推理:YOLO 实时检测流水线优化与 FPS 提升实践

C# + OpenVINO + 异步推理:YOLO 实时检测流水线优化与 FPS 提升实践

简介:这份资源是一套C#结合OpenVINO部署YOLO模型并实现异步推理的完整工程与教程资料,面向希望在高帧率场景下(如150FPS以上)做实时目标检测的开发者。资源涵盖模型转换、IR格式优化、C#环境配置及异步推理关键代码,适…

2026/9/25 22:59:21 阅读更多 →
七星卫通技术专业吗

七星卫通技术专业吗

从北斗卫星导航系统完成全球组网,到天通一号卫星移动通信系统建成,国产卫星通信产业从追赶到并跑,从单点突破到体系成型,走过了十余年的攻坚旅程。在这片关乎信息安全、关乎极端场景通信保障的蓝海中,北京七星卫通科技…

2026/9/25 22:58:20 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/25 19:27:14 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/25 20:29:09 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/25 20:29:43 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/25 20:29:31 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/25 19:27:26 阅读更多 →