潜艇卫星图目标检测数据集实战:从零训练YOLOv8与旋转框检测器
简介这份资源是面向人工智能与计算机视觉方向研究者、学生及算法工程师的潜艇卫星图目标检测数据集可用于训练和验证水下目标识别模型服务于海洋监控、国防安全与环境监测等场景。压缩包共2001个文件包含1000张1024×1024像素的jpg卫星图像、1000个xml标注文件以及1个info.txt说明文档整体约345.83MB标注以边界框形式记录潜艇位置与类别可直接对接YOLO、Faster R-CNN等主流检测框架。info.txt提供数据集总体说明annotations存放每张图的坐标与类别信息images则保存原始卫星图像目录划分清晰便于按模块解析与加载。目前已有1686人学习下载适合需要快速搭建目标检测实验、验证算法精度与实时性的读者参考使用。1. 潜艇卫星图目标检测数据集从零训练一个能用的检测器潜艇卫星图目标检测数据集解决的是遥感场景下小目标、低对比度、复杂海况的检测问题。卫星图里的潜艇目标通常只有几十个像素背景是海面杂波、云层阴影和港口设施跟 COCO 里那些大目标完全不是一个难度。这个方向适合三类人做遥感目标检测的研究生、需要海上态势感知的工程团队、以及想拿一个真实小目标数据集练手的算法工程师。数据集本身通常包含光学卫星或 SAR 影像标注格式以水平框或旋转框为主类别一般只有“潜艇”或“舰船”一两类。难点不在模型结构而在数据预处理、小目标增强和评估指标的选择。下面按“数据集怎么读 → 模型怎么选 → 训练怎么调 → 坑在哪 → 怎么验证”的顺序拆开讲。2. 潜艇卫星图数据集的读取与格式转换从原始标注到 YOLO 可训练2.1 先搞清楚你的数据集是水平框还是旋转框拿到一个潜艇卫星图数据集第一件事不是写模型而是确认标注类型。常见的有三种PASCAL VOC 的 XML 水平框、COCO 的 JSON 水平框、DOTA 格式的旋转框。潜艇在卫星图里往往有明确朝向水平框会引入大量背景像素旋转框更合适。但旋转框训练需要 mmrotate 或 YOLOv8-OBB 这类框架不是所有团队都熟悉。我的建议是如果目标长宽比超过 3:1优先考虑旋转框如果只是做粗定位水平框也能跑出可用结果。判断方法很简单打开标注文件看坐标数量。VOC 的 bndbox 有四个值DOTA 的标注有八个值四个角点。下面是一个快速统计脚本import os import xml.etree.ElementTree as ET # 统计VOC格式标注中目标的长宽比分布 ratios [] for xml_file in os.listdir(annotations): if not xml_file.endswith(.xml): continue tree ET.parse(os.path.join(annotations, xml_file)) for obj in tree.findall(object): bbox obj.find(bndbox) w float(bbox.find(xmax).text) - float(bbox.find(xmin).text) h float(bbox.find(ymax).text) - float(bbox.find(ymin).text) if h 0: ratios.append(w / h) import numpy as np ratios np.array(ratios) print(f目标数量: {len(ratios)}) print(f长宽比中位数: {np.median(ratios):.2f}) print(f长宽比3的比例: {(ratios 3).mean():.2%})这段代码遍历所有 XML 文件提取每个目标框的宽高计算长宽比。如果中位数超过 3说明目标细长旋转框更合适。参数上annotations目录换成你的实际路径即可。注意有些数据集用xmin/ymin/xmax/ymax有些用xmin/ymin/width/height读之前先看一个文件确认字段名。2.2 转成 YOLO 格式四个边界坑YOLO 训练需要每张图对应一个 txt每行是class_id x_center y_center width height全部归一化到 0-1。转换脚本网上一搜一大把但潜艇卫星图有几个特殊坑第一图像尺寸不一致。卫星图可能是 1024×1024、512×512 甚至 2048×2048 混在一起。归一化时必须用每张图自己的宽高不能用一个全局尺寸。第二有些标注框超出图像边界。卫星图拼接时边缘目标会被裁切标注可能保留原始坐标导致 xmax 大于图像宽度。转换前要 clamp 到 [0, width]。第三类别名映射。如果数据集里写的是 “submarine” 和 “warship”你要决定是合并成一类还是保留两类。潜艇检测通常只关心潜艇建议合并成 “submarine” 一类减少类间混淆。第四空标注文件。有些图没有目标YOLO 需要对应的空 txt 文件否则训练时会报错。转换时记得为每张图都生成 txt哪怕内容是空的。import os import xml.etree.ElementTree as ET from PIL import Image def voc_to_yolo(xml_dir, img_dir, out_dir, class_map): os.makedirs(out_dir, exist_okTrue) for xml_file in os.listdir(xml_dir): if not xml_file.endswith(.xml): continue tree ET.parse(os.path.join(xml_dir, xml_file)) root tree.getroot() # 用对应的图像文件获取真实宽高 img_name os.path.splitext(xml_file)[0] .jpg img_path os.path.join(img_dir, img_name) if not os.path.exists(img_path): continue with Image.open(img_path) as im: W, H im.size lines [] for obj in root.findall(object): name obj.find(name).text if name not in class_map: continue cls_id class_map[name] bbox obj.find(bndbox) xmin max(0, float(bbox.find(xmin).text)) ymin max(0, float(bbox.find(ymin).text)) xmax min(W, float(bbox.find(xmax).text)) ymax min(H, float(bbox.find(ymax).text)) # 过滤掉无效框 if xmax xmin or ymax ymin: continue xc (xmin xmax) / 2 / W yc (ymin ymax) / 2 / H w (xmax - xmin) / W h (ymax - ymin) / H lines.append(f{cls_id} {xc:.6f} {yc:.6f} {w:.6f} {h:.6f}) out_path os.path.join(out_dir, os.path.splitext(xml_file)[0] .txt) with open(out_path, w) as f: f.write(\n.join(lines)) voc_to_yolo(annotations, images, labels, {submarine: 0})逻辑说明先读 XML再用 PIL 打开对应图像拿真实宽高然后对每个目标框做边界裁剪和归一化。class_map控制类别映射只保留需要的类别。参数上xml_dir、img_dir、out_dir按实际路径改。注意xmax和ymax要 clamp 到图像宽高否则归一化后坐标会大于 1YOLO 训练时直接报错。2.3 数据集划分别用随机划分遥感图像有个特点同一区域的多张图高度相似。如果随机划分训练集和验证集验证集里可能有跟训练集几乎一样的图指标虚高。正确做法是按区域或按时间划分。如果数据集本身按区域组织直接按区域分如果没有用图像的地理坐标做聚类同一簇的图分到同一侧。没有坐标信息时至少按文件名前缀分组别让同一批次的图跨集。import os import random from sklearn.cluster import KMeans import numpy as np # 假设文件名里包含经纬度或区域编号这里用文件名哈希模拟分组 files [f for f in os.listdir(images) if f.endswith(.jpg)] # 按前缀分组前缀相同的分到同一侧 groups {} for f in files: prefix f.split(_)[0] groups.setdefault(prefix, []).append(f) group_keys list(groups.keys()) random.shuffle(group_keys) split int(len(group_keys) * 0.8) train_groups group_keys[:split] val_groups group_keys[split:] with open(train.txt, w) as f: for g in train_groups: for img in groups[g]: f.write(fimages/{img}\n) with open(val.txt, w) as f: for g in val_groups: for img in groups[g]: f.write(fimages/{img}\n)这段代码按文件名前缀分组保证同一组的图不会同时出现在训练和验证集。参数上0.8是训练集比例按需调整。如果你的数据集有地理坐标把prefix换成坐标聚类结果更好。3. 模型选型与训练参数YOLOv8 还是旋转框检测器3.1 水平框场景YOLOv8 够用但要注意输入分辨率潜艇卫星图目标小YOLOv8 默认 640 输入下一个 30 像素的目标缩到 640 后只剩不到 20 像素特征图上的响应很弱。常见做法是把输入提到 1024 或 1280但显存占用会翻倍。我的经验是先试 1024如果 mAP 不够再上 1280同时把 batch size 降到 4 或 2。YOLOv8 的imgsz参数直接控制输入尺寸训练命令如下yolo detect train \ datasubmarine.yaml \ modelyolov8s.pt \ imgsz1024 \ epochs200 \ batch4 \ patience30 \ lr00.01 \ lrf0.01 \ mosaic0.5 \ scale0.3 \ degrees0.0 \ translate0.1 \ fliplr0.5 \ flipud0.5 \ device0参数说明imgsz1024是输入分辨率小目标场景别低于 1024。batch4是显存不够时的妥协显存够可以上 8。mosaic0.5控制 mosaic 增强概率小目标场景建议降到 0.5 以下因为 mosaic 会把四张图拼一起目标更小。scale0.3是缩放增强幅度别太大否则小目标直接消失。flipud0.5是上下翻转卫星图没有方向性上下翻转合理。degrees0.0关闭旋转水平框场景旋转会引入无效框。3.2 旋转框场景mmrotate 或 YOLOv8-OBB如果目标长宽比大水平框漏检严重就得上旋转框。mmrotate 是 OpenMMLab 的旋转框检测工具箱支持 DOTA 格式。YOLOv8-OBB 是 Ultralytics 的旋转框版本上手更快。两者选型看团队熟悉度mmrotate 配置灵活但学习曲线陡YOLOv8-OBB 开箱即用但自定义受限。mmrotate 训练配置的核心参数在configs/_base_/datasets/dota.py里主要改img_scale、keep_ratio和classes。潜艇数据类别少把num_classes改成 1 或 2。训练命令python tools/train.py \ configs/rotated_retinanet/rotated-retinanet-rbox-le90_r50_fpn_1x_dota.py \ --work-dir work_dirs/submarine \ --cfg-options data.train.dataset.classes(submarine,) \ data.val.dataset.classes(submarine,) \ model.bbox_head.num_classes1参数说明--cfg-options直接覆盖配置里的类别数和类别名。work-dir是输出目录。注意 mmrotate 的 DOTA 格式标注需要images和labelTxt两个目录labelTxt里每行是x1 y1 x2 y2 x3 y3 x4 y4 class_name difficult。3.3 小目标增强三个真正有用的技巧第一个切图训练。把 1024×1024 的图切成 512×512 带重叠目标相对变大。推理时再拼回去。切图重叠率设 0.2太小会漏掉边缘目标太大浪费算力。第二个复制粘贴增强。把训练集里的潜艇目标抠出来随机贴到其他海面背景上。这个对小目标提升明显但要注意粘贴位置别太离谱别贴到陆地上。第三个负样本挖掘。海面杂波、云层阴影、小岛都容易被误检。把这些图作为负样本加入训练能显著降低误报。负样本不需要标注YOLO 里放空 txt 即可。4. 潜艇卫星图检测的避坑与排查五个血泪教训4.1 现象训练 loss 正常下降但 mAP 一直是 0原因标注格式不对。YOLO 要求归一化坐标如果转换时忘了除以宽高坐标全是几百的整数模型学不到东西。或者类别 id 从 1 开始YOLO 要求从 0 开始。解决打开一个 label txt 文件确认所有值都在 0-1 之间。如果不在检查转换脚本的归一化步骤。类别 id 用class_map显式映射别依赖标注文件里的原始 id。4.2 现象验证集 mAP 很高但实际推理漏检严重原因训练集和验证集同分布但实际场景的卫星图分辨率、光照、海况跟数据集不一样。或者验证集划分时同一区域的图跨了集指标虚高。解决按区域重新划分验证集确保验证集区域跟训练集不重叠。另外实际推理时把输入分辨率提到跟训练一致别用默认 640。4.3 现象模型把海浪杂波检测成潜艇原因负样本不足。训练集里全是带潜艇的图模型没见过纯海面把高频纹理当成目标特征。解决加入负样本图空 txt 标注。负样本比例控制在 10%-20%太多会拉低召回。另外推理时提高置信度阈值从 0.25 提到 0.4 试试。4.4 现象旋转框训练时 loss 震荡不收敛原因旋转框的角度定义不一致。mmrotate 里角度有 le90、le135、oc 等多种定义数据标注和配置不匹配时角度回归会乱。解决确认标注文件的角度定义跟配置一致。DOTA 格式默认是 le90如果标注是 le135需要在配置里改angle_version。另外学习率别设太大旋转框回归比水平框敏感lr0从 0.01 降到 0.005 试试。4.5 现象推理速度慢达不到实时原因输入分辨率太高或者模型太大。1024 输入的 YOLOv8s 在单卡上大概 20-30 FPS如果要求实时得降分辨率或换更小的模型。解决先确认业务是否真的需要实时。卫星图检测通常是离线批处理不需要实时。如果确实要实时用 YOLOv8n 加 640 输入但小目标漏检会变多需要权衡。5. 验证与调优用混淆矩阵和 PR 曲线定位问题训练完不是看一个 mAP 就完事。打开 YOLO 输出的混淆矩阵看误检和漏检分别集中在哪。潜艇检测常见的是把“潜艇”和“舰船”搞混如果数据集里这两类都有混淆矩阵会直接告诉你。如果只有一类看背景误检率也就是有多少背景被误判成潜艇。PR 曲线看的是不同置信度下的精确率和召回率。潜艇检测通常要求高召回因为漏掉一个潜艇比误报一个严重。把置信度阈值调到召回率 0.9 以上看精确率掉到多少。如果精确率低于 0.5说明误报太多得加负样本或提高模型容量。from ultralytics import YOLO import matplotlib.pyplot as plt model YOLO(runs/detect/train/weights/best.pt) metrics model.val(datasubmarine.yaml, imgsz1024, conf0.001, iou0.5) # 打印各类别的AP for i, name in enumerate(metrics.names): print(f{name}: AP50{metrics.box.ap50[i]:.3f}, AP{metrics.box.ap[i]:.3f}) # 绘制PR曲线 metrics.box.plot_pr_curve() plt.savefig(pr_curve.png)这段代码加载训练好的模型在验证集上跑评估。conf0.001是为了画完整的 PR 曲线实际部署时用 0.25 或更高。metrics.box.ap50是 IoU0.5 时的 APmetrics.box.ap是 IoU0.5:0.95 的平均 AP。潜艇检测主要看 AP50因为定位精度要求没那么高。调优方向按优先级排先加数据再加负样本再调输入分辨率最后才动模型结构。我见过太多人一上来就改网络结果数据里一堆错标改什么都没用。卫星图数据集的质量比模型重要得多标注框有没有把潜艇完整框住、有没有漏标、类别有没有标错这些检查一遍比调参一周都管用。还有一个习惯每次训练完把预测结果可视化几张肉眼看看漏在哪、误检在哪。指标是黑匣子图是真相。我一般会抽 20 张验证集图用model.predict跑一遍存下来对比。如果发现某个区域的图普遍漏检大概率是那个区域的海况跟训练集差异大得补数据。希望帮到你。本文还有配套的精品资源点击获取

相关新闻

onnxruntime部署LivePortrait人像动画:C++与Python双栈实战

onnxruntime部署LivePortrait人像动画:C++与Python双栈实战

简介:本资源面向希望在人像动画生成方向落地的开发者,提供使用onnxruntime部署LivePortrait的完整程序,同时给出C与Python两套实现路径,适合具备一定深度学习推理基础、想在本地或工程环境中集成人像驱动能力的读者参考。压缩包共…

2026/10/10 22:02:51 阅读更多 →
开源 CUA 大战本周开打:OpenCUA、UI-TARS-1.5 前后脚开源,27k 星的 trycua/cua 如何守擂

开源 CUA 大战本周开打:OpenCUA、UI-TARS-1.5 前后脚开源,27k 星的 trycua/cua 如何守擂

开源 CUA 大战本周开打:OpenCUA、UI-TARS-1.5 前后脚开源,27k 星的 trycua/cua 如何守擂 【免费下载链接】cua Scale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation. 项…

2026/10/10 22:01:50 阅读更多 →
基于VGG16的图像检索系统:毕业设计从特征提取到可复现落地

基于VGG16的图像检索系统:毕业设计从特征提取到可复现落地

简介:这是一套面向高校学生与深度学习入门者的图像检索毕业设计完整项目,基于VGG16卷积神经网络实现以图搜图功能。项目使用Python与Keras搭建,将图像转换为高维特征向量,再通过余弦相似度或欧氏距离完成相似图像匹配,…

2026/10/12 0:55:53 阅读更多 →

最新新闻

J2EE超市订单后台管理系统实战:从架构设计到事务与库存扣减

J2EE超市订单后台管理系统实战:从架构设计到事务与库存扣减

直接用标题开写。G同学曾做过一个J2EE课程设计,叫“基于J2EE架构的超市订单后台理系统”,实打实地完整跑通了需求分析、编码、部署全过程。这篇文章就以这个项目代号11812为例,拆解开发全过程,把常规文档不会写的细节一并补上。1.…

2026/10/12 0:55:27 阅读更多 →
论文降AI率工具怎么选?十款实测对比与操作避坑指南

论文降AI率工具怎么选?十款实测对比与操作避坑指南

1. 这次测评的来龙去脉:为什么2026届突然集体焦虑“AI味"2026届本科生现在应该正处于毕业论文写作的关键周期,我不止一次在后台收到类似留言——“导师说我论文AI味太重”“自己写的怎么也被标成AI生成的”“降AI率工具到底哪个靠谱”。这一波焦虑不…

2026/10/12 0:55:27 阅读更多 →
采矿CAD课程设计PPT:从软件操作到工程表达的全链路建模

采矿CAD课程设计PPT:从软件操作到工程表达的全链路建模

简介:本资源是一份面向高校采矿工程、地质环境与安全工程专业学生的《采矿CAD课程设计》教学课件,聚焦矿山地质环境治理与生态保护的CAD辅助设计实践。课件系统梳理了矿山地质环境定义、矿区生态破坏成因(含景观与生态双重破坏)、…

2026/10/12 0:54:26 阅读更多 →
桌面调度台 vs 云端 Agent 平台:Orca、美团 CatPaw、NVIDIA 路由器的三条路线谁先跑通

桌面调度台 vs 云端 Agent 平台:Orca、美团 CatPaw、NVIDIA 路由器的三条路线谁先跑通

桌面调度台 vs 云端 Agent 平台:Orca、美团 CatPaw、NVIDIA 路由器的三条路线谁先跑通 【免费下载链接】orca Orca is the ADE for working with a fleet of parallel agents. Run any coding agent with your own subscription. Available on desktop, mobile and …

2026/10/12 0:54:26 阅读更多 →
Kubernetes Python 客户端 V1beta2ResourceClaim 模型详解:Dynamic Resource Allocation 资源声明的完整 API 参考

Kubernetes Python 客户端 V1beta2ResourceClaim 模型详解:Dynamic Resource Allocation 资源声明的完整 API 参考

后端云原生容器编排 【免费下载链接】python Official Python client library for kubernetes 项目地址: https://gitcode.com/gh_mirrors/python1/python 点击查看 免费下载 导读 本文面向使用官方 Kubernetes Python 客户端(本项目仓库 gh_mirrors/p…

2026/10/12 0:54:26 阅读更多 →
CodeIgniter 4 Request 类详解:HTTP 请求的面向对象封装与全局数据安全访问

CodeIgniter 4 Request 类详解:HTTP 请求的面向对象封装与全局数据安全访问

后端Web框架 【免费下载链接】CodeIgniter4 Open Source PHP Framework (originally from EllisLab) 项目地址: https://gitcode.com/gh_mirrors/co/CodeIgniter4 点击查看 免费下载 本指南以 CodeIgniter 4 官方用户指南 request.rst 为主体,系统讲解框…

2026/10/12 0:54:26 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →