ArchiveBox `archivebox schedule` 命令完全指南:数据库化定时爬取的创建、管理与运行原理
后端数据工程【免费下载链接】ArchiveBox Open source self-hosted web archiving. Takes URLs/browser history/bookmarks/Pocket/Pinboard/etc., saves HTML, JS, PDFs, media, and more...项目地址https://gitcode.com/gh_mirrors/ar/ArchiveBox点击查看免费下载archivebox schedule是 ArchiveBox 中管理**数据库化定时爬取database-backed scheduled crawls**的核心命令它把调度信息持久化到CrawlSchedule数据库表并交由运行中的全局编排器global orchestrator在到期时物化为待处理的Crawl记录从而摆脱对宿主机 cron、用户 crontab 或独立 scheduler 容器的依赖。读完本文你将掌握该命令的全部参数用法、调度表达式的合法格式、与archivebox server编排器的协作机制以及从源码层面理解调度如何被创建、校验、到期触发与执行。一、命令定位从「cron 外挂」到「数据库调度」在传统方案中定时归档依赖宿主机的 cron 定时执行archivebox add之类的命令。而当前版本的archivebox schedule将调度真正搬进了数据库archivebox schedule ...创建一条CrawlSchedule记录同时生成一个密封的模板Crawlsealed template Crawl状态为SEALED本身不会被直接执行。运行中的全局编排器位于archivebox server内部持续监听已启用的调度。当某个调度到期due时编排器创建一条新的排队中的Crawl状态为QUEUED。这条排队爬取与通过 UI/API 提交的任务走完全相同的处理流水线。这一点在官方文档 docs/Scheduled-Archiving.md 中有明确描述只要archivebox server在运行就不再需要宿主机 cron、用户 crontab 或单独的archivebox_scheduler容器。值得注意的是单次one-shot前台流程的隔离性archivebox add之类的一次性命令只处理自己被要求执行的爬取不会顺带清扫并执行其他到期的定时任务。这一点在 archivebox/tests/test_cli_schedule.py 的test_add_remains_one_shot_when_schedule_is_due测试中有专门验证即使调度已经到期add也不会物化定时任务只产生模板 Crawl、不产生任何定时快照。二、CLI 函数签名与参数速查从 API 文档archivebox.cli.archivebox_schedule.schedule的函数签名可以看到完整参数集合它由 archivebox/cli/archivebox_schedule.py 中的schedule()函数实现并通过main(**kwargs)用rich_click声明为 CLI 命令。参数CLI 选项类型默认值作用add--addflagFalse创建一个新的定时爬取show--showflagFalse打印当前所有已启用的调度clear--clearflagFalse禁用当前所有已启用调度foreground--foreground/-fflagFalse前台运行全局爬取编排器无需 crontabrun_all--run-allflagFalse立即派发所有已启用的调度quiet--quiet/-qflagFalse只返回结构化结果不输出额外摘要every--everystrNone调度别名如daily、weekly或 cron 表达式如0 */6 * * *tag--tag/-tstr应用于定时爬取快照的逗号分隔标签depth--depthint0递归归档链接页面的跳数0–4import_path位置参数strNone要定时爬取的 URL/文件路径缺省时创建维护型调度config内部dictNone配置覆盖如{ONLY_NEW: False}only_new--only-new/--no-only-newflag继承配置跳过已有快照的 URL--no-only-new强制每次重新归档--depth在 CLI 层面被限制为 0–4 的选择值click.Choice([str(i) for i in range(5)])与数据模型中Crawl.max_depth的MaxValueValidator(4)校验一致见 archivebox/crawls/models.py。返回的结构化结果schedule()函数返回一个包含四类信息的 dict源码 archivebox/cli/archivebox_schedule.pycreated_schedule_ids本次新建的CrawlScheduleID 列表disabled_count被--clear禁用的调度数量run_all_enqueued/run_all_maintained--run-all时立即入队的爬取数 / 直接执行的维护任务数active_schedule_ids当前所有启用中的调度 ID 列表。三、基础用法创建、查看、清理与立即执行官方文档 docs/Scheduled-Archiving.md 给出了核心命令集cd ~/archivebox/data # 每天归档一个 RSS feed并递归抓取 1 跳链接 archivebox schedule --everydaily --depth1 https://example.com/feed.xml # 使用 cron 表达式每 6 小时执行一次 archivebox schedule --every0 */6 * * * https://example.com/feed.xml # 查看当前启用的所有调度 archivebox schedule --show # 禁用全部调度 archivebox schedule --clear # 立即派发所有已启用调度 archivebox schedule --run-all # 前台运行全局编排器作为长期运行的调度/工作进程 archivebox schedule --foreground支持的调度表达式格式--every接受两类格式校验逻辑在 archivebox/crawls/schedule_util.py 中实现底层基于croniter别名aliasesminute/minutely、hour/hourly、day/daily、week/weekly、month/monthly、year/yearly。别名到 cron 表达式的完整映射见 schedule_util.py如daily→0 0 * * *weekly→0 0 * * 0monthly→0 0 1 * *yearly→0 0 1 1 *。标准 5 字段 cron 表达式例如0 */6 * * *。任何既不是已知别名、也无法被croniter.is_valid()识别的字符串都会抛出ValueError: Invalid schedule...测试test_schedule_every_requires_valid_periodtest_cli_schedule.py验证了非法值会被拒绝。同时CrawlSchedule.save()在模型层也会再次调用validate_schedule()archivebox/crawls/models.py保证入库数据始终合法。四、维护型调度不带import_path的用法运行archivebox schedule --everyday且不提供任何import_path会创建一个周期性的维护型调度maintenance schedule用于 ArchiveBox 自身的日常维护。从源码看archivebox/cli/archivebox_schedule.pyis_update_schedule not import_path模板 URL 为空标签为Scheduled ArchiveBox update写入CrawlSchedule.config的SCHEDULE_KIND为update到期时调度器直接执行有界的数据库/文件系统维护调用archivebox_update.run_scheduled_maintenance()而不是创建一条合成 Crawl 或 Snapshot见 archivebox/crawls/models.py 的dispatch()方法kind update时直接运行维护并更新modified_at返回None。测试test_schedule_without_import_path_creates_maintenance_scheduletest_cli_schedule.py验证了schedule_row.kind update、template.urls 、template.status sealed。# 排队一个每日维护更新 archivebox schedule --everyday五、--run-all与--foreground的语义差异这两个选项最容易混淆其行为在源码中泾渭分明--run-all遍历所有启用调度并立即dispatch()archivebox/cli/archivebox_schedule.py。对于普通爬取型调度会创建排队中的 Crawl计入run_all_enqueued对于维护型调度则当场直接执行维护计入run_all_maintained。之后会打印提示启动archivebox server、archivebox run --daemon或archivebox schedule --foreground来处理已入队的爬取。--foreground直接调用run_pending_crawls(daemonTrue)启动全局编排器进入长期运行的前台模式。官方文档说明它适合在archivebox server之外、希望有一个不带 Web UI 的专用长期调度/工作进程的场景docs/Scheduled-Archiving.md。编排器的核心循环位于 archivebox/services/runner.py 的run_pending_crawls()daemonTrue时每轮循环都会检查CrawlSchedule.objects.filter(is_enabledTrue)中is_due(now)的调度并调用dispatch()随后按优先级认领并执行到期的 Snapshot、CrawlQUEUED/STARTED/SEALED 状态、取消中/暂停中的子快照清理、到期二进制安装等任务空闲时还会每 30 秒执行一次recover_orchestrator_state()状态恢复并每 24 小时对数据库执行一次有界的ANALYZE统计刷新。到期判定逻辑CrawlSchedule.is_due()archivebox/crawls/models.py的判定依据是return self.is_enabled and self.next_run_at now其中next_run_at基于last_run_at与调度表达式通过croniter计算下一个执行时刻next_run_for_schedule见 schedule_util.py。last_run_at对爬取型调度取最近一条关联 Crawl 的created_at对维护型调度取modified_atarchivebox/crawls/models.py。六、爬取型调度的模板化机制标签、深度与配置覆盖当提供import_path时命令会创建一个密封模板 Crawl和一条引用它的CrawlSchedule模板 Crawl 以statusSEALED创建携带urls支持多行 URL 列表、max_depth、tags_str、label、notes以及一份config其中DEPTH被固定为0 if is_update_schedule else depth源码 archivebox/cli/archivebox_schedule.py。标签与备注默认形如Scheduled import: urls/Created by archivebox schedule for urls上限 64 字符。CrawlSchedule.config会合并模板 config 并附加SCHEDULE_KIND: crawl有 import_path 时或update无 import_path 时。到期后CrawlSchedule.enqueue()archivebox/crawls/models.py基于模板生成新的Crawl复用模板的urls、max_depth、tags_str、persona、label、notes通过build_crawl_config_snapshot(persona..., overrides...)冻结配置快照其中已剔除SCHEDULE_KIND键新 Crawl 状态为QUEUEDschedule外键指向对应CrawlScheduleretry_at设为入队时刻从而进入普通爬取队列。通过--only-new/--no-only-new控制重复归档main()会捕获only_new参数并转换为配置覆盖archivebox/cli/archivebox_schedule.pyonly_new kwargs.pop(only_new, None) if only_new is not None: kwargs[config] {ONLY_NEW: bool(only_new)}默认不传该选项继承全局ONLY_NEW配置已有快照的 URL 会被跳过--no-only-new强制每次定时运行都重新归档全部 URL。ONLY_NEW在创建快照时生效create_snapshots_from_urls()中会读取config[ONLY_NEW]默认True来决定是否跳过已有快照的 URLarchivebox/crawls/models.py。七、Docker Compose 部署形态在新的编排器流程下只需保留主archivebox服务即可官方文档 docs/Scheduled-Archiving.md 给出的最小配置services: archivebox: image: archivebox/archivebox:dev command: server --init 0.0.0.0:8000 volumes: - ./data:/data创建与查看调度docker compose run --rm archivebox schedule --everyweekly --depth1 https://example.com/feed.xml docker compose run --rm archivebox schedule --show只要主archivebox server容器在运行其内部编排器会自动接管后续的定时执行不需要重启任何 scheduler 伴生容器。八、实战示例结合 URL 过滤配置的定时归档官方文档 docs/Scheduled-Archiving.md 给出了三个可直接套用的组合场景其关键点是把archivebox config --set的 URL 过滤规则与定时调度叠加使用每周归档一次 Twitter 镜像含 1 跳链接archivebox schedule --everyweekly --depth1 https://nitter.net/ArchiveBoxApp每周归档一个 subreddit 及其讨论链接配合 URL 白名单archivebox config --set URL_ALLOWLIST^http(s)?:\/\/(.)?teddit\.net\/?.*$ archivebox schedule --everyweekly --depth1 https://teddit.net/r/DataHoarder/每天归档 Hacker News配合 URL 黑名单屏蔽外部视频/购物站archivebox config --set URL_DENYLIST^http(s)?:\/\/(.\.)?(youtube\.com)|(amazon\.com)\/.*$ archivebox schedule --everydaily --depth1 https://news.ycombinator.comURL 过滤规则的匹配实现位于 archivebox/crawls/models.py纯域名模式*.通配子域走域名规范化比对其余模式作为正则表达式执行url_passes_filters()先查黑名单命中即拒绝再查白名单有白名单时仅放行命中的 URL见 archivebox/crawls/models.py。九、管理与验证建议查看当前调度archivebox schedule --show会列出每个启用调度的id、every调度表达式、next_run下次执行时刻与source模板首个 URL见 archivebox/cli/archivebox_schedule.py不带任何参数直接运行archivebox schedule也会打印同样的活动调度摘要。清理调度archivebox schedule --clear会通过一次批量UPDATE将所有is_enabledTrue的调度置为禁用archivebox/cli/archivebox_schedule.py。在脚本中使用-q/--quiet让命令只返回结构化 dict便于被其他工具或工作流消费。测试参考完整的 CLI 行为验证可参考 archivebox/tests/test_cli_schedule.py包括创建启用调度test_schedule_creates_enabled_db_schedule、列出test_schedule_show_lists_enabled_schedules、清理test_schedule_clear_disables_existing_schedules、非法周期拒绝、以及端到端到点执行test_schedule_due_crawl_runs_over_server_and_saves_real_content。十、总结archivebox schedule把「定时归档」从依赖外部 cron 的模式升级为数据库内自洽的调度体系CrawlSchedule记录持久化调度意图密封模板Crawl定义每次执行的形态URL、深度、标签、配置运行中的编排器负责到期物化与队列执行。理解--every的别名/ cron 双格式、--run-all与--foreground的差别、维护型与爬取型调度的分流SCHEDULE_KIND以及--only-new配置覆盖的传导路径就能把 ArchiveBox 稳定地纳入自动化归档流水线。赞分享后端数据工程【免费下载链接】ArchiveBox Open source self-hosted web archiving. Takes URLs/browser history/bookmarks/Pocket/Pinboard/etc., saves HTML, JS, PDFs, media, and more...项目地址https://gitcode.com/gh_mirrors/ar/ArchiveBox点击查看免费下载相关推荐ArchiveBox 标签管理命令 archivebox tag 完整实战指南创建、列表、重命名与删除ArchiveBox 标签管理命令 archivebox tag 完整实战指南创建、列表、重命名与删除 本篇技术指南围绕 ArchiveBox 的 archi后端数据工程ArchiveBox 状态诊断指南archivebox status 命令的统计原理与实战用法ArchiveBox 状态诊断指南 archivebox status 命令的统计原理与实战用法 archivebox status 是 ArchiveBox后端数据工程ArchiveBox archivebox server 命令深度解析Web 归档服务的绑定地址校验、启动流程与运行时栈管理ArchiveBox archivebox server 命令深度解析Web 归档服务的绑定地址校验、启动流程与运行时栈管理 archivebox serve后端数据工程上一篇GitHub Actions 上传工件项目推荐下一篇G2Plot 2025零代码构建企业级可视化大屏的革命创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

51单片机交通灯硬核实现:黄灯精准闪烁与数码管动态扫描

51单片机交通灯硬核实现:黄灯精准闪烁与数码管动态扫描

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/22 20:50:58 阅读更多 →
HuLa 即时通讯实用指南:从安装到群聊、文件传输与 AI 助手

HuLa 即时通讯实用指南:从安装到群聊、文件传输与 AI 助手

HuLa 即时通讯实用指南:从安装到群聊、文件传输与 AI 助手 【免费下载链接】HuLa 🍀 A cross-platform instant messaging desktop application with exceptional performance built on Rust Vue3, compatible with Windows, macOS, Linux, Android, an…

2026/9/22 9:48:18 阅读更多 →
SWMM排水模型入门:从手算思维到管网动态模拟的完整教程

SWMM排水模型入门:从手算思维到管网动态模拟的完整教程

刚转做排水设计那阵子,我最大的卡点不是管网平差,而是怎么把一场两小时的大雨,换算成下游管道的几条流量线。手算推理公式可以做,但一旦碰上小区竖向复杂、两块汇水区中间还隔着绿化带的情况,那种“近似到底靠不靠谱”…

2026/9/23 3:45:00 阅读更多 →

最新新闻

ECG心电信号分类实战:Python与Matlab双版本实现与避坑指南

ECG心电信号分类实战:Python与Matlab双版本实现与避坑指南

简介:这是一份面向医学数据分析、生物医学工程及机器学习初学者的ECG心电信号分类资源包,整合Python与MATLAB两套实现方案,帮助学习者掌握从信号预处理、特征提取到分类建模的完整流程。压缩包共825个文件,约6.25MB,核…

2026/9/24 0:46:51 阅读更多 →
YOLOv7打电话检测实战:双格式数据集与训练部署全解析

YOLOv7打电话检测实战:双格式数据集与训练部署全解析

简介:YOLOv7打电话行为检测项目,面向计算机视觉开发者与边缘设备部署场景,适合需要快速落地手持电话识别功能的工程人员及高校研究者。压缩包提供训练好的权重、完整训练代码以及配套数据集,可直接加载权重进行图片/视频推理&…

2026/9/24 0:46:51 阅读更多 →
ResNet50迁移学习做垃圾分类:数据对齐、模型改造与可解释性实战

ResNet50迁移学习做垃圾分类:数据对齐、模型改造与可解释性实战

简介:本资源是一份基于ResNet50迁移学习实现垃圾分类任务的完整Python项目,面向计算机、人工智能、数据科学等专业学生及初入CV领域的开发者,适用于课程设计、毕业设计、大作业或技术验证场景。项目已通过实测运行,包含模型训练、…

2026/9/24 0:46:51 阅读更多 →
基于SpringBoot的仓储管理系统-附源码

基于SpringBoot的仓储管理系统-附源码

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/9/24 0:44:50 阅读更多 →
ISO 24748-3指南:软件生命周期过程落地与裁剪实战

ISO 24748-3指南:软件生命周期过程落地与裁剪实战

简介:ISO/IEC/IEEE 24748-3:2020 是一份系统与软件工程领域生命周期管理国际标准,旨在为组织实施 ISO/IEC/IEEE 12207(软件生命周期过程)提供详细指南。该标准共75页,完整英文电子版,适用于软件工程师、系统…

2026/9/24 0:44:50 阅读更多 →
Linux与Windows交替输出实现原理对比

Linux与Windows交替输出实现原理对比

1. 这道题到底在考什么:从“交替输出”看操作系统思维的本质差异刚看到这个标题——“Linux课后作业,用Windows下批处理和Linux下的shell脚本完成,两文本交替输出”——我第一反应不是写代码,而是笑了。不是笑题目难,是…

2026/9/24 0:44:50 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →