MiniMax H3开源:多模态2K视频生成模型本地部署与实战指南
如果你最近关注AI视频生成可能会发现一个现象很多模型要么生成质量不稳定要么分辨率太低要么只能处理单一模态的输入。当你想要一个能理解复杂指令、支持多模态上下文、还能输出高清视频的模型时选择往往不多。今天这个局面被打破了。MiniMax 正式开源了其通用视频模型 H3。这不仅仅是一个“又一个开源模型”而是一个在架构设计和能力边界上都有显著突破的版本。它最核心的吸引力在于两点原生支持多模态上下文理解以及能够生成高达2K分辨率的高清视频。这意味着你可以用图片、文字、甚至视频片段作为提示词的一部分让模型基于这些混合信息进行创作并直接得到可用于专业场景的高清输出。对于开发者、研究者和AI应用构建者来说H3的开源释放了一个明确的信号高质量的视频生成能力正在从封闭的实验室走向开放的社区。本文将带你深入解析H3模型从核心原理、环境搭建、到本地部署和效果测试提供一个完整的实践指南。无论你是想将其集成到自己的产品中还是进行研究复现抑或是单纯体验最前沿的视频生成技术读完本文你都能获得一条清晰的路径。1. H3 开源解决了什么实际痛点在深入技术细节之前我们首先要明白H3 的开源究竟在解决哪些真实存在的开发和应用难题。痛点一视频生成模型的“输入贫困”。传统的视频生成模型大多依赖文本描述Prompt。但人类的创意表达是多元的一张参考图、一段描述性视频往往比纯文字更精准。之前要实现多模态输入往往需要复杂的预处理流水线将图像、视频特征编码成文本再喂给模型过程繁琐且信息损耗严重。H3 原生支持多模态上下文直接将图像、视频作为输入的一部分极大地降低了构建复杂创意应用的门槛。痛点二分辨率与质量的权衡。许多开源视频模型出于计算成本考虑将输出分辨率限制在 512x512 或 768x768 级别。这样的视频在移动端小屏观看尚可但一旦需要用于内容创作、广告、短视频平台清晰度就捉襟见肘。H3 支持生成 2K约 2048x1152分辨率视频虽然对硬件要求更高但它为高质量内容生产提供了可能让开源模型首次具备了接近商业级应用的画质潜力。痛点三模型可控性与一致性的缺失。生成视频时角色、场景的一致性保持是一大挑战。H3 通过其多模态上下文能力可以更好地实现这一点。例如你可以先输入一张角色设定图再通过文本描述动作模型能更准确地保持角色特征减少“闪烁”和“突变”。因此H3 的目标用户非常清晰AI 应用开发者希望在自己的产品中集成高质量、可控的视频生成功能。内容创作者与研究者需要一款强大的工具进行艺术创作或学术研究。技术极客与学习者渴望了解和学习最前沿的多模态视频生成技术架构。2. 核心概念解析多模态上下文与 2K 生成理解 H3必须搞清楚两个核心概念多模态上下文和2K视频生成。2.1 什么是多模态上下文Multimodal Context简单来说就是模型能够同时理解和处理来自不同“模态”的信息并将它们融合为一个统一的上下文用于指导生成。模态指信息的类型如文本Text、图像Image、视频Video、音频Audio等。上下文指模型进行推理和生成时所依据的背景信息。在 H3 中多模态上下文意味着你的输入Prompt可以是一个灵活的混合体纯文本提示“一个宇航员在月球上漫步地球在背景中清晰可见。”文本图像提示[一张赛博朋克城市街景图] “在这条街上添加一个穿着发光风衣的行人。”文本视频片段提示[一段海浪拍打岩石的短视频] “将这段视频的风格转换为梵高的星空画风。”甚至更复杂的组合。模型内部通过不同的编码器如 CLIP 用于图像词嵌入用于文本将这些异构输入映射到统一的语义空间再通过一个强大的多模态 Transformer 进行理解和融合。这比“先用人眼观察图片再用文字描述图片最后把文字输入模型”这种间接方式要高效、精准得多。2.2 2K 分辨率生成意味着什么视频分辨率是指视频画面包含的像素数量。2K 通常指水平分辨率达到约 2000 像素级别常见规格为 2048×1080影院2K或 2560×1440QHD常被称作2K。对比常见的 512x512 分辨率包含约 26 万像素而 2048x1152 包含约 236 万像素是前者的9 倍。像素量的提升直接带来了更丰富的细节、更清晰的边缘和更震撼的视觉体验。技术挑战生成高分辨率视频对模型的表征能力、训练数据的质量、以及推理时的计算资源显存、算力都提出了巨大挑战。H3 能够做到这一点表明其在模型缩放、训练稳定性和效率优化上取得了进展。应用价值对于需要直接产出最终内容如短视频、宣传片、游戏素材的场景2K 视频减少了后期升级采样upscaling的步骤和可能带来的画质损失实现了“端到端”的高质量输出。3. 环境准备部署 H3 的硬件与软件要求在激动地开始克隆代码之前请务必检查你的环境是否满足要求。视频生成尤其是高分辨率视频生成是典型的计算密集型任务。3.1 硬件要求推荐GPU这是最重要的部分。建议使用NVIDIA GPU显存不低于 16GB。对于 2K 分辨率生成24GB 或以上显存如 RTX 4090, RTX 3090, A100/A10/A40 等会有更流畅的体验并能支持更长的视频序列或更大的批量大小。显存不足会导致推理失败或只能生成极低分辨率和帧数的视频。CPU现代多核 CPU如 Intel i7/i9 或 AMD Ryzen 7/9 系列用于数据加载和预处理。内存至少 32GB 系统内存RAM。存储预留 50GB 以上的可用磁盘空间用于存放模型权重、代码库和生成结果。3.2 软件环境操作系统LinuxUbuntu 20.04/22.04 为佳或 WindowsWSL2 环境。原生 macOS 可能因缺乏 CUDA 支持而困难重重。Python3.8 至 3.10 版本。建议使用conda或venv创建独立的虚拟环境。CUDA根据你的 GPU 型号安装对应版本的 CUDA Toolkit如 11.7, 11.8, 12.1。这是 PyTorch 等深度学习框架调用 GPU 的基础。深度学习框架PyTorch。需要安装与 CUDA 版本匹配的 PyTorch。其他工具git用于克隆代码ffmpeg用于视频处理许多项目依赖它。4. 一步步部署 MiniMax H3 到本地假设我们在一台满足条件的 Ubuntu 22.04 服务器上进行部署。以下是详细步骤。4.1 第一步创建并激活 Python 虚拟环境使用虚拟环境可以避免包依赖冲突。# 更新系统包列表 sudo apt update sudo apt upgrade -y # 安装 Python3 虚拟环境工具如果未安装 sudo apt install python3-venv python3-pip -y # 创建一个名为 h3_env 的虚拟环境 python3 -m venv h3_env # 激活虚拟环境 source h3_env/bin/activate激活后你的命令行提示符前通常会显示(h3_env)表示已进入该环境。4.2 第二步安装 PyTorch 与基础依赖前往 PyTorch 官网 获取适合你 CUDA 版本的安装命令。例如对于 CUDA 11.8# 在激活的 h3_env 环境中执行 pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118安装一些通用的科学计算和图像处理库pip install numpy pandas matplotlib opencv-python pillow4.3 第三步克隆 H3 代码仓库并安装项目依赖我们需要从 MiniMax 的开源仓库假设为 GitHub具体地址需根据官方公布信息获取代码。# 克隆仓库请将 repository_url 替换为实际的官方仓库地址 git clone repository_url cd minimax-h3 # 安装项目所需的特定依赖 # 通常项目会提供一个 requirements.txt 文件 pip install -r requirements.txt注意如果官方没有直接提供requirements.txt可能需要查看setup.py或pyproject.toml文件或者根据项目文档手动安装。一个典型的视频生成项目可能还包含transformers,diffusers,accelerate,xformers(用于优化) 等库。# 示例手动安装一些可能需要的库 pip install transformers diffusers accelerate # 安装 xformers 以优化注意力计算可选但推荐 pip install xformers4.4 第四步下载模型权重大型模型通常不会直接放在 Git 仓库里。你需要从指定的地方如 Hugging Face Model Hub、官方提供的云存储链接下载预训练的模型权重。# 假设模型权重存放在 Hugging Face 上使用 huggingface-cli pip install huggingface-hub huggingface-cli download MiniMax/H3-model --local-dir ./model_weights # 或者如果官方提供了直接下载链接可以使用 wget 或 curl # mkdir -p model_weights # wget -P ./model_weights 模型权重文件下载链接请务必遵循官方文档中关于模型权重下载的指引确保下载正确的文件和版本。4.5 第五步配置模型路径与环境变量在代码中你需要告诉程序模型权重存放在哪里。通常可以通过修改配置文件或设置环境变量实现。创建一个简单的配置文件config.yaml或在代码中指定路径# config.yaml 示例 model: checkpoint_path: ./model_weights/h3_main_model.safetensors config_path: ./model_weights/config.json inference: resolution: 2048x1152 # 目标生成分辨率 num_frames: 24 # 生成视频帧数 guidance_scale: 7.5 # 分类器自由引导尺度或者在运行前设置环境变量export H3_MODEL_PATH./model_weights export INFERENCE_RESOLUTION2048x11525. 运行你的第一个 H3 视频生成示例现在环境已经就绪让我们运行一个最简单的生成脚本验证一切是否正常。5.1 编写一个简单的推理脚本在项目根目录下创建一个名为generate_simple.py的文件# generate_simple.py import torch from PIL import Image import os # 假设项目提供了名为 h3_pipeline 的推理管道 # 这里是一个模拟的结构实际导入方式请参考官方示例 from pipelines import H3VideoPipeline def main(): # 1. 初始化管道加载模型 print(Loading H3 model...) pipe H3VideoPipeline.from_pretrained( pretrained_model_pathos.getenv(H3_MODEL_PATH, ./model_weights), torch_dtypetorch.float16, # 使用半精度节省显存 devicecuda ) print(Model loaded.) # 2. 定义生成参数 prompt A beautiful sunset over a calm ocean, cinematic, 4K, high detail. negative_prompt blurry, low quality, distorted, ugly # 3. 执行生成 print(fGenerating video for prompt: {prompt}) # 注意实际API可能不同这里仅为示意 video_frames pipe( promptprompt, negative_promptnegative_prompt, height1152, width2048, num_frames16, num_inference_steps50, guidance_scale7.5, generatortorch.Generator(devicecuda).manual_seed(42) # 固定随机种子以便复现 ).frames # 4. 保存生成的视频帧为GIF或MP4 print(Saving output...) # 将帧列表PIL Images或Tensors保存为视频 # 这里需要用到 imageio 或 cv2 等库 import imageio output_path ./output/sunset_ocean.mp4 os.makedirs(os.path.dirname(output_path), exist_okTrue) # 假设 video_frames 是 PIL Image 列表 with imageio.get_writer(output_path, fps8) as writer: for frame in video_frames: writer.append_data(np.array(frame)) # 将PIL Image转为numpy数组 print(fVideo saved to {output_path}) if __name__ __main__: main()5.2 运行脚本并观察在终端中运行你的脚本# 确保在虚拟环境和项目目录下 python generate_simple.py关键观察点加载阶段观察是否有错误提示如“CUDA out of memory”显存不足或“找不到模块”。推理阶段控制台会显示生成进度如50/50 steps。此过程耗时较长取决于你的GPU性能、生成分辨率和帧数。输出完成后在./output/目录下找到生成的视频文件。6. 进阶使用探索多模态上下文输入H3 的核心特性是多模态上下文。让我们看一个结合图像输入的示例。假设我们有一张城市白天的图片city_day.jpg我们想生成一段“同一城市夜晚霓虹灯亮起有飞行汽车穿梭”的视频。# generate_with_image.py import torch from PIL import Image from pipelines import H3VideoPipeline def main(): pipe H3VideoPipeline.from_pretrained(./model_weights, torch_dtypetorch.float16).to(cuda) # 1. 加载条件图像 condition_image Image.open(./assets/city_day.jpg).convert(RGB) # 可能需要调整图像尺寸以匹配模型输入要求 # condition_image condition_image.resize((2048, 1152)) # 2. 准备多模态提示 # 假设管道接受一个 context 参数可以是字典包含图像和文本 multimodal_context { image: condition_image, text: Transform this city scene into night time with neon lights and flying cars. } prompt A cyberpunk city at night, neon lights glowing, flying cars passing by, cinematic. # 3. 生成 video_frames pipe( promptprompt, contextmultimodal_context, # 传入多模态上下文 height1152, width2048, num_frames24, num_inference_steps50, ).frames # ... 保存视频的代码同上 ... print(Generation with image context completed.) if __name__ __main__: main()这个例子展示了如何将一张静态图片作为生成视频的“起点”或“风格参考”模型会尝试理解图片内容并与文本提示结合生成连贯的视频。这是构建“图生视频”应用的基础。7. 常见问题与排查指南 (QA)在部署和运行过程中你几乎一定会遇到一些问题。下表总结了常见问题及解决方法。问题现象可能原因排查步骤解决方案CUDA out of memory显存不足。2K生成需要大量显存。1. 运行nvidia-smi查看GPU使用情况。2. 检查代码中图像/视频的height,width,num_frames参数是否过大。1.降低分辨率尝试 1024x576 或 768x432。2.减少帧数将num_frames从 24 减至 16 或 8。3.启用 CPU offload如果使用diffusers库尝试pipe.enable_model_cpu_offload()。4.使用内存优化安装xformers并启用pipe.enable_xformers_memory_efficient_attention()。5.升级硬件。ImportError: No module named ‘xxx’Python 依赖包缺失或版本不对。查看完整的错误信息确认缺失的模块名。1. 根据错误提示安装对应包pip install xxx。2. 严格按项目requirements.txt安装。3. 创建全新的虚拟环境重试。生成的视频闪烁、扭曲、质量差1. 推理步数 (num_inference_steps) 太少。2. 引导尺度 (guidance_scale) 不合适。3. 提示词 (prompt) 不够详细或冲突。1. 检查生成参数。2. 用相同的seed生成两次看问题是否一致。1.增加推理步数尝试 75 或 100 步。2.调整引导尺度在 5.0 到 15.0 之间微调。3.优化提示词使用更具体、正面的描述并添加质量词汇如masterpiece, best quality, 4K, ultra detailed。使用负面提示词排除不想要的特征。模型加载失败或权重不匹配1. 模型权重文件损坏或没下载完。2. 模型配置文件与权重不匹配。3. 代码版本与权重版本不兼容。1. 检查权重文件大小是否与官方公布的一致。2. 查看加载错误的具体信息。1.重新下载模型权重。2.确保使用官方提供的配套配置文件和代码版本。3. 回退到代码仓库中标记的稳定版本 (git checkout tag)。生成速度极慢1. GPU 算力不足。2. 未使用半精度 (fp16)。3. 未启用优化如 xformers。1. 监控 GPU 利用率 (nvidia-smi -l 1)。2. 检查代码中torch_dtype是否设置为torch.float16。1.使用半精度确保模型加载和推理时使用torch.float16。2.启用 xformers。3.考虑使用更快的采样器如 DPM-Solver。4. 如果用于测试可大幅降低分辨率和帧数。多模态输入未被识别调用 API 的方式错误或模型不支持该格式。1. 仔细阅读官方 API 文档或示例代码。2. 打印context数据的类型和形状。1.严格按照示例格式准备输入数据如 PIL Image, 特定形状的 Tensor。2. 确认你使用的模型分支确实支持多模态输入。8. 最佳实践与工程化建议如果你计划将 H3 用于实际项目或深入研究以下建议能帮你走得更稳。版本固化一旦找到一个能稳定工作的代码和权重版本组合立即将其固化。使用git tag或 Docker 镜像保存整个环境。深度学习项目的依赖冲突是常态。提示词工程视频生成对提示词非常敏感。结构化提示尝试将提示词分为“主题、场景描述、风格、质量、负面”等部分例如[主题宇航员] [场景在月球基地检查设备] [风格科幻电影写实] [质量8K超高清电影光影] [负面卡通模糊多余人]。使用负面提示词明确你不想要什么能有效提升质量。迭代优化从一个简单提示开始逐步增加细节观察变化。参数调优记录建立一个实验日志记录每次生成的prompt,seed,steps,guidance_scale,resolution等参数和对应的输出结果。这是找到最佳参数组合的唯一方法。资源管理与队列视频生成任务耗时长不能阻塞主应用。考虑使用任务队列如 Celery Redis异步处理生成请求并做好超时和重试机制。安全与合规性内容过滤在将用户输入的提示词送入模型前务必进行内容安全过滤防止生成有害、暴力或侵权内容。版权风险生成的视频内容可能包含受版权保护的风格或元素在商业应用中需谨慎评估风险。算力成本明确向用户展示生成高分辨率视频可能需要较长时间和较高成本。性能监控在生产环境中监控 GPU 使用率、任务成功率、平均生成时间等指标以便进行容量规划和故障预警。MiniMax H3 的开源将高质量、多模态视频生成的能力交到了广大开发者和研究者手中。它不仅仅是一个模型更是一个新的起点。通过本文你应该已经掌握了从零开始部署、运行并初步探索 H3 模型的方法。从理解其多模态上下文的核心优势到克服部署中的显存挑战再到进行有效的提示词调优每一步都是将这项前沿技术转化为实际价值的关键。接下来的方向可以是深入其模型架构如 Transformer 设计、扩散模型优化尝试微调Fine-tuning以适应特定领域如动漫风格、产品展示或者将其作为核心引擎构建一个完整的视频创作应用。技术已经就位创意和工程的舞台现在属于你。建议收藏本文在实践过程中遇到具体问题时可以随时回溯到第 7 节的排查指南。

相关新闻

从指尖到街头:探索金华市建设局网站如何重塑城市治理与民生服务体验

从指尖到街头:探索金华市建设局网站如何重塑城市治理与民生服务体验

在这个万物互联、数据奔流的时代,我们对“城市建设”这四个字的认知,往往还停留在钢筋混凝土堆砌的视觉冲击上,或者是对繁忙工地的喧嚣印象中。然而,随着数字政府建设的纵深推进,一座城市的脉动早已不仅仅由塔吊的起落来定义,更由那些隐藏在服务器里的代码、在光纤中传输…

2026/9/27 21:59:51 阅读更多 →
MFC控件开发实战:从基础原理到高级应用与避坑指南

MFC控件开发实战:从基础原理到高级应用与避坑指南

1. MFC控件全景:从经典骨架到现代应用如果你在Windows平台上用C做桌面开发,MFC(Microsoft Foundation Classes)是你绕不开的一个话题。很多人一听到MFC,第一反应可能是“老古董”、“过时了”。确实,它的设…

2026/10/10 18:43:40 阅读更多 →
Unity场景搭建革命:规则驱动的程序化内容生成实战指南

Unity场景搭建革命:规则驱动的程序化内容生成实战指南

1. 项目概述:当场景搭建不再是体力活如果你是一名Unity开发者,无论你是独立游戏制作人、技术美术,还是项目组里的场景搭建主力,我相信你一定经历过这样的时刻:面对一张宏伟的世界设计图,需要填充成千上万的…

2026/10/8 14:34:39 阅读更多 →

最新新闻

easyHook实战:用C#实现全局键盘鼠标钩子与API Hook

easyHook实战:用C#实现全局键盘鼠标钩子与API Hook

简介:C# EasyHook演示工程是一份面向.NET开发者的远程函数拦截与钩子注入入门资源。资源围绕EasyHook库展开,包含被注入宿主进程、类库封装与测试窗口等多个项目,覆盖从NuGet安装、Hook创建、远程方法注册到启动注入的完整流程,尤…

2026/10/12 4:38:46 阅读更多 →
Spring Cloud微服务核心组件、版本选型与高频坑位解析

Spring Cloud微服务核心组件、版本选型与高频坑位解析

Spring Cloud这套东西,很多刚接触微服务的人第一反应是“又大又乱”——全家桶里几十个组件,官方文档翻到手酸,还是搞不清哪个组件是用来干嘛的。我自己第一次在真实项目里落Spring Cloud的时候,也绕了不少弯路。今天这篇就按我的…

2026/10/12 4:38:46 阅读更多 →
AI龙虾必备:4个做短视频的Agent Skills,用TaoToken统一Key跑通CLI工作流

AI龙虾必备:4个做短视频的Agent Skills,用TaoToken统一Key跑通CLI工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 4:38:46 阅读更多 →
ClawTeam 演进路线图深度解析:从单机文件系统到跨机器 Agent 协作的 Transport 抽象之路

ClawTeam 演进路线图深度解析:从单机文件系统到跨机器 Agent 协作的 Transport 抽象之路

人工智能AI Agent多智能体Agent 编排Agent 工作流MCP 服务 【免费下载链接】ClawTeam "ClawTeam: Agent Swarm Intelligence" (One Command → Full Automation) 项目地址: https://gitcode.com/gh_mirrors/cl/ClawTeam 点击查看 免费下载 ClawTeam&…

2026/10/12 4:38:46 阅读更多 →
Proton Pass Agent 接入实战:基于 pass-cli 的 PAT 认证、会话管理与安全取密完整指南

Proton Pass Agent 接入实战:基于 pass-cli 的 PAT 认证、会话管理与安全取密完整指南

前端 【免费下载链接】WebClients Monorepo hosting the proton web clients 项目地址: https://gitcode.com/gh_mirrors/we/WebClients 点击查看 免费下载 本篇技术指南围绕 Proton Pass 为 AI Agent 场景准备的 agent-instructions.md 指令文档展开,系…

2026/10/12 4:38:46 阅读更多 →
上行CCE分配失败拖垮无线接通率:5G网优定位与参数优化案例

上行CCE分配失败拖垮无线接通率:5G网优定位与参数优化案例

简介:这是一份面向5G网络优化工程师的实战案例文档,聚焦上行CCE(Control Channel Element)分配失败导致无线接通率劣化的典型问题。文档以某5G小区为对象,完整记录了从后台指标发现无线接通率劣化、RRC建立成功率与QoS…

2026/10/12 4:37:46 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →