小红书数据采集终极指南:5分钟快速掌握Python自动化工具
小红书数据采集终极指南5分钟快速掌握Python自动化工具【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs想要轻松获取小红书公开数据进行内容分析和市场研究吗xhs项目为你提供了一个简单高效的Python解决方案。这个开源工具封装了小红书Web端的请求接口让你能够以编程方式访问笔记、用户、搜索等数据无需手动操作网页。无论你是数据分析师、内容创作者还是产品经理都能通过这个工具快速获取所需的小红书数据为你的决策提供有力支持。为什么选择小红书数据采集工具在当今社交媒体分析领域小红书已经成为不可忽视的内容平台。传统的网页爬虫开发需要处理复杂的反爬机制和频繁的接口变更而xhs工具帮你解决了这些痛点功能特点传统方法xhs工具接口稳定性需要频繁维护封装官方接口稳定性高反爬处理手动处理验证码、签名自动签名验证机制数据完整性可能缺失字段完整的数据结构开发效率数天到数周几分钟上手维护成本持续投入开源社区维护重要提示本工具仅用于学习和研究目的请遵守小红书平台的使用条款不要对网站造成压力或进行未经授权的活动。快速开始5分钟上手小红书数据采集安装步骤超简单首先确保你已安装Python 3.7或更高版本然后只需要一行命令pip install xhs如果你想要最新版本可以直接从Git仓库安装pip install githttps://gitcode.com/gh_mirrors/xh/xhs获取必要的认证信息要使用这个工具你需要准备两个关键信息Cookie- 从小红书网站获取的登录凭证签名函数- 处理请求签名的函数别担心这些听起来复杂其实很简单Cookie可以通过浏览器开发者工具获取而签名函数项目已经提供了示例。第一个采集脚本让我们写一个最简单的示例获取单篇笔记的详细信息from xhs import XhsClient # 初始化客户端 cookie 你的小红书cookie xhs_client XhsClient(cookie) # 获取笔记详情 note_id 6505318c000000001f03c5a6 note_data xhs_client.get_note_by_id(note_id) print(f笔记标题{note_data.get(title, 无标题)}) print(f作者{note_data.get(user, {}).get(nickname, 匿名)}) print(f点赞数{note_data.get(likes, 0)})核心功能深度解析1. 笔记数据获取 小红书数据采集工具提供了多种获取笔记数据的方式按ID获取单篇笔记# 获取指定ID的笔记 note xhs_client.get_note_by_id(笔记ID) # 获取笔记中的图片URL from xhs import help image_urls help.get_imgs_url_from_note(note)获取用户发布的笔记列表# 获取用户的所有笔记 user_notes xhs_client.get_user_notes(用户ID, page1)按关键词搜索笔记# 搜索美妆相关的笔记 search_results xhs_client.get_note_by_keyword( keyword美妆, page1, sortgeneral # 排序方式general(综合)、time(时间) )2. 用户信息分析 了解创作者信息对于内容分析至关重要# 获取用户基本信息 user_info xhs_client.get_user_info(用户ID) print(f用户名{user_info[nickname]}) print(f粉丝数{user_info[fans]}) print(f获赞数{user_info[likes]}) print(f笔记数{user_info[notes]})3. 内容分类浏览 ️工具内置了多种内容分类让你可以按兴趣领域获取内容from xhs import FeedType # 获取穿搭类内容 fashion_notes xhs_client.get_home_feed(FeedType.FASION) # 获取美食类内容 food_notes xhs_client.get_home_feed(FeedType.FOOD) # 获取旅行类内容 travel_notes xhs_client.get_home_feed(FeedType.TRAVEL)支持的内容分类包括穿搭FASION美食FOOD彩妆COSMETICS影视MOVIE职场CAREER情感EMOTION家居HOURSE游戏GAME旅行TRAVEL健身FITNESS实际应用场景案例场景1竞品内容分析假设你是一家美妆品牌的市场人员想了解竞品在小红书上的表现import pandas as pd from datetime import datetime, timedelta def analyze_competitor_content(competitor_id, days30): 分析竞品最近30天的内容表现 all_notes [] current_page 1 while True: notes xhs_client.get_user_notes(competitor_id, pagecurrent_page) if not notes: break # 过滤最近30天的笔记 cutoff_date datetime.now() - timedelta(daysdays) recent_notes [ note for note in notes if datetime.fromtimestamp(note[time]/1000) cutoff_date ] all_notes.extend(recent_notes) current_page 1 # 创建数据分析表 df pd.DataFrame(all_notes) # 计算关键指标 avg_likes df[likes].mean() avg_comments df[comments].mean() avg_shares df[shares].mean() return { total_notes: len(df), avg_likes: round(avg_likes, 2), avg_comments: round(avg_comments, 2), avg_shares: round(avg_shares, 2), best_performing: df.loc[df[likes].idxmax()] }场景2热门话题追踪追踪特定话题的热度变化发现内容趋势def track_topic_trend(keyword, days7): 追踪话题7天内的热度变化 daily_data {} for i in range(days): date datetime.now() - timedelta(daysi) date_str date.strftime(%Y-%m-%d) # 搜索当天相关笔记 results xhs_client.get_note_by_keyword( keywordkeyword, page1, sorttime ) daily_data[date_str] { total_notes: len(results), avg_likes: sum(n[likes] for n in results) / max(len(results), 1), top_note: max(results, keylambda x: x[likes]) if results else None } return daily_data常见问题与解决方案Q1: 如何获取有效的CookieA: 登录小红书网页版后按F12打开开发者工具在Network标签中找到任意请求复制Request Headers中的Cookie字段即可。Q2: 遇到签名失败错误怎么办A: 签名失败通常是因为签名函数配置问题。项目提供了完整的签名示例你可以参考 example/basic_usage.py 中的实现。Q3: 请求频率有限制吗A: 为了避免对小红书服务器造成压力建议添加适当的请求间隔如1-3秒避免短时间内大量请求同一接口使用代理IP轮换如果需要大量采集Q4: 数据采集的合法性如何A: 请务必注意仅采集公开数据不要用于商业侵权用途遵守robots.txt协议尊重用户隐私Q5: 如何保存采集的数据A: 建议使用以下格式保存数据import json import csv # 保存为JSON格式 with open(notes.json, w, encodingutf-8) as f: json.dump(notes_data, f, ensure_asciiFalse, indent2) # 保存为CSV格式 import pandas as pd df pd.DataFrame(notes_data) df.to_csv(notes.csv, indexFalse, encodingutf-8-sig)进阶使用技巧1. 错误处理与重试机制from xhs.exception import DataFetchError, IPBlockError import time def safe_get_note(note_id, max_retries3): 安全获取笔记带重试机制 for attempt in range(max_retries): try: return xhs_client.get_note_by_id(note_id) except (DataFetchError, IPBlockError) as e: if attempt max_retries - 1: raise wait_time 2 ** attempt # 指数退避 print(f请求失败{wait_time}秒后重试...) time.sleep(wait_time)2. 批量处理与进度显示from tqdm import tqdm def batch_process_notes(note_ids): 批量处理笔记显示进度条 results [] for note_id in tqdm(note_ids, desc处理笔记): try: note xhs_client.get_note_by_id(note_id) results.append(note) time.sleep(1) # 避免请求过快 except Exception as e: print(f处理笔记 {note_id} 失败: {e}) return results3. 数据清洗与格式化def clean_note_data(raw_note): 清洗和格式化笔记数据 cleaned { note_id: raw_note.get(id, ), title: raw_note.get(title, ).strip(), author: raw_note.get(user, {}).get(nickname, ), publish_time: datetime.fromtimestamp( raw_note.get(time, 0) / 1000 ).strftime(%Y-%m-%d %H:%M:%S), likes: raw_note.get(likes, 0), comments: raw_note.get(comments, 0), shares: raw_note.get(shares, 0), collects: raw_note.get(collects, 0), tags: [tag.get(name, ) for tag in raw_note.get(tag_list, [])], image_count: len(raw_note.get(images, [])), video_url: raw_note.get(video, {}).get(url, ) if raw_note.get(video) else } # 计算互动率 total_interactions cleaned[likes] cleaned[comments] cleaned[shares] cleaned[interaction_rate] round(total_interactions / max(cleaned[likes], 1), 4) return cleaned最佳实践建议数据采集策略分时段采集避免在高峰时段集中请求增量更新只采集新增或更新的内容数据验证定期检查数据完整性和准确性备份机制定期备份已采集的数据性能优化优化方向具体措施预期效果请求优化合并相似请求减少请求次数30%缓存策略本地缓存已获取数据降低重复请求50%并发控制合理设置并发数提升采集速度2-3倍错误恢复实现断点续采避免重复工作合规使用指南✅可以做的采集公开的笔记数据进行研究分析用于个人学习和小规模项目遵守平台的robots.txt规则❌禁止做的大规模商业数据采集侵犯用户隐私对服务器造成压力违反平台用户协议资源与支持官方文档项目的完整API文档可以在 docs/source/xhs.rst 找到包含了所有类和方法的详细说明。示例代码项目提供了丰富的示例代码帮助你快速上手example/basic_usage.py - 基础使用示例example/login_qrcode.py - 二维码登录示例example/basic_sign_server.py - 签名服务器示例核心源码如果你想深入了解实现原理可以查看核心源码xhs/core.py - 主要功能实现xhs/help.py - 辅助函数测试用例项目包含完整的测试用例确保代码质量tests/test_xhs.py - 主要功能测试tests/test_help.py - 辅助函数测试总结小红书数据采集工具为你提供了一个强大而灵活的数据获取方案。通过这个工具你可以快速获取小红书平台的公开数据深度分析内容趋势和用户行为自动化处理重复的数据采集任务构建应用基于小红书数据的分析系统记住技术只是工具如何使用它才是关键。始终将合规性和道德考量放在首位用技术创造价值而不是问题。希望这个工具能帮助你在小红书数据分析的道路上走得更远、更稳如果你在使用过程中遇到问题或者有改进建议欢迎参与项目的开发和讨论。开源社区的力量能让这个工具变得更加强大和完善。【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

XCOM2模组管理终极指南:AML启动器完全教程

XCOM2模组管理终极指南:AML启动器完全教程

XCOM2模组管理终极指南:AML启动器完全教程 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…

2026/7/29 23:20:56 阅读更多 →
3分钟学会:国家中小学智慧教育平台电子课本一键下载技巧

3分钟学会:国家中小学智慧教育平台电子课本一键下载技巧

3分钟学会:国家中小学智慧教育平台电子课本一键下载技巧 【免费下载链接】tchMaterial-parser 国家中小学智慧教育平台 电子课本下载工具,帮助您从智慧教育平台中获取电子课本的 PDF 文件网址并进行下载,让您更方便地获取课本内容。 项目地…

2026/7/29 23:19:55 阅读更多 →
为什么选择terminal-to-html?5大核心优势解析与真实案例

为什么选择terminal-to-html?5大核心优势解析与真实案例

为什么选择terminal-to-html?5大核心优势解析与真实案例 【免费下载链接】terminal-to-html Converts arbitrary shell output (with ANSI) into beautifully rendered HTML 项目地址: https://gitcode.com/gh_mirrors/te/terminal-to-html terminal-to-html…

2026/7/29 23:19:55 阅读更多 →

最新新闻

【爱马仕】Hermes 整合包 Windows 部署全流程 启动卡顿、文件缺失处理办法(含安装包)

【爱马仕】Hermes 整合包 Windows 部署全流程 启动卡顿、文件缺失处理办法(含安装包)

Windows 本地部署 Hermes 太繁琐?这款一键整合包 5 分钟即可完成搭建 很多想要体验 Hermes Agent 的使用者,实操部署时很容易卡在环境配置环节。 手动部署需要安装各类运行依赖、调试系统运行环境、处理目录路径异常,还会频繁出现命令行报错…

2026/7/29 23:31:59 阅读更多 →
靠谱的阅卷软件哪个功能多

靠谱的阅卷软件哪个功能多

在当今教育数字化的大趋势下,阅卷软件的重要性日益凸显。它不仅能减轻教师的工作负担,还能提高教学效率和精准度。然而,市面上的阅卷软件众多,哪个功能更多且靠谱呢?今天我们就来分析分析,尤其要重点介绍山…

2026/7/29 23:31:59 阅读更多 →
SuperCom:5大核心能力解锁串口调试新境界

SuperCom:5大核心能力解锁串口调试新境界

SuperCom:5大核心能力解锁串口调试新境界 【免费下载链接】SuperCom SuperCom 是一款串口调试工具 项目地址: https://gitcode.com/gh_mirrors/su/SuperCom SuperCom作为一款专业的Windows串口调试工具,为嵌入式开发者、硬件工程师和物联网爱好者…

2026/7/29 23:31:59 阅读更多 →
AG Kit技能组合:如何组合多个AI能力模块解决复杂问题

AG Kit技能组合:如何组合多个AI能力模块解决复杂问题

AG Kit技能组合:如何组合多个AI能力模块解决复杂问题 【免费下载链接】ag-kit 项目地址: https://gitcode.com/GitHub_Trending/an/ag-kit AG Kit(Modular AI Agent Toolkit)是一个强大的模块化AI代理工具包,它允许用户通…

2026/7/29 23:31:59 阅读更多 →
突破性内存管理:Wasmtime内存映射技术如何实现10倍性能提升

突破性内存管理:Wasmtime内存映射技术如何实现10倍性能提升

突破性内存管理:Wasmtime内存映射技术如何实现10倍性能提升 【免费下载链接】wasmtime A lightweight WebAssembly runtime that is fast, secure, and standards-compliant 项目地址: https://gitcode.com/gh_mirrors/wa/wasmtime 在当今大数据和高性能计算…

2026/7/29 23:31:59 阅读更多 →
Siglec: 糖蛋白受体家族的免疫调节作用

Siglec: 糖蛋白受体家族的免疫调节作用

SiglecSiglec(Sialic acid-binding immunoglobulin-like lectins)是一类含有免疫球蛋白样结构域的糖蛋白受体家族,广泛存在于多种免疫细胞中,包括B细胞、T细胞、巨噬细胞、树突状细胞及中性粒细胞等。它们以与唾液酸(s…

2026/7/29 23:30:59 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻