# pgy_spider **Repository Path**: hanzonghui/pgy_spider ## Basic Information - **Project Name**: pgy_spider - **Description**: 小红书蒲公英KOL采集工具,支持达人筛选、博主详情采集、报价与粉丝画像数据整理、CSV导出。小红书爬虫|蒲公英爬虫|小红书采集工具|小红书蒲公英采集|小红书采集软件|小红书爬取数据|xiaohongshu|xhs|XHS|pgy - **Primary Language**: Python - **License**: Not specified - **Default Branch**: main - **Homepage**: https://mgnb.pro/product/pgy - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 2 - **Created**: 2026-07-15 - **Last Updated**: 2026-07-15 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # pgy_spider > 🔥 小红书蒲公英 KOL 采集工具 / Xiaohongshu Pugongying KOL crawler GUI,支持按筛选条件采集博主列表、进入博主详情页采集核心商业数据,并导出 CSV 文件。 > > 💡 支持 Windows/macOS,无需配置 Python 环境;仓库用于软件介绍、版本发布、使用说明和问题反馈,完整源码暂不公开。 > > [⬇️下载最新版](https://gitee.com/mashukui/pgy_spider/releases) | [🎬使用演示](https://www.bilibili.com/video/BV14J4m1T7tb) | [🏠产品主页](https://mashukui.github.io/pgy_spider/) | [💳开通使用](https://mgnb.pro/product/pgy)

简体中文 README | English README

## 👋 软件简介 `pgy_spider` 是一款面向小红书蒲公英达人筛选、媒介投放和 KOL 数据整理场景的桌面 GUI 工具。软件围绕蒲公英「寻找博主」页面开发,支持按照笔记关键词、笔记类型、粉丝数量、图文报价、搜索页范围等条件筛选博主,并进一步采集博主详情页中的报价、粉丝画像、阅读互动、合作笔记表现等核心字段。 蒲公英是小红书推出的创作者商业合作服务平台,通常需要具备相应权限的企业资质账号才能开通。开通后可在「寻找博主」页面通过筛选条件匹配达人,本工具用于辅助已具备访问权限的用户批量整理公开可见的合作参考数据。 它适合以下场景: | 场景 | 说明 | | --- | --- | | ✅ 达人筛选 | 按关键词、笔记类型、粉丝数量、报价区间等条件批量整理候选 KOL | | ✅ 媒介投放 | 对比达人报价、预估阅读单价、互动中位数和合作笔记表现,辅助投放选型 | | ✅ 品牌种草 | 围绕行业、品类、竞品关键词筛选适合合作的小红书博主 | | ✅ 数据归档 | 将蒲公英页面中的达人基础信息、粉丝画像和商业合作数据保存为 CSV | ## ⚙️ 功能概览 | 功能 | 说明 | 输出 | | --- | --- | --- | | ✅ 博主列表采集 | 根据蒲公英筛选条件采集博主列表数据 | CSV | | ✅ 博主详情采集 | 根据博主 id 进入详情页采集更完整的商业数据 | CSV | | ✅ 条件筛选 | 支持关键词、笔记类型、粉丝数量、图文报价、搜索页范围等条件 | 采集任务 | | ✅ cookie 自动配置 | 内置 cookie小工具,可自动写入 `cookie.txt` | cookie.txt | | ✅ 自动保存 | 采集过程中按条保存结果,降低中断丢数风险 | CSV | | ✅ 运行日志 | 自动记录运行过程,便于排查问题 | logs日志文件 | ## 🚀 快速开始 1. 打开 [Releases](https://gitee.com/mashukui/pgy_spider/releases) 下载最新版软件。 2. 解压后运行对应系统的客户端。 3. 使用软件内置的「cookie小工具」完成cookie配置。 4. 登录软件账号。 5. 填写笔记关键词、笔记类型、粉丝数量、图文报价和页码范围等采集条件。 6. 点击「开始执行」,等待采集完成。 7. 在软件所在目录查看CSV文件和日志文件。 ## 💻 支持系统 | 系统 | 支持情况 | | --- | --- | | Windows | 支持,下载 Windows 客户端即可运行 | | macOS | 支持,下载 macOS 客户端即可运行 | ## 🖼️ 功能展示 ### 爬取目标 蒲公英平台可用于按条件筛选小红书博主: ![输入图片说明](%E7%88%AC%E5%8F%96%E7%9B%AE%E6%A0%87.png) ### 蒲公英寻找博主页面 进入蒲公英「寻找博主」页面后,可以根据平台提供的筛选条件过滤博主列表。页面上方为筛选条件,下方为筛选结果。 ![输入图片说明](%E5%AF%BB%E6%89%BE%E5%8D%9A%E4%B8%BB%E9%A1%B5.png) ### 博主详情页 软件会基于采集到的博主 id,继续进入详情页整理更完整的数据。 ![输入图片说明](%E5%8D%9A%E4%B8%BB%E8%AF%A6%E6%83%85%E9%A1%B5.png) ### 软件主界面 当前软件已升级至v2.3版: ![输入图片说明](v2.3%E8%BD%AF%E4%BB%B6%E7%95%8C%E9%9D%A2.png) ### cookie自动配置 开始采集前,可使用内置的《cookie小工具》自动配置cookie。获取到的cookie值会写入 `cookie.txt`,减少手动复制配置的步骤。 ![输入图片说明](ck%E5%B0%8F%E5%B7%A5%E5%85%B7.png) ### 字段与结果数据 软件可采集`34`个核心字段。演示数据可查看腾讯文档中的《蒲公英》sheet页: [https://docs.qq.com/sheet/DVEFhZlFKR1NXVEdN?tab=suenot](https://docs.qq.com/sheet/DVEFhZlFKR1NXVEdN?tab=suenot) ### 运行日志 采集过程中会生成日志文件,便于出现问题后定位原因。 ![输入图片说明](logs.png) ## 📊 输出字段 软件会根据蒲公英筛选页和博主详情页整理CSV文件。字段较多,下面先按数据类型展示主要字段范围;需要完整字段时,可展开查看。 ### KOL基础信息 - 采集信息:关键词、页码、数据更新至 - 账号信息:小红书昵称、小红书号、小红书链接、地址、机构、账号类型 - 粉丝信息:粉丝数、女性粉丝占比、年龄占比最多的 ### 商业报价与合作数据 - 报价信息:图文报价、视频报价、预估阅读单价_图文 - 合作概况:合作笔记数、账号评估 - 日常数据:图文3秒阅读、阅读中位数、互动中位数、阅读来源发现页占比、阅读来源搜索页占比 - 合作数据:合作阅读中位数、合作互动中位数、合作阅读来源发现页占比、合作阅读来源搜索页占比 ### 合作笔记阅读数据 - 合作笔记表现:合作笔记1阅读数~合作笔记8阅读数
查看完整字段 关键词、页码、小红书昵称、小红书号、地址、机构、数据更新至、小红书链接、粉丝数、账号类型、图文报价、视频报价、合作笔记数、预估阅读单价_图文、图文3秒阅读、日常_阅读中位数、日常_互动中位数、日常_阅读来源发现页占比、日常_阅读来源搜索页占比、合作_阅读中位数、合作_互动中位数、合作_阅读来源发现页占比、合作_阅读来源搜索页占比、女性粉丝占比、年龄占比最多的、账号评估、合作笔记1阅读数、合作笔记2阅读数、合作笔记3阅读数、合作笔记4阅读数、合作笔记5阅读数、合作笔记6阅读数、合作笔记7阅读数、合作笔记8阅读数
## 🛠️ 技术说明 软件采用`Python`开发,核心模块包括: | 模块 | 用途 | | --- | --- | | tkinter | GUI软件界面 | | requests | 接口请求 | | json | 响应数据解析 | | pandas | CSV数据保存 | | logging | 运行日志记录 | 采集程序整合了多个页面接口,用于完成博主列表、日常笔记、合作笔记、粉丝数、阅读单价、合作笔记阅读数、所属机构等数据的整理。为保护个人知识产权、防止恶意盗版,仓库仅展示软件说明和部分骨架结构,暂不公开核心采集代码。 采集过程中会自动保存CSV,并在 `logs` 目录记录运行日志。由于字段来源较多,实际可采集结果会受到账号权限、筛选条件、平台页面返回、网络环境和采集频率等因素影响。 ## 💰 价格说明 | 类型 | 使用期限 | 价格 | 适用场景 | | --- | --- | --- | --- | | 日卡 | 1 天 | 39 元 | 临时试用、小批量任务 | | 月卡 | 1 个月 | 149 元 | 短期采集需求 | | 季卡 | 3 个月 | 399 元 | 中期采集需求 | | 年卡 | 1 年 | 799 元 | 长期稳定使用 | 开通入口:[https://mgnb.pro/product/pgy](https://mgnb.pro/product/pgy) ## 🔐 授权规则 - 软件采用一机一码机制,一个卡密仅支持一台电脑使用。 - 一台电脑仅允许运行一个软件实例,不支持多开。 - 软件由作者长期维护,后续版本通过 [Gitee Releases](https://gitee.com/mashukui/pgy_spider/releases) 发布。 ## ❓ 常见问题 ### 是否需要安装Python? 不需要。软件已打包为桌面客户端,下载对应系统版本后即可运行。 ### 使用前需要什么账号权限? 需要使用已具备蒲公英访问权限的账号。蒲公英通常需要相应企业资质账号申请开通,软件不会绕过平台权限限制。 ### cookie是做什么用的? cookie用于让软件以当前账号状态访问蒲公英页面数据。请使用自己的账号cookie,并妥善保管相关文件。 ### 采集中断后数据会丢失吗? 软件会在采集过程中持续保存结果,不是等全部采集结束后才写入文件。即使中途中断,已完成部分的数据通常仍会保留在结果文件中。 ### 结果文件保存在哪里? 默认保存在软件所在文件夹。CSV文件和日志文件会根据采集任务生成。 ### 支持采集多少数据? 实际可采集数量会受到账号权限、筛选条件、平台接口返回、网络环境和采集频率等因素影响。建议合理设置搜索页范围和请求节奏。 ### 软件报错怎么办? 请优先查看 `logs` 目录下的日志文件,并在反馈时提供以下信息: - 软件版本 - 操作系统 - 使用的筛选条件 - 报错截图 - 对应时间段的日志内容 ## ⚠️ 合规声明 本软件仅供合法合规的数据分析、学习研究和自有业务场景使用。使用者应自行遵守目标平台服务协议、隐私政策以及所在地法律法规。 请勿将本软件用于以下用途: - 高频、恶意或破坏性请求 - 未经授权采集、传播或售卖个人敏感信息 - 绕过平台权限、风控或访问限制 - 侵犯平台、作者、品牌方或用户合法权益的行为 - 违反法律法规或平台规则的其他行为 因使用者不当使用造成的风险和责任,由使用者自行承担。 ## 📦 获取软件 - Gitee Releases:[https://gitee.com/mashukui/pgy_spider/releases](https://gitee.com/mashukui/pgy_spider/releases) - 公众号 `老男孩的平凡之路` 后台回复:`蒲公英` ![输入图片说明](wechat.png)