多源数据管理平台 是一个基于 FastAPI 企业级架构构建的多源数据采集、管理与监控平台。提供多种数据源的接入、爬虫任务调度分发、服务器远程管理、待办事项跟踪等完整服务能力。
多源数据管理平台 是一个基于 FastAPI 企业级架构构建的多源数据采集、管理与监控平台。提供多种数据源的接入、爬虫任务调度分发、服务器远程管理、待办事项跟踪等完整服务能力。
ArticleCrawler 是一个用 Python 编写的增量式新闻聚合爬虫项目,基于 Scrapy 框架和 APScheduler 定时调度器构建。它内置了超过 10 个站点的爬虫模块,通过自定义的 SunSpider 基类实现 URL 自动去重,借助 curl_cffi 模拟浏览器指纹来应对反爬机制。项目支持图片本地化下载与 HTML 替换、JSON 文件输出和 MySQL 数据库持久化,并
这个项目是一个基于 Scrapy 和 Flask 的 TRON 区块链数据采集与控制服务,主要通过 tron_spider.py 拉取最新区块与交易信息,并将数据存入 数据库;同时提供接口,用于启动、停止爬虫、查询状态和管理配置。它适合快速搭建 TRON 区块链数据抓取系统,便于在本地或服务器上监控链上区块变化、保存区块与交易详情,并通过简单接口实现爬虫控制与配置调整。
这是一个基于 DrissionPage 的今日头条电商选品爬虫项目,主要通过浏览器自动化访问今日抖音店铺后台,登录后采集商品详情、销售数据、转化率和带货内容链接。项目使用 config.py 管理运行配置,支持最低佣金、目标数量、抓取间隔、暂停时间、视频转化率阈值和禁止关键词过滤。抓取结果会生成 Excel 报表,client_db.py 负责格式化和导出数据。
最近一年贡献:241 次
最长连续贡献:16 日
最近连续贡献:2 日
贡献度的统计数据包括代码提交、创建任务 / Pull Request、合并 Pull Request,其中代码提交的次数需本地配置的 git 邮箱是 Gitee 帐号已确认绑定的才会被统计。