117_l-weiwei
强力 Java 爬虫,列表分页、详细页分页、ajax、微内核高扩展、配置灵活
over 1 year ago
471_flashsword20
webmagic 是一个无须配置、便于二次开发的爬虫框架,它提供简单灵活的API,只需少量代码即可实现一个爬虫。
almost 2 years ago
329436_xiyoumc
全球最大成人网站PornHub爬虫 (Scrapy、MongoDB) 一天500w的数据
6 months ago
117_l-weiwei
二代蜘蛛侠,此版本完全重新开发,比上一代更加强大(性能,易用,架构,分布式,简洁,成熟)
12 months ago
666978_xtuhcy
Gecco 是一款用java语言开发的轻量化的易用的网络爬虫,整合了jsoup、httpclient、fastjson、spring、htmlunit、redission等优秀框架。
6 months ago
429922_mail_osc
扒网站工具,看好哪个网站,指定好URL,自动扒下来做成模版。所见网站,皆可为我所用!
12 months ago
分布式爬虫系统,简单使用,高级配置。可扩展,减轻开发量,能docker化,适应各种急切需求核心框架:WebMagic, Spring Boot ,MongoDB, ActiveMQ ,Spring + Quartz,Spring Jpa , Druid,Redis, Ehcache ,SLF4J、Log4j2, Bootstrap + Jquery 等,不详细列举了
10 months ago
297689_jmxd
新一代爬虫平台,以图形化方式定义爬虫流程,不写代码即可完成爬虫。
2 days ago
实战多种网站、电商数据爬虫。包含:淘宝商品、微信公众号、大众点评、招聘网站、闲鱼、阿里任务、scrapy博客园、微博、百度贴吧、豆瓣电影、包图网、全景网、豆瓣音乐、某省药监局、搜狐新闻、机器学习文本采集、fofa资产采集、汽车之家、国家统计局、百度关键词收录数、蜘蛛泛目录、今日头条、豆瓣影评️️️。微信爬虫展示项目:
1 day ago
13016_dreamidea
牛咖-neocrawler nodejs 的爬虫系统。 特点: 支持web界面方式的摘取规则配置(css selector & regex); 包含无界面的浏览器引擎(phantomjs),支持js产生内容的抓取; 用http代理路由的方式防止抓取并发量过大的情况下被对方屏蔽; nodejs none-block 异步环境下的抓取性能比较高; 中央调度器负责网址的调度(同一时间片内一定数量的抓取任务中根据网站的权重来决定派发任务量; 支持多种抓取实例并存,定制摘取引擎和存储方式。
over 2 years ago
49322435918264
专门用来解决爬虫采集相关网站数据时模拟自动登录,验证码自动识别的问题;欢迎加入一起开发完善。
2 days ago
365569_jiangwl
多线程知乎用户爬虫,基于python3
almost 2 years ago
357525_zongtui
基于hadoop思维的分布式网络爬虫。
over 3 years ago
1200611_coodyer
一款URL网址采集工具。支持自定义采集规则以适配不同搜索引擎
1 year ago
550473_ecitlm
基于nodejs 的爬虫 API接口项目,包括前端开发日报、知乎日报、前端top框架排行、妹纸福利、搞笑视频、各类视频新闻资讯 热点详情接口数据
over 1 year ago

Help Search