# SearchCrawler **Repository Path**: nights-shadow/search-crawler ## Basic Information - **Project Name**: SearchCrawler - **Description**: 四大搜索引擎爬虫工具 - **Primary Language**: Python - **License**: Apache-2.0 - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2025-11-09 - **Last Updated**: 2025-11-09 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README 多引擎爬虫工具 使用说明书 📖 目录 程序简介 功能特点 系统要求 快速开始 详细使用指南 配置说明 常见问题 技术支持 🚀 程序简介 多引擎分页URL爬虫工具是一款专业的网络数据采集软件,能够从多个搜索引擎自动提取真实的企业网站URL。支持百度、必应、搜狗、360四大搜索引擎,智能过滤无效链接,输出纯净的企业网址。 ✨ 功能特点 🔍 多引擎搜索 - 同时从百度、必应、搜狗、360采集数据 🎯 精准过滤 - 智能过滤政府、教育、知名平台,专注企业网站 ⚡ 高速采集 - 异步并发技术,提升采集效率 🔒 真实URL - 自动解析跳转链接,获取最终目标网址 📊 多格式输出 - 支持CSV、纯文本等多种输出格式 🛡️ 授权保护 - 一机一码授权系统,保障软件安全 💻 系统要求 最低配置 操作系统: Windows 10/11 (64位) 内存: 4GB RAM 硬盘: 500MB 可用空间 网络: 稳定的互联网连接 浏览器: Chrome 浏览器(程序自动安装驱动) 推荐配置 操作系统: Windows 10/11 (64位) 内存: 8GB RAM 或更高 硬盘: 1GB 可用空间 网络: 高速宽带连接 🎯 快速开始 第一步:准备关键词 打开 keywords.txt 文件 每行输入一个搜索关键词 保存文件 示例: text 大数据 人工智能 云计算 物联网 第二步:运行程序 双击运行 蜘蛛爬虫工具.exe 首次运行需要激活(见下文激活步骤) 程序自动开始采集 第三步:获取结果 CSV文件: keyword_urls.csv (包含详细数据) 纯文本: pure_urls_时间戳.txt (仅URL列表) 📝 详细使用指南 激活流程(首次使用) 获取机器码 text 运行程序 → 选择"2. 获取机器码" → 复制机器码 联系管理员 将机器码发送给软件提供商 选择授权时长(1个月/1年/永久) 输入激活码 text 收到激活码 → 选择"1. 输入激活码" → 粘贴激活码 → 激活成功 配置说明 编辑 config.json 文件调整参数: json { "search_engines": { "baidu": { "enabled": true, "max_results": 8, // 每页最大结果数 "max_pages": 3 // 最大翻页数 }, "bing": { "enabled": true, "max_results": 8, "max_pages": 2 } }, "strategy": { "request_delay": 3, // 请求延迟(秒) "min_urls_per_keyword": 3 }, "output": { "save_csv": true, // 输出CSV "save_url_txt": true // 输出纯文本 } } 关键词文件格式 keywords.txt 文件要求: 每行一个关键词 支持中文、英文、数字 最大支持100个关键词 文件编码:UTF-8 正确示例: text 工业互联网 智能制造 数字化转型 ⚙️ 高级配置 代理设置(可选) 如需使用代理,修改 config.json: json { "proxy": { "enabled": true, "url": "http://127.0.0.1:7890" } } 输出配置 CSV文件: 包含关键词、标题、URL、来源、页码 纯文本: 仅包含URL,适合批量处理 自动去重: 自动去除重复URL ❓ 常见问题 Q1: 程序无法启动? A: 确保系统已安装 Chrome 浏览器,程序会自动下载必要的驱动。 Q2: 采集速度很慢? A: 这是正常现象,程序设置了请求间隔以避免被反爬虫机制限制。 Q3: 激活失败怎么办? A: 检查机器码是否正确,确保网络连接正常,或联系管理员。 Q4: 结果中为什么没有某些知名网站? A: 程序专门过滤了政府、教育、知名平台等非企业网站,专注中小企业网站。 Q5: 如何提高采集数量? A: 修改 config.json 中的 max_pages 和 max_results 参数。 🛠️ 技术支持 联系方式 微信公众号: 黑帽渗透测试 (ID: hkjs6986) 问题反馈: 通过公众号联系技术支持 服务承诺 📧 24小时内响应问题 🔄 免费 bug 修复 📚 详细使用指导 🔧 专业技术支持 📄 版本信息 当前版本: V1.5 更新日期: 2025年11月 版权所有: 保留所有权利