# ecommerce-analysis **Repository Path**: MatH416/ecommerce-analysis ## Basic Information - **Project Name**: ecommerce-analysis - **Description**: 跨境电商用户行为分析与运营增长策略 | Python / Pandas / Scikit-learn - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 1 - **Forks**: 0 - **Created**: 2026-07-30 - **Last Updated**: 2026-07-30 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 技术栈:Python · Pandas · NumPy · Scikit-learn · SciPy · Matplotlib · Seaborn · Plotly · Parquet ![输入图片说明](image1.png) ![输入图片说明](image2.png) ![输入图片说明](image3.png) ![输入图片说明](image4.png) ![输入图片说明](image5.png) ## 项目背景 针对跨境电商(美妆个护)平台 5 个月、2069 万条用户行为日志,独立完成从数据清洗、指标体系搭建、转化漏斗诊断、用户分层到 A/B 测试框架的全链路分析,产出业务洞察报告与可落地的运营策略,覆盖"数据→洞察→决策"完整闭环。 ## 数据集 **来源:Kaggle [eCommerce Events History in Cosmetics Shop](https://www.kaggle.com/datasets/mkechinov/ecommerce-events-history-in-cosmetics-shop)** | 字段 | 说明 | |------|------| | `event_time` | 事件发生时间 | | `event_type` | 事件类型:view / cart / purchase | | `product_id` | 商品 ID | | `category_code` | 商品类目 | | `brand` | 品牌 | | `price` | 价格 | | `user_id` | 用户 ID | | `user_session` | 会话 ID | 数据量约 2GB,可按需取子集使用,天然支持漏斗分析、RFM 分层、A/B 测试等场景。 ## 项目结构 ``` ecommerce-analysis/ ├── data/ # 原始与清洗后数据 │ ├── 2019-Oct.csv ~ 2020-Feb.csv # Kaggle 原始月度数据(下载后生成) │ └── cleaned_parquet/ # 01 号 Notebook 产出,按月拆分的清洗后 Parquet 文件 ├── download_data.py # 数据下载脚本(kaggle API) ├── requirements.txt # 项目依赖 ├── 01_data_cleaning.ipynb # 数据清洗与预处理 ├── 02_eda_visualization.ipynb # 探索性分析与可视化 ├── 03_business_metrics_funnel.ipynb# 业务指标与漏斗分析 ├── 04_rfm_segmentation.ipynb # 用户分层(RFM + 聚类) ├── 05_ab_testing.ipynb # A/B 测试与统计检验 └── README.md ``` ## 各模块规划 ### 01. 数据清洗与预处理 - 加载数据,查看基本信息(shape、dtypes、head) - 缺失值分析与处理(`brand` 缺失填充/删除) - 重复值检测与去除 - 数据类型转换(`event_time` → datetime,`price` → float) - 异常值检测(负价格、超高价过滤) - 过滤无效 session - 输出清洗后的 Parquet 文件 ### 02. 探索性分析(EDA)与可视化 - 事件类型分布(view / cart / purchase 占比) - 价格分布(直方图,按品类拆分) - 品牌 Top 20 销售额/销量排行 - 时间趋势(日/周/月活跃用户、GMV) - 用户行为热力图(星期 × 小时) - 类目销售结构(Treemap / 饼图) ### 03. 业务指标计算与漏斗分析 - 核心指标看板:DAU/MAU、留存率、客单价、复购率 - 转化漏斗:view → cart → purchase,各环节转化率 - 漏斗可视化(Plotly Funnel Chart) - 流失点诊断:哪些类目/价格段流失严重 - 品类交叉购买分析 ### 04. 用户分层(RFM / 聚类) - 基于 purchase 事件计算 RFM 值 - **R**:最近一次购买距今天数 - **F**:购买频次 - **M**:累计消费金额 - RFM 打分(5 分位法) - 规则分层(冠军用户、忠诚用户、流失风险、新用户等 8 类) - K-Means 聚类(Elbow 法确定最优 k) - 聚类结果可视化(雷达图/3D 散点图) - 各用户群体对应的业务建议 ### 05. A/B 测试与统计检验 - 模拟真实业务场景(如推荐算法改版) - 基于真实数据构造对照组/实验组 - 转化率差异检验:卡方检验 / Fisher 精确检验 - 连续指标差异检验:独立样本 t 检验 / Mann-Whitney U 检验 - 效应量计算(Cohen's d)与统计显著性判断 - 可视化结论与业务决策建议 ## 技术栈 | 类别 | 工具 | |------|------| | 数据处理 | pandas, numpy | | 可视化 | matplotlib, seaborn, plotly | | 统计检验 | scipy.stats | | 机器学习 | scikit-learn(KMeans, StandardScaler) | | 开发环境 | Jupyter Notebook | ## 快速开始 ```bash # 1. 安装依赖 pip install -r requirements.txt # 2. 下载数据集(需先配置 Kaggle API 凭证) python download_data.py # 3. 启动 Jupyter,按顺序运行 01 ~ 05 号 Notebook jupyter notebook ``` ## 项目亮点 - 每个 Notebook 末尾均沉淀**业务结论与可执行建议**,体现"数据 → 洞察 → 决策"完整闭环 - 覆盖数据分析师岗位高频考点:数据清洗、漏斗分析、用户分层、A/B 测试 - 代码注释清晰,可作为面试作品集展示分析思路