# SparkProject **Repository Path**: oceanrivers/spark-project ## Basic Information - **Project Name**: SparkProject - **Description**: 爬取京东网站的电脑配件商品数据,并使用Spark的RDD算子、SparkSQL、SparkStreaming、StructuredStreaming、SparkML对其进行分析 - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 2 - **Forks**: 0 - **Created**: 2025-05-01 - **Last Updated**: 2025-12-16 ## Categories & Tags **Categories**: Uncategorized **Tags**: Spark ## README # 一个史诗级的巨著 ## version1.0 时间:2025年5月1日23:40:17 内容:数据预处理使用Python做的,代码没有放进来,最后我全部做完再更新进来吧,今天主要是完成了RDD编程里面的部分需求。 这里总结一下reduceByKey、combineByKey、aggregateByKey的区别(今天完成的需求里用到了): >reduceByKey:输入、中间累加器、输出三者的类型必须一致 >combineByKey:中间累加器和输出数据类型一致,输入类型可以与他们不一致,累加器的初始值取自分区第一个值 >aggregateByKey:中间累加器和输出数据类型一致,输入类型可以与他们不一致,累加器的初始值可以自定义(最灵活) >aggregateByKey和combineByKey的第一个形参都是定义中间累加器,第二个形参是分区内计算逻辑,第三个形参是分区间计算逻辑 ## version1.1 时间:2025年5月2日16:56:25 内容:把RDD编程的剩余内容完成了 ## version2.0 时间:2025年5月2日22:19:23 内容:把SparkSQL分析部分完成了,后续考虑看能不能加一下用到UDF、UDAF、UFTF的需求 ## version3.0 时间:2025年5月3日21:32:08 内容:把流处理部分的内容完成了(包括SparkStreaming和StructuredStreaming),其中SparkStreaming部分在读取Kafka数据时有时候会出现读取不到数据的情况(具体解析看代码部分的注释) ## version4.0 时间:2025年5月5日21:21:40 内容:主要完成了Spark机器学习部分的内容,做了逻辑回归分类和KMeans聚类