9.Spark小型电商项目-离线日志采集流程介绍

优采云 发布时间: 2020-08-09 11:20

  项目一Spark离线处理本项目来源于企业级电商网站的大数据统计剖析平台,该平台以Spark 框架为核心,对电商网站的日志进行离线和实时剖析。该大数据剖析平台对电商网站的各类用户行为(访问行为、购物行为、广告点击行为等)进行剖析,根据平台统计下来的数据,辅助公司中的PM(产品总监)、数据分析师以及管理人员剖析现有产品的情况,并按照用户行为剖析结果持续改进产品的设计,以及调整公司的战略和业务。最终达到用大数据技术来帮助提高公司的业绩、营业额以及市场占有率的目标。本项目使用了Spark 技术生态栈中最常用的三个技术框架,Spark Core、Spark SQL 和Spark Streaming,进行离线估算和实时估算业务模块的开发。实现了包括用户访问session 分析、页面单跳转化率统计、热门商品离线统计、广告流量实时统计4 个业务模块。通过合理的将实际业务模块进行技术整合与改建,该项目几乎完全囊括了Spark Core、Spark SQL 和Spark Streaming 这三个技术框架中大部份的功能点、知识点,学员对于Spark 技术框架的理解将会在本项目中得到很大的提升。项目二Spark实时处理项目简介对于实时性要求高的应用,如用户即时详单查询,业务量监控等,需要应用实时处理构架项目场景对于实时要求高的应用、有对数据进行实时展示和查询需求时项目技术分别使用canal和kafka搭建各自针对业务数据库和用户行为数据的实时数据采集系统,使用SparkStreaming搭建高吞吐的数据实时处理模块,选用ES作为最终的实时数据处理结果的储存位置,并从中获取数据进行展示,进一步增加响应时间。

0 个评论

要回复文章请先登录注册


官方客服QQ群

微信人工客服

QQ人工客服


线