欢迎光临

spark

Spark 内存管理机制深度解析与调优实战-汤不热吧

Spark 内存管理机制深度解析与调优实战

andy阅读(86)

前言:为什么Spark内存管理至关重要 Apache Spark 作为大数据处理领域的事实标准框架,其核心优势之一就是基于内存的计算模型。相比 Hadoop MapReduce 的磁盘迭代模式,Spark 能够将中间结果保存在内存中,大幅提...

一文搞懂Spark SQL Shuffle调优:从原理到实战的完整指南-汤不热吧

一文搞懂Spark SQL Shuffle调优:从原理到实战的完整指南

andy阅读(107)

在Spark SQL的实际开发中,Shuffle是影响作业性能的关键瓶颈之一。每当执行groupBy、join、repartition等宽依赖算子时,数据需要在不同节点间重新分布,这个过程就是Shuffle。不合理的Shuffle配置会导致...

关于SBT你需要知道的那些事-汤不热吧

关于SBT你需要知道的那些事

andy阅读(6224)评论(0)

关于SBT你需要知道的那些事 之前在做一个有关spark的项目的时候,需要使用sbt构建scala代码,以前主要用maven,gradle也用一点,但是sbt实在陌生,摸索了一阵,把自己在使用sbt中最需要了解的东西记下来,以备同样不熟悉的...

spark中如何禁用和开启snappy压缩-汤不热吧

spark中如何禁用和开启snappy压缩

andy阅读(6036)评论(0)

spark中如何禁用和开启snappy压缩 spark的作用中如果需要从hdfs中读写较大的结果,最好开启snappy压缩,已取得较好的性能。 开启或者禁用snappy压缩的方法 初始化sparkConf配置 123var conf = n...