Spark和Java API（四）分区

本文主要是介绍Spark和Java API（四）分区，对大家解决编程问题具有一定的参考价值，需要的程序猿们随着小编来一起学习吧！

RDD的分区是什么？

RDD，顾名思义它是分布式的，那么它是怎么实现分布式呢？答案就是分区，也即是一个RDD会将计算逻辑分布在整个集群中。这很像kafka中的topic的分区，通过水平扩展的方式提供系统的吞吐量。那么分区是如何分布在整个集群中呢？我们拿hdfs举例，假设hdfs上有一个文件A，大小为1个GB，hdfs默认会将这个文件切割成多个block，每个block为128MB，那么A拥有4个主block，因为hdfs会对文件做冗余，一个block有2个备份。所以A一共有12个block。这12个block分散在集群的不同的节点上，当一个RDD需要引用文件A时，它会分配4个分区，每个分区对应一个主block和两个备block，然后将计算逻辑发送到block所在的节点进行运算。

这篇关于Spark和Java API（四）分区的文章就介绍到这儿，希望我们推荐的文章对大家有所帮助，也希望大家多多支持为之网！

Java教程

Spark和Java API（四）分区

RDD的分区是什么？

前端开发

后端开发

移动端开发

数据库

服务器运维

人工智能

区块链

游戏开发

网站运营

大数据/云计算

软件工程

软件/开发工具使用

资讯