Spark运行原理及RDD解密-创新互联

Spark是分布式内存计算框架,而不是分布式内容存储框架,搭配tachyon分布式内存文件系统,会更加有效果。

创新互联是一家业务范围包括IDC托管业务,网页空间、主机租用、主机托管,四川、重庆、广东电信服务器租用,四川联通机房服务器托管,成都网通服务器托管,成都服务器租用,业务范围遍及中国大陆、港澳台以及欧美等多个国家及地区的互联网数据服务公司。

在文件模式下,spark比hadoop快10倍,在内存计算模式下,快100倍!

下面是一些

1 spark是分布式 基于内存 特别适合于迭代计算的计算框架

2 mapReduce就两个阶段map和reduce,而spark是不断地迭代计算,更加灵活更加强大,容易构造复杂算法。

3 spark不能取代hive,hive做数据仓库存储,spark sql只是取代hive的计算引擎,成为分析平台,hadoop作为存储平台

4 spark中间数据可以在内存也可以在磁盘

5 partition是一个数据集合

6 注意:初学者执行多个步骤要注意分步检验,不然不知哪里错了

7 var data = sc.textFile("/user") 不必写hdfs:// ,根据上下文判断

8 读文件得到HadoopRDD,去掉文件中索引,得到MapPartitionsRDD,这样一系列分片的数据分布在 不同的机器。

9 移动计算而不是移动数据

移动计算表示分布到各个机器上,分别计算自身负责的那部分数据,而不是把数据从各个机器上移动来进行计算。

计算完后进行数据汇总。

另外有需要云服务器可以了解下创新互联scvps.cn,海内外云服务器15元起步,三天无理由+7*72小时售后在线,公司持有idc许可证,提供“云服务器、裸金属服务器、高防服务器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案,具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势,专为企业上云打造定制,能够满足用户丰富、多元化的应用场景需求。


文章题目:Spark运行原理及RDD解密-创新互联
本文来源:http://scyanting.com/article/dpiepi.html