Spark Transformations之mapPartitions

mapPartitions(func) Similar to map, but runs separately on each partition (block) of the RDD, so func must be of type Iterator<T> => Iterator<U> when running on an RDD of type T.

mapPartitions

mapPartitions是map的一个变种。map的输入函数是应用于RDD中每个元素,而mapPartitions的输入函数是应用于每个分区,也就是把每个分区中的内容作为整体来处理的。 
它的函数定义为:

def mapPartitions[U: ClassTag](f: Iterator[T] => Iterator[U], preservesPartitioning: Boolean = false): RDD[U]

f即为输入函数,它处理每个分区里面的内容。每个分区中的内容将以Iterator[T]传递给输入函数f,f的输出结果是Iterator[U]。最终的RDD由所有分区经过输入函数处理后的结果合并起来的。

举例:

1scala> val a = sc.parallelize(1 to 9, 3) 2scala> def myfunc[T](iter: Iterator[T]) : Iterator[(T, T)] = { 3    var res = List[(T, T)]()  4    var pre = iter.next while (iter.hasNext) { 5        val cur = iter.next;  6        res .::= (pre, cur) pre = cur; 7    }  8    res.iterator 9} 10scala> a.mapPartitions(myfunc).collect 11res0: Array[(Int, Int)] = Array((2,3), (1,2), (5,6), (4,5), (8,9), (7,8))

上述例子中的函数myfunc是把分区中一个元素和它的下一个元素组成一个Tuple。因为分区中最后一个元素没有下一个元素了,所以(3,4)和(6,7)不在结果中。
mapPartitions还有些变种,比如mapPartitionsWithContext,它能把处理过程中的一些状态信息传递给用户指定的输入函数。还有mapPartitionsWithIndex,它能把分区的index传递给用户指定的输入函数。

在scala eclipse中运行

1package yanan.spark.core.transformations.example 2 3import org.apache.spark.SparkConf 4import org.apache.spark.SparkContext 5 6object TransformationsTest { 7  def mapPartitionsFunc[T](iter: Iterator[T]): Iterator[(T, T)] = { 8    var res = List[(T, T)]() 9    var pre = iter.next 10    while (iter.hasNext) { 11      val cur = iter.next 12      res.::=(pre, cur) 13      pre = cur; 14    } 15    res.iterator 16  } 17  def mapPartitionsTest(sc: SparkContext) = { 18    val a = sc.parallelize(1 to 9, 3) 19    a.mapPartitions(mapPartitionsFunc).collect.foreach(println) 20  } 21 22  def main(args: Array[String]) { 23    val conf = new SparkConf().setAppName(s"Book example: Scala").setMaster("local[2]") 24    val sc = new SparkContext(conf) 25    mapPartitionsTest(sc) 26    sc.stop() 27  } 28}

pom.xml文件:

1<project xmlns="http://maven.apache.org/POM/4.0.0" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 2 xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd"> 3 <modelVersion>4.0.0</modelVersion> 4 5 <groupId>com.yanan.spark_maven</groupId> 6 <artifactId>spark1.3.1</artifactId> 7 <version>0.0.1-SNAPSHOT</version> 8 <packaging>jar</packaging> 9 10 <name>spark_maven</name> 11 <url>http://maven.apache.org</url> 12 13 <properties> 14 <project.build.sourceEncoding>UTF-8</project.build.sourceEncoding> 15 <jackson.version>1.9.13</jackson.version> 16 <!-- <spark.version>1.3.1</spark.version> --> 17 <spark.version>1.4.0</spark.version> 18 </properties> 19 20 <dependencies> 21 <dependency> 22 <groupId>junit</groupId> 23 <artifactId>junit</artifactId> 24 <version>3.8.1</version> 25 <scope>test</scope> 26 </dependency> 27 <dependency> 28 <groupId>org.scala-lang</groupId> 29 <artifactId>scala-library</artifactId> 30 <version>2.10.4</version> 31 </dependency> 32 <dependency> 33 <groupId>org.apache.spark</groupId> 34 <artifactId>spark-core_2.10</artifactId> 35 <version>${spark.version}</version> 36 </dependency> 37 <dependency> 38 <groupId>org.apache.spark</groupId> 39 <artifactId>spark-mllib_2.10</artifactId> 40 <version>${spark.version}</version> 41 </dependency> 42 <!--<dependency> <groupId>org.apache.spark</groupId> <artifactId>spark-sql_2.10</artifactId>  43 <version>1.3.1</version> </dependency> <dependency> <groupId>org.apache.spark</groupId>  44 <artifactId>spark-hive_2.10</artifactId> <version>1.3.1</version> </dependency>  45 <dependency> <groupId>org.apache.spark</groupId> <artifactId>spark-bagel_2.10</artifactId>  46 <version>1.3.1</version> </dependency> 47  <dependency> 48 <groupId>org.apache.spark</groupId> 49 <artifactId>spark-graphx_2.10</artifactId> 50 <version>1.3.1</version> 51 </dependency> --> 52 53 <!-- specify the version for json_truple <dependency> <groupId>org.codehaus.jackson</groupId>  54 <artifactId>jackson-core-asl</artifactId> <version>${jackson.version}</version>  55 </dependency> <dependency> <groupId>org.codehaus.jackson</groupId> <artifactId>jackson-mapper-asl</artifactId>  56 <version>${jackson.version}</version> </dependency> --> 57 58 </dependencies> 59 60 61 <build> 62 <plugins> 63 <plugin> 64 <groupId>org.scala-tools</groupId> 65 <artifactId>maven-scala-plugin</artifactId> 66 <executions> 67 <execution> 68 <goals> 69 <goal>compile</goal> 70 <goal>testCompile</goal> 71 </goals> 72 </execution> 73 </executions> 74 </plugin> 75 </plugins> 76 </build> 77 <pluginRepositories> 78 <pluginRepository> 79 <id>scala-tools.org</id> 80 <name>Scala-tools Maven2 Repository</name> 81 <url>http://scala-tools.org/repo-releases</url> 82 </pluginRepository> 83 </pluginRepositories> 84 85 <repositories> 86 <repository> 87 <id>cloudera-repo-releases</id> 88 <url>https://repository.cloudera.com/artifactory/repo/</url> 89 </repository> 90 </repositories> 91</project>
点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

手写Java HashMap源码

HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程22

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )

Spark Transformations之mapPartitions - HelloWorld