SparkSQL查询程序的两种方法,及其对比

1import包: 2 3import org.apache.spark.{SparkConf, SparkContext}import org.apache.spark.rdd.RDDimport org.apache.spark.sql.types.{IntegerType, StringType, StructField, StructType}import org.apache.spark.sql.{DataFrame, Row, SQLContext} 4 5样例类: 6 7case class Person(id:Int,name:String,age:Int) 8 9主函数:def main(args: Array[String]): Unit = { val sparkConf: SparkConf = new SparkConf().setAppName(this.getClass.getName).setMaster("local") val sparkContext = new SparkContext(sparkConf) val sqlContext = new SQLContext(sparkContext) val rdd: RDD[String] = sparkContext.textFile("C:\\Users\\dummy\\Desktop\\person.txt") val lineRdd: RDD[Array[String]] = rdd.map(_.split(" ")) InferringSchema(lineRdd,sqlContext) SpecifyingSchema(lineRdd,sqlContext) sparkContext.stop()}第一种方法:(需要创建样例类) 10 11/** * 通过反射推断Schema * @param lineRdd * @param sqlContext */def InferringSchema(lineRdd: RDD[Array[String]],sqlContext:SQLContext): Unit ={ //将RDD和case class关联 val personRdd: RDD[Person] = lineRdd.map(x=>Person(x(0).toInt,x(1),x(2).toInt)) //导入隐式转换,如果不导入无法将RDD转换成DataFrame import sqlContext.implicits._ //将RDD转换成DataFrame val personDF: DataFrame = personRdd.toDF() personDF.show() //注册一张临时表 //personDF.registerTempTable("person") //val personDF2: DataFrame = sqlContext.sql("select * from person") //将结果以JSON的方式存储到指定位置 //personDF2.write.json("C:\\Users\\dummy\\Desktop\\out") //personDF2.show()} 12 13第二种方法: 14 15/** * 通过StructType直接指定Schema * @param lineRdd * @param sqlContext */def SpecifyingSchema(lineRdd: RDD[Array[String]],sqlContext:SQLContext): Unit ={ //通过StructType直接指定每个字段的schema val schema=StructType( List( /**StructField只需传入前面两个参数即可 * name: String, * dataType: DataType, * nullable: Boolean = true, * metadata: Metadata = Metadata.empty) */ StructField("id",IntegerType), StructField("name",StringType), StructField("age",IntegerType) ) ) val rowRdd: RDD[Row] = lineRdd.map(x=>Row(x(0).toInt,x(1),x(2).toInt)) val personDF: DataFrame = sqlContext.createDataFrame(rowRdd,schema) //personDF.show() personDF.registerTempTable("person") val personDF2: DataFrame = sqlContext.sql("select * from person") //personDF2.write.json("C:\\Users\\dummy\\Desktop\\out") personDF2.show()}对比:

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

手写Java HashMap源码

HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程22

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )