Kafka学习(一)

官网 kafka.apache.org

集群部署

1消息中间键 --> 分布式流式平台 Kafka Streaming 2 3Flume: 1个进程包含三个角色 4 source channle sink 5Kakfa: 每个进程对应一个角色 6 producer broker consumer 7 Flume --> Kafka --> Spark Streaming/Fink (场景) 8 9Kafka部署的进程叫 broker 10 11使用方向: 121. 消息中间件 132. 流式计算 143. 存储 分布式 副本 15Kafka® is used for building real-time data pipelines and streaming apps. It is horizontally scalable, fault-tolerant, wicked fast, and runs in production in thousands of companies. 16 17版本选择: 180.10.0.1 191. CDH-5.12.0(实际使用) 本身学习(CDH-5.7.0) 集群用cdh版本 20 选择相近的chd版的kafka 21 222. Spark Streming官网 23 Kafka+Streaming spark-streaming-kafka-0-10 24 25CDK: clouder distributed kakfa 26 27 28 29

屏幕快照 2019-06-21 16.20.11 base_version+cloudera_version+patch_level

屏幕快照 2019-06-21 16.23.46

http://archive.cloudera.com/kafka/parcels/2.2.0/KAFKA-2.2.0-1.2.2.0.p0.68-el7.parcel

CDH:(实际使用) kafka_2.11-0.10.2-kafka-2.2.0.jar kafka_2.11: scala版本 代码开发选择(2.11.8) 0.10.2: Apache kafka版本 小版本选择 2.2.0: CDK 版本

生产环境版本,实际开发版本,要对应,因为有些api不一样 KAFKA-2.2.0-1.2.2.0.p0.68-el7.parcel KAFKA-2.2.0-1.2.2.0.p0.68-el7.parcel.sha1

Apache版本:(学习用)

CDH在部署过程中: HDFS YARN ZK Hive HBase Spark(1.6.x) 额外单独部署,自定义parcel(包裹): kafka spark2

kafka 使用scala语言编写的

1. 主题: topic

1生产业务: 2oms订单系统: mysql-->flume-->kafka(omstopic)-->SparkStreaming 3wms仓库系统: mysql-->flume-->kafka(wmstopic)-->SparkStreaming 4mkdir omstopic文件夹 (不同业务系统的数据,放在不同文件夹) 5mkdir wmstopic文件夹 6 7alltopic文件夹(最好分开业务系统) 8 9一般根据上游或下游业务系统来划分 10 11kafka创建主题: 一般根据生产业务数据处理来划分 上游+数据处理来划分 12最终落在磁盘上面就是创建文件夹(Linux文件夹)

2. 分区

1omstopic 有3个分区 下标是 2100条数据 3 40 p0 omstopic_0 4 20 p1 omstopic_1 5 40 p2 omstopic_2

3. 副本

1omstopic_0 omstopic_0 omstopic_0 2omstopic_1 omstopic_1 omstopic_1 3omstopic_2 omstopic_2 omstopic_2

4. offset 从0开始 (这个文件在磁盘上的位置)

1log文件 位置下标 2 3mysql: (主键) 4 PK VALUE 5 1 aaa 6 2 bbb 7 3 ccc 8 4 ddd

5.全局有序有序?

160%的公司,都是log日志, 无序的状态 2 如果有序,处理方式和mysql处理方式一致 340%的公司,都是业务数据,mysql,有序数据. 4淘宝购物车, insert(添加一双鞋) , update1(鞋子), update2(口红),update3,update4, delete 5 6 7Kafka数据的文件是Linux磁盘文件 是有序状态,也就是分区内有序 8 追加模式,效率最高; 如何insert ,还要检索 9

重点:
1. 一个分区
2. SparkStreaming程序做排序 分组排序,然后保证全局有序, 代码多,性能差
3. producer api(key-value)

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

手写Java HashMap源码

HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程22

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )