Flink+Kafka整合实例
1.使用工具Intellig IDEA新建一个maven项目,为项目命名为kafka01。
2.我的pom.xml文件配置如下。
1<?xml version="1.0" encoding="UTF-8"?> 2<project xmlns="http://maven.apache.org/POM/4.0.0" 3 xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 4 xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd"> 5 <modelVersion>4.0.0</modelVersion> 6 7 <groupId>com.hrb.lhr</groupId> 8 <artifactId>kafka01</artifactId> 9 <version>1.0-SNAPSHOT</version> 10 11 <properties> 12 <project.build.sourceEncoding>UTF-8</project.build.sourceEncoding> 13 <flink.version>1.1.4</flink.version> 14 <slf4j.version>1.7.7</slf4j.version> 15 <log4j.version>1.2.17</log4j.version> 16 </properties> 17 18 <dependencies> 19 <dependency> 20 <groupId>org.apache.flink</groupId> 21 <artifactId>flink-java</artifactId> 22 <version>${flink.version}</version> 23 </dependency> 24 <dependency> 25 <groupId>org.apache.flink</groupId> 26 <artifactId>flink-streaming-java_2.11</artifactId> 27 <version>${flink.version}</version> 28 </dependency> 29 <dependency> 30 <groupId>org.apache.flink</groupId> 31 <artifactId>flink-clients_2.11</artifactId> 32 <version>${flink.version}</version> 33 </dependency> 34 <!-- explicitly add a standard loggin framework, as Flink does not (in the future) have 35 a hard dependency on one specific framework by default --> 36 <dependency> 37 <groupId>org.slf4j</groupId> 38 <artifactId>slf4j-log4j12</artifactId> 39 <version>${slf4j.version}</version> 40 </dependency> 41 <dependency> 42 <groupId>log4j</groupId> 43 <artifactId>log4j</artifactId> 44 <version>${log4j.version}</version> 45 </dependency> 46 <dependency> 47 <groupId>org.apache.flink</groupId> 48 <artifactId>flink-connector-kafka-0.9_2.11</artifactId> 49 <version>${flink.version}</version> 50 </dependency> 51 </dependencies> 52 53</project>
3.在项目的目录/src/main/java在创建两个Java类,分别命名为KafkaDemo和CustomWatermarkEmitter,代码如下所示。
1import java.util.Properties; 2import org.apache.flink.streaming.api.TimeCharacteristic; 3import org.apache.flink.streaming.api.datastream.DataStream; 4import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment; 5import org.apache.flink.streaming.connectors.kafka.FlinkKafkaConsumer09; 6import org.apache.flink.streaming.util.serialization.SimpleStringSchema; 7 8 9public class KafkaDeme { 10 11 public static void main(String[] args) throws Exception { 12 13 // set up the streaming execution environment 14 final StreamExecutionEnvironment env = StreamExecutionEnvironment.getExecutionEnvironment(); 15 //默认情况下,检查点被禁用。要启用检查点,请在StreamExecutionEnvironment上调用enableCheckpointing(n)方法, 16 // 其中n是以毫秒为单位的检查点间隔。每隔5000 ms进行启动一个检查点,则下一个检查点将在上一个检查点完成后5秒钟内启动 17 env.enableCheckpointing(5000); 18 env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime); 19 Properties properties = new Properties(); 20 properties.setProperty("bootstrap.servers", "10.192.12.106:9092");//kafka的节点的IP或者hostName,多个使用逗号分隔 21 properties.setProperty("zookeeper.connect", "10.192.12.106:2181");//zookeeper的节点的IP或者hostName,多个使用逗号进行分隔 22 properties.setProperty("group.id", "test-consumer-group");//flink consumer flink的消费者的group.id 23 FlinkKafkaConsumer09<String> myConsumer = new FlinkKafkaConsumer09<String>("test0", new SimpleStringSchema(), 24 properties);//test0是kafka中开启的topic 25 myConsumer.assignTimestampsAndWatermarks(new CustomWatermarkEmitter()); 26 DataStream<String> keyedStream = env.addSource(myConsumer);//将kafka生产者发来的数据进行处理,本例子我进任何处理 27 keyedStream.print();//直接将从生产者接收到的数据在控制台上进行打印 28 // execute program 29 env.execute("Flink Streaming Java API Skeleton"); 30 31 } 32 33import org.apache.flink.streaming.api.functions.AssignerWithPunctuatedWatermarks; 34import org.apache.flink.streaming.api.watermark.Watermark; 35 36public class CustomWatermarkEmitter implements AssignerWithPunctuatedWatermarks<String> { 37 38 private static final long serialVersionUID = 1L; 39 40 public long extractTimestamp(String arg0, long arg1) { 41 if (null != arg0 && arg0.contains(",")) { 42 String parts[] = arg0.split(","); 43 return Long.parseLong(parts[0]); 44 } 45 return 0; 46 } 47 48 public Watermark checkAndGetNextWatermark(String arg0, long arg1) { 49 if (null != arg0 && arg0.contains(",")) { 50 String parts[] = arg0.split(","); 51 return new Watermark(Long.parseLong(parts[0])); 52 } 53 return null; 54 } 55}
4.开启一台配置好zookeeper和kafka的Ubuntu虚拟机,输入以下命令分别开启zookeeper、kafka、topic、producer。(zookeeper和kafka的配置可参考https://www.cnblogs.com/ALittleMoreLove/p/9396745.html)
1bin/zkServer.sh start 2bin/kafka-server-start.sh config/server.properties 3bin/kafka-topics.sh --create --zookeeper 10.192.12.106:2181 --replication-factor 1 --partitions 1 --topic test0 4bin/kafka-console-producer.sh --broker-list 10.192.12.106:9092 --topic test0
5.检测Flink程序是否可以接收到来自Kafka生产者发来的数据,运行Java类KafkaDemo,在开启kafka生产者的终端下随便输入一段话,在IDEA控制台可以收到该信息,如下为kafka生产者终端和控制台。


OK,成功的接收到了来自Kafka生产者的消息^.^。