在 MapReduce 中, 通过我们指定分区, 会将同一个分区的数据发送到同一个 Reduce 当中进行 处理 例如: 为了数据的统计, 可以把一批类似的数据发送到同一个 Reduce 当中, 在同一个 Reduce 当 中统计相同类型的数据, 就可以实现类似的数据分区和统计等 其实就是相同类型的数据, 有共性的数据, 送到一起去处理 Reduce 当中默认的分区只有一个
这个 Mapper 程序不做任何逻辑, 也不对 Key-Value 做任何改变, 只是接收数据, 然后往下发送
import org.apache.hadoop.io.LongWritable; import org.apache.hadoop.io.NullWritable; import org.apache.hadoop.io.Text; import org.apache.hadoop.mapreduce.Counter; import org.apache.hadoop.mapreduce.Mapper; import java.io.IOException; /* K1: 行偏移量 LongWritable V1: 行文本数据 Text K2: 行文本数据 Text V2: NullWritable */ public class PartitionMapper extends Mapper<LongWritable,Text,Text,NullWritable>{ //map方法将K1和V1转为K2和V2 @Override protected void map(LongWritable key, Text value, Context context) throws IOException, InterruptedException { //方式1:定义计数器 Counter counter = context.getCounter("MR_COUNTER", "partition_counter"); //每次执行该方法,则计数器变量的值加1 counter.increment(1L); context.write(value,NullWritable.get()); } }主要的逻辑就在这里, 这也是这个案例的意义, 通过 Partitioner 将数据分发给不同的 Reducer
import org.apache.hadoop.io.NullWritable; import org.apache.hadoop.io.Text; import org.apache.hadoop.mapreduce.Partitioner; public class MyPartitioner extends Partitioner<Text,NullWritable> { /* 1:定义分区规则 2:返回对应的分区编号 */ @Override public int getPartition(Text text, NullWritable nullWritable, int i) { //1:拆分行文本数据(K2),获取中奖字段的值 String[] split = text.toString().split("\t"); String numStr = split[5]; //2:判断中奖字段的值和15的关系,然后返回对应的分区编号 if(Integer.parseInt(numStr) > 15){ return 1; }else{ return 0; } } }这个 Reducer 也不做任何处理, 将数据原封不动的输出即可
import org.apache.hadoop.io.NullWritable; import org.apache.hadoop.io.Text; import org.apache.hadoop.mapreduce.Reducer; import java.io.IOException; /* K2: Text V2: NullWritable K3: Text V3: NullWritable */ public class PartitionerReducer extends Reducer<Text,NullWritable,Text,NullWritable> { public static enum Counter{ MY_INPUT_RECOREDS,MY_INPUT_BYTES } @Override protected void reduce(Text key, Iterable<NullWritable> values, Context context) throws IOException, InterruptedException { //方式2:使用枚枚举来定义计数器 context.getCounter(Counter.MY_INPUT_RECOREDS).increment(1L); context.write(key, NullWritable.get()); } }