博客
关于我
【MapReduce】---- MR 框架原理 之 Shuffle机制
阅读量:329 次
发布时间:2019-03-04

本文共 581 字,大约阅读时间需要 1 分钟。


文章目录


♑ 定义

Map方法之后,Reduce方法之前的数据处理过程称之为Shuffle。


♑ Map方法之后Shuffle过程

在这里插入图片描述

主要包括以下几步:

   ♬ 分区

  • 在溢写之前对环形缓冲区中的数据集进行分区操作

   ♬ 排序

  • 在溢写之前对环形缓冲区中分区的数据集进行排序,按照分区进行

   ♬ Combiner(可选)

  • 在溢写到磁盘之前,如果是汇总操作,可以利用Combiner对数据进行分区合并,最终溢写到磁盘上

   ♬ 分区归并排序

  • 将分区上的数据集进行归并,同一分区上的数据集合并,排序(如果符合条件还可以继续进行Combiner合并)

   ♬ 压缩

  • 对处理好的数据进行压缩

   ♬ 写磁盘

  • 将压缩好的数据写到磁盘上,按分区输出


♑ Reduce方法之前Shuffle过程

在这里插入图片描述

主要包括以下几步:

   ♬ 拷贝

  • 将map处理输出的同一分区数据拷贝到内存中,若内存不够,溢出到磁盘中(同时开启一个RecuceTask来处理该分区的数据)

   ♬ 归并排序

  • 将内存和磁盘上的数据集进行归并,也就是在每个开启的ReduceTask中,对从不同MapTask中拉取过来的相同分区的数据进行合并,之后对每个ReduceTask上合并的总数据集再进行排序。

   ♬ 分组

  • 对归并好的数据按照相同的key进行分组,等待reduce()来对同组数据进行处理,也就是相同key的数据进入同一个reduce()方法。


转载地址:http://ckeq.baihongyu.com/

你可能感兴趣的文章
Nacos实战攻略:从入门到精通,全面掌握服务治理与配置管理!(下)
查看>>
Nacos心跳机制实现快速上下线
查看>>
nacos报错com.alibaba.nacos.shaded.io.grpc.StatusRuntimeException: UNAVAILABLE: io exception
查看>>
nacos服务提供和发现及客户端负载均衡配置
查看>>
Nacos服务注册与发现demo
查看>>
Nacos服务注册与发现的2种实现方法!
查看>>
nacos服务注册和发现原理简单实现案例
查看>>
Nacos服务注册总流程(源码分析)
查看>>
nacos服务注册流程
查看>>
Nacos服务部署安装
查看>>
nacos本地可以,上服务器报错
查看>>
Nacos注册Dubbo(2.7.x)以及namespace配置
查看>>
Nacos注册中心有几种调用方式?
查看>>
nacos注册失败,Feign调用失败,feign无法注入成我们的bean对象
查看>>
nacos源码 nacos注册中心1.4.x 源码 nacos源码如何下载 nacos 客户端源码下载地址 nacos discovery下载地址(一)
查看>>
nacos源码 nacos注册中心1.4.x 源码 spring cloud alibaba 的discovery做了什么 nacos客户端是如何启动的(二)
查看>>
nacos源码 nacos注册中心1.4.x 源码 如何注册服务 发送请求,nacos clinet客户端心跳 nacos 注册中心客户端如何发送的心跳 (三)
查看>>
Nacos源码分析:心跳机制、健康检查、服务发现、AP集群
查看>>
nacos看这一篇文章就够了
查看>>
Nacos简介、下载与配置持久化到Mysql
查看>>