博客
关于我
【MapReduce】---- MR 框架原理 之 Shuffle机制
阅读量:329 次
发布时间:2019-03-04

本文共 581 字,大约阅读时间需要 1 分钟。


文章目录


♑ 定义

Map方法之后,Reduce方法之前的数据处理过程称之为Shuffle。


♑ Map方法之后Shuffle过程

在这里插入图片描述

主要包括以下几步:

   ♬ 分区

  • 在溢写之前对环形缓冲区中的数据集进行分区操作

   ♬ 排序

  • 在溢写之前对环形缓冲区中分区的数据集进行排序,按照分区进行

   ♬ Combiner(可选)

  • 在溢写到磁盘之前,如果是汇总操作,可以利用Combiner对数据进行分区合并,最终溢写到磁盘上

   ♬ 分区归并排序

  • 将分区上的数据集进行归并,同一分区上的数据集合并,排序(如果符合条件还可以继续进行Combiner合并)

   ♬ 压缩

  • 对处理好的数据进行压缩

   ♬ 写磁盘

  • 将压缩好的数据写到磁盘上,按分区输出


♑ Reduce方法之前Shuffle过程

在这里插入图片描述

主要包括以下几步:

   ♬ 拷贝

  • 将map处理输出的同一分区数据拷贝到内存中,若内存不够,溢出到磁盘中(同时开启一个RecuceTask来处理该分区的数据)

   ♬ 归并排序

  • 将内存和磁盘上的数据集进行归并,也就是在每个开启的ReduceTask中,对从不同MapTask中拉取过来的相同分区的数据进行合并,之后对每个ReduceTask上合并的总数据集再进行排序。

   ♬ 分组

  • 对归并好的数据按照相同的key进行分组,等待reduce()来对同组数据进行处理,也就是相同key的数据进入同一个reduce()方法。


转载地址:http://ckeq.baihongyu.com/

你可能感兴趣的文章
Navicat 导入sql文件
查看>>
navicat 添加外键1215错误
查看>>
navicat 系列软件一点击菜单栏就闪退
查看>>
navicat 自动关闭_干掉Navicat!MySQL官方客户端到底行不行?
查看>>
Navicat 设置时间默认值(当前最新时间)
查看>>
navicat 连接远程mysql
查看>>
navicat:2013-Lost connection to MySQL server at ‘reading initial communication packet解决方法
查看>>
Navicate for mysql 数据库设计-数据库分析
查看>>
Navicat下载和破解以及使用
查看>>
Navicat中怎样将SQLServer的表复制到MySql中
查看>>
navicat创建连接 2002-can‘t connect to server on localhost(10061)且mysql服务已启动问题
查看>>
Navicat可视化界面导入SQL文件生成数据库表
查看>>
Navicat向sqlserver中插入数据时提示:当 IDENTITY_INSERT 设置为 OFF 时,不能向表中的标识列插入显式值
查看>>
Navicat因导入的sql文件中时间数据类型有参数而报错的原因(例:datetime(3))
查看>>
Navicat如何连接MySQL
查看>>
navicat导入.sql文件出错2006- MySQLserver has gone away
查看>>
Navicat导入海量Excel数据到数据库(简易介绍)
查看>>
Navicat工具Oracle数据库复制 or 备用、恢复功能(评论都在谈论需要教)
查看>>
navicat工具查看MySQL数据库_表占用容量_占用空间是多少MB---Linux工作笔记048
查看>>
navicat怎么导出和导入数据表
查看>>