psStyle / repos

0 stars 0 forks source link

MapReduce的执行步骤 #12

Open psStyle opened 9 years ago

psStyle commented 9 years ago
    MapReduce
MapReduce是一种分布式计算模型,由Google提出,主要用于搜索领域,解决海量数据的计

算问题。 MR由两个阶段组成:Map和Reduce ,用户只需要实现map()和reduce()两个函数,即可

实现分布式计算, 这两个函数的形参是key、value对,表示函数的输入信息。

    MapReduce的执行步骤:
1.1、读取输入文件内容,每一行都解析成一个<k,v>,每一个键值对调用一次map函数

1.2、覆盖map(),接收1.1产生的<k,v>,进行处理,转换成新的<k,v>输出

1.3、对1.2输出的<k,v>进行分区。默认是1个区

1.4、对不同分区中的数据按照key进行排序、分组,相同key的value放到一个集合中。

1.5、对分组后的数据进行规约

2.1、多个map任务的输出,按照不同的分区,通过网络copy到不同的reduce节点上

2.2、对多个map的输出进行合并、排序。覆盖reduce函数,接收的是分组后的数据,实现

自己的业务逻辑,处理后,产生新的<k,v>输出

2.3、把reduce输出的<k.v>写入到hdfs中