Hadoop 是一个开æº�的分布å¼�计算和å˜å‚¨æ¡†æž¶ï¼Œç”± Apache 基金会开å�‘和维护。
Hadoop 为庞大的计算机集群æ��ä¾›å�¯é� çš„ã€�å�¯ä¼¸ç¼©çš„应用层计算和å˜å‚¨æ”¯æŒ�,它å…�许使用简å�•的编程模型跨计算机群集分布å¼�处ç�†å¤§åž‹æ•°æ�®é›†ï¼Œå¹¶ä¸”支æŒ�在å�•å�°è®¡ç®—æœºåˆ°å‡ å�ƒå�°è®¡ç®—机之间进行扩展。
Hadoop 使用 Java å¼€å�‘,所以å�¯ä»¥åœ¨å¤šç§�ä¸�å�Œç¡¬ä»¶å¹³å�°çš„è®¡ç®—æœºä¸Šéƒ¨ç½²å’Œä½¿ç”¨ã€‚å…¶æ ¸å¿ƒéƒ¨ä»¶åŒ…æ‹¬åˆ†å¸ƒå¼�文件系统 (Hadoop DFS,HDFS) å’Œ MapReduce。
Hadoop 历�
2003 年和 2004 年,Google 公�先��表了两篇著�的论文 GFS 和 MapReduce。
这两篇论文和 2006 年�表的 BigTable �为了现在著�的"Google 三大论文"。
Doug Cutting 在�到了这些�论的影��开始了 Hadoop 的开�。
Hadoop 包å�«äº†ä¸¤å¤§æ ¸å¿ƒç»„件。在 Google 的论文ä¸ï¼ŒGFS 是一个在庞大的计算机集群ä¸è¿�行的分布å¼�文件系统,在 Hadoop ä¸ HDFS 实现了它的功能。MapReduce 是一个分布å¼�计算的方å¼�,Hadoop 用å�Œå��ç§°çš„ MapReduce 框架实现了它的功能。我们会在之å�Žçš„ MapReduce ç« èŠ‚ä¸è¯¦ç»†ä»‹ç»�它。 从 2008 年开始,Hadoop 作为 Apache 顶级项目å˜åœ¨ã€‚它与它的众多å�项目广泛应用于包括 Yahooã€�阿里巴巴ã€�腾讯ç‰å¤§åž‹ç½‘络æœ�务ä¼�业,并被 IBMã€�Intelã€�Microsoft ç‰å¹³å�°å…¬å�¸åˆ—为支æŒ�对象。
Hadoop 的作用
Hadoop 的作用é�žå¸¸ç®€å�•,就是在多计算机集群环境ä¸è�¥é€ 一个统一而稳定的å˜å‚¨å’Œè®¡ç®—环境,并能为其他分布å¼�应用æœ�务æ��供平å�°æ”¯æŒ�。
也就是说, Hadoop 在��程度上将多�计算机组织�了一�计算机(��一件事),那么 HDFS 就相当于这�计算机的硬盘,而 MapReduce 就是这�计算机的 CPU 控制器。