Hadoop分布式文件系統(tǒng)(HDFS)設(shè)計為適合在商用硬件上運(yùn)行的分布式文件系統(tǒng)。 它與現(xiàn)有的分布式文件系統(tǒng)有很多共同點(diǎn)。 但是與此同時,它與其他分布式文件系統(tǒng)之間的區(qū)別也非常明顯。 HDFS是一個高度容錯的系統(tǒng),適合在廉價機(jī)器上部署。 HDFS可以提供高吞吐量的數(shù)據(jù)訪問,非常適合大規(guī)模 數(shù)據(jù)集 上的應(yīng)用程序。 HDFS放松了一些POSIX約束,以達(dá)到流傳輸文件系統(tǒng)數(shù)據(jù)的目的。 HDFS最初是作為Apache Nutch搜索引擎項目的基礎(chǔ)結(jié)構(gòu)開發(fā)的。 HDFS是Apache Hadoop Core項目的一部分。
Hadoop是一個分布式計算平臺,使用戶可以輕松地進(jìn)行架構(gòu)和使用用戶可以輕松地在Hadoop上開發(fā)和運(yùn)行處理海量數(shù)據(jù)的應(yīng)用程序。它主要有以下幾個優(yōu)點(diǎn):
1.高可靠性:Hadoop按位存儲和處理數(shù)據(jù)的能力值得人們信賴。
2.高擴(kuò)展性:Hadoop是在可用的計算機(jī)集簇間分配數(shù)據(jù)并完成計算任務(wù)的,這些集簇可以方便地擴(kuò)展到數(shù)以千計的節(jié)點(diǎn)中。
3.高效性:Hadoop能夠在節(jié)點(diǎn)之間動態(tài)地移動數(shù)據(jù),并保證各個節(jié)點(diǎn)的動態(tài)平衡,因此處理速度非???。
4.高容錯性:Hadoop能夠自動保存數(shù)據(jù)的多個副本,并且能夠自動將失敗的任務(wù)重新分配。
5.低成本:與一體機(jī)、商用 數(shù)據(jù)倉庫 以及QlikView、Yonghong Z-Suite等數(shù)據(jù)集市相比,hadoop是開源的,項目的軟件成本因此會大大降低