大數(shù)據(jù)分析之六大神器
大數(shù)據(jù)是一個內(nèi)涵寬泛的術(shù)語,其中含有十分龐大且復(fù)雜無比數(shù)據(jù)集的意思,需要專門設(shè)計的硬件和軟件工具進(jìn)行處理。該數(shù)據(jù)集通常是萬億或EB的大小。這些數(shù)據(jù)集收集自各種各樣的來源:傳感器、氣候信息、公開的信息、如雜志、報紙、文章。大數(shù)據(jù)產(chǎn)生的其他例子包括購買交易記錄、網(wǎng)絡(luò)日志、病歷、事監(jiān)控、視頻和圖像檔案、及大型電子商務(wù)。大數(shù)據(jù)分析是在研究大量的數(shù)據(jù)的過程中尋找模式,相關(guān)性和其他有用的信息,可以幫助企業(yè)更好地適應(yīng)變化,并做出更明智的決策。
Hadoop
Hadoop是一個能夠?qū)Υ罅繑?shù)據(jù)進(jìn)行分布式處理的軟件框架。但是Hadoop是以一種可靠、高效、可伸縮的方式進(jìn)行處理的。Hadoop是可靠的,因為它假設(shè)計算元素和存儲會失敗,因此它維護(hù)多個工作數(shù)據(jù)副本,確保能夠針對失敗的節(jié)點重新分布處理。Hadoop是高效的,因為它以并行的方式工作,通過并行處理加快處理速度。Hadoop還是可伸縮的,能夠處理PB級數(shù)據(jù)。此外,Hadoop依賴于社區(qū)服務(wù)器,因此它的成本比較低,任何人都可以使用。
Hadoop是一個能夠讓用戶輕松架構(gòu)和使用的分布式計算平臺。用戶可以輕松地在Hadoop上開發(fā)和運行處理海量數(shù)據(jù)的應(yīng)用程序。它主要有以下幾個優(yōu)點:
高可靠性。Hadoop按位存儲和處理數(shù)據(jù)的能力值得人們信賴。
高擴展性。Hadoop是在可用的計算機集簇間分配數(shù)據(jù)并完成計算任務(wù)的,這些集簇可以方便地擴展到數(shù)以千計的節(jié)點中。
高效性。Hadoop能夠在節(jié)點之間動態(tài)地移動數(shù)據(jù),并保證各個節(jié)點的動態(tài)平衡,因此處理速度非常快。
高容錯性。Hadoop能夠自動保存數(shù)據(jù)的多個副本,并且能夠自動將失敗的任務(wù)重新分配。
Hadoop帶有用Java語言編寫的框架,因此運行在Linux生產(chǎn)平臺上是非常理想的。Hadoop上的應(yīng)用程序也可以使用其他語言編寫,比如C++。
HPCC
HPCC,High Performance Computing and Communications(高性能計算與通信)的縮寫。1993年,由美國科學(xué)、工程、技術(shù)聯(lián)邦協(xié)調(diào)理事會向國會提交了“重大挑戰(zhàn)項目:高性能計算與通信”的報告,也就是被稱為HPCC計劃的報告,即美國總統(tǒng)科學(xué)戰(zhàn)略項目,其目的是通過加強研究與開發(fā)解決一批重要的科學(xué)與技術(shù)挑戰(zhàn)問題。HPCC是美國實施信息高速公路而上實施的計劃,該計劃的實施將耗資百億美元,其主要目標(biāo)要達(dá)到:開發(fā)可擴展的計算系統(tǒng)及相關(guān)軟件,以支持太位級網(wǎng)絡(luò)傳輸性能,開發(fā)千兆比特網(wǎng)絡(luò)技術(shù),擴展研究和教育機構(gòu)及網(wǎng)絡(luò)連接能力。
該項目主要由五部分組成:
高性能計算機系統(tǒng)(HPCS),內(nèi)容包括今后幾代計算機系統(tǒng)的研究、系統(tǒng)設(shè)計工具、先進(jìn)的典型系統(tǒng)及原有系統(tǒng)的評價等;
先進(jìn)軟件技術(shù)與算法(ASTA),內(nèi)容有巨大挑戰(zhàn)問題的軟件支撐、新算法設(shè)計、軟件分支與工具、計算計算及高性能計算研究中心等;
國家科研與教育網(wǎng)格(NREN),內(nèi)容有中接站及10億位級傳輸?shù)难芯颗c開發(fā);
基本研究與人類資源(BRHR),內(nèi)容有基礎(chǔ)研究、培訓(xùn)、教育及課程教材,被設(shè)計通過獎勵調(diào)查者-開始的,長期的調(diào)查在可升級的高性能計算中來增加創(chuàng)新意識流,通過提高教育和高性能的計算訓(xùn)練和通信來加大熟練的和訓(xùn)練有素的人員的聯(lián)營,和來提供必需的基礎(chǔ)架構(gòu)來支持這些調(diào)查和研究活動;
信息基礎(chǔ)結(jié)構(gòu)技術(shù)和應(yīng)用(IITA ),目的在于保證美國在先進(jìn)信息技術(shù)開發(fā)方面的領(lǐng)先地位。
Storm
Storm是自由的開源軟件,一個分布式的、容錯的實時計算系統(tǒng)。Storm可以非常可靠的處理龐大的數(shù)據(jù)流,用于處理Hadoop的批量數(shù)據(jù)。Storm很簡單,支持許多種編程語言,使用起來非常有趣。Storm由Twitter開源而來,其它知名的應(yīng)用企業(yè)包括Groupon、淘寶、支付寶、阿里巴巴、樂元素、Admaster等等。
Storm有許多應(yīng)用領(lǐng)域:實時分析、在線機器學(xué)習(xí)、不停頓的計算、分布式RPC(遠(yuǎn)過程調(diào)用協(xié)議,一種通過網(wǎng)絡(luò)從遠(yuǎn)程計算機程序上請求服務(wù))、ETL(Extraction-Transformation-Loading的縮寫,即數(shù)據(jù)抽取、轉(zhuǎn)換和加載)等等。Storm的處理速度驚人:經(jīng)測試,每個節(jié)點每秒鐘可以處理100萬個數(shù)據(jù)元組。Storm是可擴展、容錯,很容易設(shè)置和操作。
Apache Drill
為了幫助企業(yè)用戶尋找更為有效、加快Hadoop數(shù)據(jù)查詢的方法,Apache軟件基金會近日發(fā)起了一項名為“Drill”的開源項目。Apache Drill實現(xiàn)了Google's Dremel。
相關(guān)新聞:
- 月入6000還缺人?大數(shù)據(jù)統(tǒng)計:物流業(yè)人才成今年最
- 沱沱工社許良:利用大數(shù)據(jù)手段增強網(wǎng)絡(luò)誠信透明
- 大數(shù)據(jù)時代如何升級電商供應(yīng)鏈管理
- 大數(shù)據(jù)作支撐 智能物流迎加速發(fā)展
- 國家郵政局公布5月郵政行業(yè)運行大數(shù)據(jù) 你想到
- 2015全國物流運行大數(shù)據(jù)發(fā)布 這幾個數(shù)字對你
- 馬化騰、李彥宏、劉強東......大數(shù)據(jù)峰會他們
- 李克強:信息產(chǎn)業(yè)、大數(shù)據(jù)、電子商務(wù)等新經(jīng)濟給
- 4月郵政業(yè)消費者申訴大數(shù)據(jù)公布:為消費者挽回
- 一圖看懂未來5年大數(shù)據(jù)市場
0條評論
網(wǎng)友評論推薦資訊
全國預(yù)制菜品牌供應(yīng)鏈與冷鏈服
- 國家郵政局:上半年快遞業(yè)務(wù)收入完成6530億元,
- 國家發(fā)展改革委發(fā)布2024年國家骨干冷鏈物流
- 商務(wù)部外貿(mào)司負(fù)責(zé)人解讀《關(guān)于拓展跨境電商
- 以責(zé)任落實筑牢交通運輸安全防線
- 2024年端午假期全國郵政快遞業(yè)攬投快遞包裹2
- 交通運輸領(lǐng)域七大行動促進(jìn)大規(guī)模設(shè)備更新
- 中國商業(yè)聯(lián)合會發(fā)布商貿(mào)流通領(lǐng)域提升支付便
- 2024年度農(nóng)產(chǎn)品骨干冷鏈物流重點縣(重點市)建
- 中歐班列累計開行9萬列
- 關(guān)于舉辦“全國預(yù)制菜品牌供應(yīng)鏈與冷鏈服務(wù)
熱門點擊排行
- ·物流企業(yè)數(shù)字化轉(zhuǎn)型:精準(zhǔn)匹配人車貨 技術(shù)創(chuàng)
- ·我國智能航運發(fā)展迅速 相繼突破航行關(guān)鍵核
- ·中共二十屆三中全會公報:健全提升產(chǎn)業(yè)鏈供應(yīng)
- ·商務(wù)部財務(wù)司負(fù)責(zé)人解讀《關(guān)于加強商務(wù)和金
- ·財經(jīng)觀察:貨物貿(mào)易創(chuàng)歷史同期新高 增長動能
- ·天津印發(fā)方案打造世界一流自由貿(mào)易園
- ·新疆加快建設(shè)烏魯木齊國際航空樞紐
- ·黑龍江辦理運輸企業(yè)“一件事”許可超四千件
- ·交通運輸行業(yè)壓實責(zé)任強化巡查排險
- ·深中通道車流量超200萬輛次