大數(shù)據(jù)
IT行業(yè)術(shù)語(yǔ)
本詞是多義詞 共6個(gè)含義
大數(shù)據(jù)(big data),或稱(chēng)巨量資料,指的是所涉及的資料量規(guī)模巨大到無(wú)法透過(guò)目前主流軟件工具,在合理時(shí)間內(nèi)達(dá)到擷取、管理、處理、并整理成為幫助企業(yè)經(jīng)營(yíng)決策更積極目的的資訊。[1] 在維克托·邁爾-舍恩伯格及肯尼斯·庫(kù)克耶編寫(xiě)的《大數(shù)據(jù)時(shí)代》 中大數(shù)據(jù)指不用隨機(jī)分析法(抽樣調(diào)查)這樣捷徑,而采用所有數(shù)據(jù)進(jìn)行分析處理。[2]大數(shù)據(jù)歸納有五大特點(diǎn):Volume(大量)、Velocity(高速)、Variety(多樣)、Value(低價(jià)值密度)、Veracity(真實(shí)性)。 中文名大數(shù)據(jù) 外文名big data,mega data 適用領(lǐng)域人工智能,BI,工業(yè)4.0,云計(jì)算,物聯(lián)網(wǎng),互聯(lián)網(wǎng)+ 特點(diǎn)大量、高速、多樣、價(jià)值、真實(shí)性 應(yīng)用學(xué)科計(jì)算機(jī)、信息科學(xué)、統(tǒng)計(jì)學(xué) 提出時(shí)間2008年8月中旬 提出者維克托·邁爾-舍恩伯格[2]、肯尼斯·庫(kù)克耶 定義詳解
大數(shù)據(jù)(big data)是指無(wú)法在一定時(shí)間范圍內(nèi)用常規(guī)軟件工具進(jìn)行捕捉、管理和處理的數(shù)據(jù)集合,是需要新處理模式才能具有更強(qiáng)的決策力、洞察發(fā)現(xiàn)力和流程優(yōu)化能力的海量、高增長(zhǎng)率和多樣化的信息資產(chǎn)。大數(shù)據(jù)有大量(Volume)、高速(Velocity)、多樣(Variety)、低價(jià)值密度(Value)、真實(shí)性(Veracity)五大特點(diǎn)。它并沒(méi)有統(tǒng)計(jì)學(xué)的抽樣方法,只是觀察和追蹤發(fā)生的事情。大數(shù)據(jù)的用法傾向于預(yù)測(cè)分析、用戶行為分析或某些其他高級(jí)數(shù)據(jù)分析方法的使用。 對(duì)于“大數(shù)據(jù)”(Big data)研究機(jī)構(gòu)Gartner給出了這樣的定義?!按髷?shù)據(jù)”是需要新處理模式才能具有更強(qiáng)的決策力、洞察發(fā)現(xiàn)力和流程優(yōu)化能力來(lái)適應(yīng)海量、高增長(zhǎng)率和多樣化的信息資產(chǎn)。 麥肯錫全球研究所給出的定義是:一種規(guī)模大到在獲取、存儲(chǔ)、管理、分析方面大大超出了傳統(tǒng)數(shù)據(jù)庫(kù)軟件工具能力范圍的數(shù)據(jù)集合,具有海量的數(shù)據(jù)規(guī)模、快速的數(shù)據(jù)流轉(zhuǎn)、多樣的數(shù)據(jù)類(lèi)型和價(jià)值密度低四大特征。 大數(shù)據(jù)技術(shù)的戰(zhàn)略意義不在于掌握龐大的數(shù)據(jù)信息,而在于對(duì)這些含有意義的數(shù)據(jù)進(jìn)行專(zhuān)業(yè)化處理。換而言之,如果把大數(shù)據(jù)比作一種產(chǎn)業(yè),那么這種產(chǎn)業(yè)實(shí)現(xiàn)盈利的關(guān)鍵,在于提高對(duì)數(shù)據(jù)的“加工能力”,通過(guò)“加工”實(shí)現(xiàn)數(shù)據(jù)的“增值”。[3] 從技術(shù)上看,大數(shù)據(jù)與云計(jì)算的關(guān)系就像一枚硬幣的正反面一樣密不可分。大數(shù)據(jù)必然無(wú)法用單臺(tái)的計(jì)算機(jī)進(jìn)行處理,必須采用分布式架構(gòu)。它的特色在于對(duì)海量數(shù)據(jù)進(jìn)行分布式數(shù)據(jù)挖掘。但它必須依托云計(jì)算的分布式處理、分布式數(shù)據(jù)庫(kù)和云存儲(chǔ)、虛擬化技術(shù)。 隨著云時(shí)代的來(lái)臨,大數(shù)據(jù)(Big data)也吸引了越來(lái)越多的關(guān)注。分析師團(tuán)隊(duì)認(rèn)為,大數(shù)據(jù)(Big data)通常用來(lái)形容一個(gè)公司創(chuàng)造的大量非結(jié)構(gòu)化數(shù)據(jù)和半結(jié)構(gòu)化數(shù)據(jù),這些數(shù)據(jù)在下載到關(guān)系型數(shù)據(jù)庫(kù)用于分析時(shí)會(huì)花費(fèi)過(guò)多時(shí)間和金錢(qián)。大數(shù)據(jù)分析常和云計(jì)算聯(lián)系到一起,因?yàn)閷?shí)時(shí)的大型數(shù)據(jù)集分析需要像MapReduce一樣的框架來(lái)向數(shù)十、數(shù)百或甚至數(shù)千的電腦分配工作。 大數(shù)據(jù)需要特殊的技術(shù),以有效地處理大量的容忍經(jīng)過(guò)時(shí)間內(nèi)的數(shù)據(jù)。適用于大數(shù)據(jù)的技術(shù),包括大規(guī)模并行處理(MPP)數(shù)據(jù)庫(kù)、數(shù)據(jù)挖掘、分布式文件系統(tǒng)、分布式數(shù)據(jù)庫(kù)、云計(jì)算平臺(tái)、互聯(lián)網(wǎng)和可擴(kuò)展的存儲(chǔ)系統(tǒng)。 最小的基本單位是bit,按順序給出所有單位:bit、Byte、KB、MB、GB、TB、PB、EB、ZB、YB、BB、NB、DB。 它們按照進(jìn)率1024(2的十次方)來(lái)計(jì)算:1 Byte =8 bit,1KB= 1,024 Bytes = 8192 bit,1MB= 1,024 KB = 1,048,576 Bytes,1GB= 1,024 MB = 1,048,576 KB,1TB= 1,024 GB = 1,048,576 MB,1PB= 1,024 TB = 1,048,576 GB,1EB= 1,024 PB = 1,048,576 TB,1ZB= 1,024 EB = 1,048,576 PB,1YB= 1,024 ZB = 1,048,576 EB,1BB= 1,024 YB = 1,048,576 ZB,1NB= 1,024 BB = 1,048,576 YB,1DB= 1,024 NB = 1,048,576 BB 全稱(chēng):,1Bit(比特) =Binary Digit,8Bits= 1 Byte(字節(jié)),1,000 Bytes = 1 Kilobyte,1,000Kilobytes = 1 Megabyte,1,000 Megabytes = 1 Gigabyte,1,000 Gigabytes = 1Terabyte,1,000 Terabytes = 1 Petabyte,1,000 Petabytes = 1 Exabyte,1,000Exabytes = 1 Zettabyte,1,000 Zettabytes = 1Yottabyte,1,000 Yottabytes = 1Brontobyte,1,000 Brontobytes = 1 Geopbyte 特征容量(Volume):數(shù)據(jù)的大小決定所考慮的數(shù)據(jù)的價(jià)值和潛在的信息; 種類(lèi)(Variety):數(shù)據(jù)類(lèi)型的多樣性; 速度(Velocity):指獲得數(shù)據(jù)的速度; 可變性(Variability):妨礙了處理和有效地管理數(shù)據(jù)的過(guò)程。 真實(shí)性(Veracity):數(shù)據(jù)的質(zhì)量 復(fù)雜性(Complexity):數(shù)據(jù)量巨大,來(lái)源多渠道 價(jià)值(value):合理運(yùn)用大數(shù)據(jù),以低成本創(chuàng)造高價(jià)值 結(jié)構(gòu)
其次,想要系統(tǒng)的認(rèn)知大數(shù)據(jù),必須要全面而細(xì)致的分解它,著手從三個(gè)層面來(lái)展開(kāi): 第一層面是理論,理論是認(rèn)知的必經(jīng)途徑,也是被廣泛認(rèn)同和傳播的基線。在這里從大數(shù)據(jù)的特征定義理解行業(yè)對(duì)大數(shù)據(jù)的整體描繪和定性;從對(duì)大數(shù)據(jù)價(jià)值的探討來(lái)深入解析大數(shù)據(jù)的珍貴所在;洞悉大數(shù)據(jù)的發(fā)展趨勢(shì);從大數(shù)據(jù)隱私這個(gè)特別而重要的視角審視人和數(shù)據(jù)之間的長(zhǎng)久博弈。 第二層面是技術(shù),技術(shù)是大數(shù)據(jù)價(jià)值體現(xiàn)的手段和前進(jìn)的基石。在這里分別從云計(jì)算、分布式處理技術(shù)、存儲(chǔ)技術(shù)和感知技術(shù)的發(fā)展來(lái)說(shuō)明大數(shù)據(jù)從采集、處理、存儲(chǔ)到形成結(jié)果的整個(gè)過(guò)程。 第三層面是實(shí)踐,實(shí)踐是大數(shù)據(jù)的最終價(jià)值體現(xiàn)。在這里分別從互聯(lián)網(wǎng)的大數(shù)據(jù),政府的大數(shù)據(jù),企業(yè)的大數(shù)據(jù)和個(gè)人的大數(shù)據(jù)四個(gè)方面來(lái)描繪大數(shù)據(jù)已經(jīng)展現(xiàn)的美好景象及即將實(shí)現(xiàn)的藍(lán)圖。[4] |
|
|
來(lái)自: 新用戶76284912 > 《待分類(lèi)》