|
公司基本資料信息
|
(1)采集
大數(shù)據(jù)的采集是指利用多個(gè)數(shù)據(jù)庫(kù)來(lái)接收發(fā)自客戶端(Web、App或者傳感器形式等)的數(shù)據(jù),并且用戶可以通過(guò)這些數(shù)據(jù)庫(kù)來(lái)進(jìn)行簡(jiǎn)單的查詢和處理工作。比如,電商會(huì)使用傳統(tǒng)的關(guān)系型數(shù)據(jù)庫(kù)MySQL和Oracle等來(lái)存儲(chǔ)每一筆事務(wù)數(shù)據(jù),除此之外,Redis和MongoDB這樣的NoSQL數(shù)據(jù)庫(kù)也常用于數(shù)據(jù)的采集。
(2)導(dǎo)入/預(yù)處理
雖然采集端本身會(huì)有很多數(shù)據(jù)庫(kù),但是如果要對(duì)這些海量數(shù)據(jù)進(jìn)行有效的分析,還是應(yīng)該將這些來(lái)自前端的數(shù)據(jù)導(dǎo)入到一個(gè)集中的大型分布式數(shù)據(jù)庫(kù),或者分布式存儲(chǔ)集群,并且可以在導(dǎo)入基礎(chǔ)上做一些簡(jiǎn)單的清洗和預(yù)處理工作。也有一些用戶會(huì)在導(dǎo)入時(shí)使用來(lái)自Twitter的Storm來(lái)對(duì)數(shù)據(jù)進(jìn)行流式計(jì)算,來(lái)滿足部分業(yè)務(wù)的實(shí)時(shí)計(jì)算需求。
導(dǎo)入與預(yù)處理過(guò)程的特點(diǎn)和挑戰(zhàn)主要是導(dǎo)入的數(shù)據(jù)量大,每秒鐘的導(dǎo)入量經(jīng)常會(huì)達(dá)到百兆,甚至千兆級(jí)別。
(3)統(tǒng)計(jì)/分析
統(tǒng)計(jì)與分析主要利用分布式數(shù)據(jù)庫(kù),或者分布式計(jì)算集群來(lái)對(duì)存儲(chǔ)于其內(nèi)的海量數(shù)據(jù)進(jìn)行普通的分析和分類匯總等,以滿足大多數(shù)常見的分析需求,在這方面,一些實(shí)時(shí)性需求會(huì)用到EMC的GreenPlum、Oracle的Exadata,以及基于MySQL的列式存儲(chǔ)Infobright等,而一些批處理,或者基于半結(jié)構(gòu)化數(shù)據(jù)的需求可以使用Hadoop。
統(tǒng)計(jì)與分析這部分的主要特點(diǎn)和挑戰(zhàn)是分析涉及的數(shù)據(jù)量大,其對(duì)系統(tǒng)資源,特別是I/O會(huì)有極大的占用。
(4)挖掘
與前面統(tǒng)計(jì)和分析過(guò)程不同的是,數(shù)據(jù)挖掘一般沒有什么預(yù)先設(shè)定好的主題,主要是在現(xiàn)有數(shù)據(jù)上面進(jìn)行基于各種算法的計(jì)算,從而起到預(yù)測(cè)(Predict)的效果,從而實(shí)現(xiàn)一些高層級(jí)數(shù)據(jù)分析的需求。比較典型算法有用于聚類的Kmeans、用于統(tǒng)計(jì)學(xué)習(xí)的SVM和用于分類的NaiveBayes,主要使用的工具有Hadoop的Mahout等。
房產(chǎn)測(cè)繪檔案管理不同于一般意義上的檔案管理,涉及開發(fā)企業(yè)和房屋業(yè)主個(gè)人隱私及信息安全。盡管房產(chǎn)測(cè)繪檔案數(shù)字化管理是社會(huì)和經(jīng)濟(jì)發(fā)展的必然要求,但必須注意到,在推動(dòng)實(shí)現(xiàn)房產(chǎn)測(cè)繪檔案數(shù)字化管理過(guò)程中還存在許多急需解決的問題。
(一)房產(chǎn)測(cè)繪檔案信息的保密性和安全性無(wú)法保證
在電子文檔給人們生活、學(xué)習(xí)、工作、管理帶來(lái)快捷、靈活、存儲(chǔ)量大、易于傳輸、便于保管和修改等優(yōu)點(diǎn)的同時(shí),也帶來(lái)不利于房產(chǎn)測(cè)繪檔案信息安全保密等不利因素。如:病毒侵害、數(shù)據(jù)丟失、信息泄密、人為破壞等。
(二)房產(chǎn)測(cè)繪檔案信息系統(tǒng)缺乏通用性和科學(xué)性
國(guó)家沒有形成統(tǒng)一的房產(chǎn)測(cè)繪檔案管理信息系統(tǒng),各地甚至各部門都在研究開發(fā)適合本地區(qū)本部門的信息系統(tǒng)。由于層次、標(biāo)準(zhǔn)各不相同,使得系統(tǒng)的通用性較差,基礎(chǔ)數(shù)據(jù)難以交換、難以共享,不能適應(yīng)房產(chǎn)測(cè)繪檔案信息資源共享的基本要求。
智慧檔案館
智慧檔案館借助物聯(lián)網(wǎng)技術(shù)建立智能化檔案信息服務(wù)平臺(tái),對(duì)檔案實(shí)體信息和檔案內(nèi)容信息進(jìn)行智能化識(shí)別、定位、跟蹤監(jiān)控和管理,智慧檔案館中的環(huán)境管理控制是基于物聯(lián)網(wǎng)技術(shù)構(gòu)建的,通過(guò)傳感器的感知能力,實(shí)現(xiàn)對(duì)檔案實(shí)體周圍的溫濕度、光線等信息的傳感。智慧檔案館是是智能的、更是簡(jiǎn)單的,用戶不用花很長(zhǎng)的時(shí)間去查找、借閱檔案,就可以輕松獲取檔案信息,檔案環(huán)境可輕松實(shí)現(xiàn)智能化控制,檔案管理人員也擺脫了復(fù)雜的檔案借、還、盤點(diǎn)、查詢等流程。