资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,大数据,大数据引领我们走向数据智能化时代,Big Data,目录,大数据的定义理解,相关技术与应用,机遇与挑战,大数据的定义理解,一,什么是,大数据,Dada大,大数据的构成,1,2,3,大数据的定义理解,大数据的“4V”特征,大数据时代的背景,大数据时代的背景,facebook,社交网络,淘宝、,ebuy,电子商务,微博、,Apps,移动互联,21世纪是数据信息大发展的时代,移动互联、社交网络、电子商务等极大拓展了互联网的边界和应用范围,各种数据正在迅速膨胀并变大。,互联网(社交、搜索、电商)、移动互联网(微博)、物联网(传感器,智慧地球)、车联网、GPS、医学影像、安全监控、金融(银行、股市、保险)、电信(通话、短信)都在疯狂产生着数据。,“大数据”的诞生:,半个世纪以来,随着计算机技术全面融入社会生活,信息爆炸已经积累到了一个开始引发变革的程度。它不仅使世界充斥着比以往更多的信息,而且其增长速度也在加快。信息爆炸的学科如天文学和基因学,创造出了“大数据”这个概念*。如今,这个概念几乎应用到了所有人类智力与发展的领域中。,20世纪90年代,数据仓库之父的Bill Inmon就经常提及Big Data,2011,年5 月,在“云计算相遇大数据”为主题的EMC World 2011 会议中,EMC 抛出了Big Data概念,Big Data名词由来,全球每秒钟发送,2.9 百万,封,电子邮件,一分钟读一篇的话,足够一个人昼夜不息的读5.5 年,每天会有,2.88 万,个小时,的视频上传到Youtube,足够一个人昼夜不息的观看3.3 年,推特上每天发布,5 千万,条,消息,假设10 秒钟浏览一条信息,这些消息足够一个人昼夜不息的浏览16 年,每天亚马逊上将产生,6.3 百万,笔,订单,每个月网民在Facebook 上要花费,7 千亿,分钟,,被移动互联网使用者发送和接收的数据高达,1.3EB,Google 上每天需要处理,24PB,的数据,新的时代,人们从信息的被动接受者变成了主动创造者,大数据时代到来,TB,PB,ZB,EB,大量新数据源的出现则导致了非结构化、半结构化数据爆发式的增长,根据IDC 监测,人类产生的数据量正在呈指数级增长,大约每两年翻一番,这个速度在2020 年之前会继续保持下去。这意味着人类在最近两年产生的数据量相当于之前产生的全部数据量,数据量增加,数据结构日趋复杂,这些由我们创造的信息背后产生的这些数据早已经远远超越了目前人力所能处理的范畴,大数据时代正在来临.,大数据时代到来,大数据的4V特征,“大量化(Volume)、多样化(Variety)、快速化(Velocity)、价值密度低(Value)”就是“大数据”的显著特征,或者说,只有具备这些特点的数据,才是大数据。,体量Volume,多样性,Variety,价值密度Value,速度,Velocity,非结构化数据,的超大规模和增长,总数据量的8090%,比结构化数据增长快10倍到50倍,是传统数据仓库的10倍到50倍,大数据的异构和多样性,很多不同形式(文本、图像、视频、机器数据),无模式或者模式不明显,不连贯的语法或句义,大量的不相关信息,对未来趋势与模式的可预测分析,深度复杂分析(机器学习、人工智能Vs传统商务智能(咨询、报告等),实时分析,而非批量式分析,数据输入、处理与丢弃,立竿见影而非事后见效,大数据的构成,大数据=海量数据+复杂类型的数据,海量交易数据:,企业内部的经营交易信息主要包括联机交易数据和联机分析数据,是结构化的、通过关系数据库进行管理和访问的静态、历史数据。通过这些数据,我们能了解过去发生了什么。,大数据包括:,交易数据和交互数据集在内的所有数据集,海量交互数据:,源于Facebook、Twitter、LinkedIn及其他来源的社交媒体数据构成。它包括了呼叫详细记录CDR、设备和传感器信息、GPS和地理定位映射数据、通过管理文件传输Manage File Transfer协议传送的海量图像文件、Web文本和点击流数据、科学信息、电子邮件等等。可以告诉我们未来会发生什么。,海量数据处理:,大数据的涌现已经催生出了设计用于数据密集型处理的架构。例如具有开放源码、在商品硬件群中运行的Apache Hadoop。,大数,据,据要,解,解决,的,的问,题,题,Volume,海量,的,的数,据,据规,模,模,Variety,多样,的,的数,据,据类,型,型,Streams,Real time,Near time,Batch,TB,PB,EB,Structured,Unstructured,Semi-structured,All the above,Value,Velocity,快速,的,的数,据,据流,转,转,巨大,的,的数,据,据价,值,值,相关技术与应用,二,大数据怎么用,大数,据,据时,代,代的,背,背景,相关,技,技术,云计算与大数据,大数据领的应用,1,2,3,相关,技,技术,相关,技,技术,大数,据,据技,术,术将,被,被设,计,计用,于,于在,成,成本,可,可承,受,受(,economically,)的,条,条件,下,下,,通,通过,非,非常,快,快速,(,(,velocity,)的,采,采集,、,、发,现,现和,分,分析,,,,从,大,大量,化,化(,volumes,)、,多,多类,别,别(,variety,)的,数,数据,中,中提,取,取价,值,值(,value,),,将,将是IT,领,领,域,域新,一,一代,的,的技,术,术与,架,架构,企业用以分析的数据越全面,分析的结果就越接近于真实。大数据分析意味着企业能够从这些新的数据中获取新的洞察力,并将其与已知业务的各个细节相融合,什么,是,是BigData技,术,术,分析,技,技术,:,:,数据,处,处理,:,:自,然,然语,言,言处,理,理技,术,术,统计,和,和分,析,析:A/Btest;topN排,行,行榜,;,;地,域,域占,比,比;,文,文本,情,情感,分,分析,数据挖,掘,掘:关,联,联规则,分,分析;,分,分类;,聚,聚类,模型预,测,测:预,测,测模型,;,;机器,学,学习;,建,建模仿,真,真,大数据,技,技术:,数据采,集,集:ETL工,具,具,数据存,取,取:关,系,系数据,库,库;NoSQL;SQL等,基础架,构,构支持,:,:云存,储,储;分,布,布式文,件,件系统,等,等,计算结,果,果展现,:,:云计,算,算;标,签,签云;,关,关系图,等,等,一些相,关,关技术,存储,结构化,数,数据:,海量数,据,据的查,询,询、统,计,计、更,新,新等操,作,作效率,低,低,非结构,化,化数据,图片、,视,视频、word、pdf、ppt,等,等文件,存,存储,不利于,检,检索、,查,查询和,存,存储,半结构,化,化数据,转换为,结,结构化,存,存储,按照非,结,结构化,存,存储,解决方,案,案:,Hadoop,(,(MapReduce技术,),),流计算,(,(twitter的storm和yahoo!,的,的S4,),),数据采集,数据储存,数据管理,数据分析与挖掘,技术领,域,域的挑,战,战,1,、对现,有,有数据,库,库管理,技,技术的,挑,挑战,传统的,数,数据库,部,部署不,能,能处理,数,数,TB,级别的,数,数据,,也,也不能,很,很好的,支,支持高,级,级别的,数,数据分,析,析。急,速,速膨胀,的,的数据,体,体量即,将,将超越,传,传统数,据,据库的,管,管理能,力,力。,如何构,建,建全球,级,级的分,布,布式数,据,据库,(Globally-DistributedDatabase),,可以,扩,扩展到,数,数百万,的,的机器,,,,数已,百,百计的,数,数据中,心,心,上,万,万亿的,行,行数据,。,。,2,、经典,数,数据库,技,技术并,没,没有考,虑,虑数据,的,的多类,别,别(,variety,),SQL,(结构,化,化数据,查,查询语,言,言),,在,在设计,的,的一开,始,始是没,有,有考虑,非,非结构,化,化数据,的,的。,3,、实时,性,性的技,术,术挑战,:,:,一般而,言,言,像,数,数据仓,库,库系统,、,、,BI,应用,,对,对处理,时,时间的,要,要求并,不,不高。,因,因此这,类,类应用,往,往往运,行,行,1,、,2,天获得,结,结果依,然,然可行,的,的。但,实,实时处,理,理的要,求,求,是,区,区别大,数,数据应,用,用和传,统,统数据,仓,仓库技,术,术、,BI,技术的,关,关键差,别,别之一,。,。,网络架,构,构、数,据,据中心,、,、运维,的,的挑战,:,:,技术架构的,挑,挑战:,人们每天创,建,建的数据量,正,正呈爆炸式,增,增长,但就,数,数据保存来,说,说,我们的,技,技术改进不,大,大,而数据,丢,丢失的可能,性,性却不断增,加,加。,如此庞大的,数,数据量首先,在,在存储上就,会,会是一个非,常,常严重的问,题,题,硬件的,更,更新速度将,是,是大数据发,展,展的基石。,大数据与云,计,计算,云计算的模,式,式是业务模,式,式,本质是,数,数据处理技,术,术。,数据是资产,,,,云为数据,资,资产提供存,储,储、访问和,计,计算。,当前云计算,更,更偏重海量,存,存储和计算,,,,以及提供,的,的云服务,,运,运行云应用,,,,但是缺乏,盘,盘活数据资,产,产的能力,,挖,挖掘价值性,信,信息和预测,性,性分析,为,国,国家、企业,、,、个人提供,决,决策和服务,,,,是大数据,核,核心议题,,也,也是云计算,的,的最终方向,。,。,白云下面数,据,据跑,蓝蓝的天,上,上白云飘,如果数据,是,是财富,,那,那么大数,据,据就是宝,藏,藏,而云,计,计算就是,挖,挖掘和利,用,用宝藏的,利,利器!没,有,有强大的,计,计算能力,,,,数据宝,藏,藏终究是,镜,镜中花;,没,没有大数,据,据的积淀,,,,云计算,也,也只能是,杀,杀鸡用的,宰,宰牛刀!,大数据与,云,云计算,2012,云,云计算,2013,大,大数据?,美国:,美国政府,在,在2012年3月29日宣,布,布投资两,亿,亿美元拉,动,动大数据,相,相关产业,发,发展,将,“,“大数据,战,战略”上,升,升为国家,意,意志。,中国:,中国商业,联,联合会:,副,副会长刘,建,建沪介绍,说,说,随着,互,互联网的,快,快速发展,,,,中国的,电,电子商务,企,企业纷纷,组,组建了数,据,据分析部,门,门。,2011,年,年10月,,,,工信部,确,确认京沪,深,深杭等5,城,城市为“,云,云计算中,心,心”试点,城,城市。而,真,真正的问,题,题或许不,在,在于怎样,建,建设“云,计,计算中心,”,”。国家,信,信息中心,常,常务副主,任,任杜平直,言,言不讳:,“,“应对大,数,数据的到,来,来,需要,不,不断建基,础,础设施,,但,但是建了,干,干什么,,有,有些数据,需,需要存储,,,,也有很,多,多数据可,能,能不需要,储,储存。”,大数据的,市,市场有多,大,大?中央,财,财经大学,中,中国经济,管,管理研究,院,院博士张,永,永力说,,国,国外大数,据,据行业约,有,有1000亿美元,的,的市场,,而,而且每年,都,都以10%的速度,在,在增长,,增,增速是软,件,件行业的,两,两倍。,行业拓展,者,者,打造,大,大数据行,业,业基石:,大数据的,应,应用,企业,在,在投入,IBM:,IBM大,数,数据提供,的,的服务包,括,括数据分,析,析,文本,分,分析,蓝,色,色云杉(,混,混搭供电,合,合作的网,络,络平台);业务事,件,件处理;IBMMashup Center的计量,,,,监测,,和,和商业化,服,服务(MMMS),IBM的,大,大数据产,品,品组合中,的,的最新系,列,列产品的InfoS
展开阅读全文