《大数据的介绍及案例分享》由会员分享,可在线阅读,更多相关《大数据的介绍及案例分享(25页珍藏版)》请在维思文库上搜索。
1、大数据大数据的概念大数据(Big Data)是指“无法用现有的软件工具提取、存储、搜索、共享、分析和处理的海量的、复杂的数据集合。网络上每一笔搜索,网站上每一笔交易、每一笔输入都是数据,通过计算机做筛选、整理、分析,所得出的结果可不仅仅只得到简单、客观的结论,更能用于帮助企业经营决策,搜集起来的数据还可以被规划,引导开发更大的消费力量。大数据与传统数据的区别?银行做数据业务做了十多年,那么大数据和传统数据的仓库有哪些差异?实际上就是群体和个体的差异。互联网数据完全瞄向个体,数据结构也是精准于个体,而传统的数据面向经营指标、面向群体。宏观意义上来看,假如小明去了一百次书店,以前要回答的问题是他第
2、一百零一次买不买书,即业绩和经营指标的问题;而现在,互联网关心的是什么?最关心的是他第一百零一次买什么书,需要将什么样的内容推荐给他。这不是一个概率问题,而是一个模糊的程度问题。要量化这个程度,我们一定要基于个体,而不是基于群体的共性描述。传统定义上,更多关注的是一类人群,用同一类规则制订套餐给他们;而在互联网时代,要把每个人都精准刻画出来,进行精准匹配。有电商说他们要做到一百万用户要有一百万个商店,特别是在移动的小屏幕上,三次点击以后就会损失一个客户。所以差异化绝对不可能是对群体共性的描述,而完全是对个体差异的刻画。关于大数据的深度分析,很重要内容就是个性化的信息推荐。个性化的信息推荐不仅仅
3、是基于用户的相似性这么简单的东西,还有大量比较深入的复杂模型。比如说,就用户看资讯而言,我们怎么样去判断一个用户点开一条八卦资讯后,是继续深挖八卦到死,还是转而浏览另外一个新闻。同样,有的用户登陆淘宝只是逛逛而已,有些用户则是很明确地想要买一些东西,这就需要对用户的意图进行预测,这里面涉及到一些比较难的机器学习技术。我们现在生活的是信息化的世界,未来会走向个性化。在这一点上有一个例子,耐克制作了一款鞋子,在这个鞋子里装上了传感器,然后穿上这个鞋子的人,你一天大概走多少路,而且你走路的状态比如着力点等相关情况的数据都会通过传感器传到耐克公司,耐克公司就会根据这些数据来给你量身定做鞋子。这样,未来
4、的销售模式将会是个性化的。大数据的典型特征(3V)“大数据”这个词,光从字面来看,可能会让人觉得只是容量非常大的数据集合而已。但是,容量只不过是大数据特征的一个方面,如果只拘泥于数据量的话,就无法深入理解当前围绕大数据所进行的讨论。因为“用现有的一般技术难以管理”这样的状况,并不仅仅是由于数据量增大这一个因素所造成的。大数据的特征,可以用三个V开头的关键词来描述。(1)Volume(容量)看到大数据这个词,大多数人的第一印象恐怕就是Volume,也就是数据量吧。从刚才我们讲到的大数据的定义来看,也就是指用现有技术无法管理的数据量,从现状来看,基本上是指从几十TB到几PB这样的数量级。当然,随着
5、技术的进步,这个数值也会不断变化。例如,在5年以后,也许只有几EB数量级的数据量才能够称得上是大数据了。截至目前,人类生产的所有印刷材料的数据量是200PB(1PB=210TB),而历史上全人类说过的所有的话的数据量大约是5EB(1EB=210PB)。当前,典型个人计算机硬盘的容量为TB量级,而一些大企业的数据量已经接近EB量级。(2)Variety(多样性)除了传统的销售、库存等数据,现在企业所采集和分析的数据还包括像网站日志数据、呼叫中心通话记录、Twitter和Facebook等社交媒体中的文本数据、智能手机中内置的GPS(全球定位系统)所产生的位置信息、时刻生成的传感器数据,甚至还有图
6、片和视频,数据的种类和几年前相比已经有了大幅度的增加。其中,近年来爆发式增长的一些数据,如互联网上的文本数据、位置信息、传感器数据、视频等,用企业中主流的关系型数据库是很难存储的,它们都属于非结构化数据。当然,在这些种类的数据中,也有一些是过去就一直存在并保存下来的。然而,和过去不同的是,这些大数据并非只是存储起来就够了,还需要对其进行分析,并从中获得有用的信息。以美国企业为代表的众多企业正在致力于这方面的研究。监控摄像机的视频数据正是其中之一。近年来,超市、便利店等零售企业几乎都配备了监控摄像机,目的是为了防止盗窃和帮助抓捕盗窃嫌犯,但最近也出现了使用监控摄像机的视频数据来分析顾客购买行为的案例。例如,美国大型折扣店Family Dollar Stores,以及高级文具制造商万宝龙(Montblanc),都开始尝试利用监控摄像头对顾客在店内的行为进行分析。以万宝龙为例,它们过去都是凭经验和直觉来决定商品陈列的布局,但通过分析监控摄像机的数据,将最想卖出去的商品移动到最容易吸引顾客目光的位置,