数据预处理是我们在拿到数据之后,真正使用之前的非常重要的一个环节。我们在对数据进行处理时往往非常注重方法论,对于数据本身问题的不重视导致最后的处理结果准确性较差,甚至根本无法使用。
数据审核说白了就是检查数据是否存在问题,主要是检查完整性和准确性。检查完整性,即检查需数据的各项是否齐全存,准确性则是查看数据是否存在异常值,对于异常值我们要多注意一下,关注一下异常值产生生的原因是采集方式导致的还是数据本身的原因。 在进行检查之前我们可以关注一下数据的来源,数据采集的方式有助于我们检查数据。我之前在国内一家超大型的国企工作,近两年在做数字化,虽然对于数据存储这一块还算是比较重视保存了大量的数据,但是由于实际产生数据的是业务人员并非我们计算机技术人员,所以业务员工有时应付式的、完成任务式的操作,随意填写数据,一些数据不填写都是时常发生的。这样便导致数据不准确。
在数据审核之后,我脉门对数据进行一些查漏补缺,纠正。但是由于我们收集数据大都是秉着尽可能多的采集的思想,所以难免会出现一些错误的、不符合要求的数据,这个时候我们就要把这类数据给过滤掉。而对于一些符合特定条件的数据我们要进行提取。
数据排序就是对数据以某种规则进行排序,以便我们方便发现数据中的特征,趋势等,有的时候对数据进行排序本身就是一种业务需求。对于分类型数据我们常见的排序方法有按英文字母升降排序,按汉语拼音升降排序,按笔画升降排序等,对于数值型则只有升序降序排序两种。
数据经过预处理之后,我们需要对数据进行进一步的整理首先要弄清楚数据的类型。因为不同的类型的数据我们进行的处理方式也有所不同。数据按照所采用的计量尺度不同分为:品质型数据和数值型数据。其中品质数据又分为分类数据和顺序数据。 品质类型数据描述的是事物本身的品质特征,如胖瘦,高矮等通常用文字进行描述,也可以用数字代表每个类别。数值型数据描述的事物的某些数值特征,如身高、体重等用数值来表述。 品质数据主要的进行分类处理,而数值类型数据主要是进行分组。
分类数据本身就是对事物的一种分类,因此整理的时候首先先列出各个分类,然后计算出一类的频数,频率等指标。即可形成一张频数分布表,然后选择适当的图形进行展示。
表 1-1 顾客地区及性别与购买产品类型 表 1-2 不同地区顾客的性别频数分布表 表 1-3 顾客性别与销售产品类型交叉频率分布表 图形的选择 (1)条形图。 条形图是用宽度相同的条形的高度或者长短来表示数据多少的图形。
图1-1客户性别条形图
图1-2地区条形图 (2)帕累托图 是按频数数值排序后的条形图,通过排序更直观的能看出数据的特征。在这里就不给予展示。 (3)饼图。
饼图是用圆形以及圆内扇形的角度来表示数值大小的图形,它主要用于表示一个样本(或总体)中个组成部分的数据占全部数据的比例,对于研究结构性问题十分有用
图1-3不同地区构成的饼图
对于顺序数据来说,与绝大多数分类数据的整理与展示方式相同,但是有些方法只适用于顺序数据并不适用于顺序数据,因为顺序数据分类之间存在顺序所以,还可以计算累计频数与累计频率。
品质数据的处理方式大都使用数值型的数据,但是很多处理方式只适用于数值型数据
1 数据分组 数组租是根据统计研究的需要,将原数据按某种标准分成不同的组别其主要的目的就是观察数据的分布特征,分组后再计算各组中的频数就行程了一张频数分布表,分组的方式一般有两种,单变量值分组,通常适用于离散变量或者变量较少的情况,使用较少。在连续变量或变量较多的情况下,通常使用组距分组这里重点介绍一下组距分组,第一步先确定组数,组数太多数据过于分散,组数太少分布又过于集中不能很好的观察数据特征一般组数在五组到十五组之间,可以根据具体的业务情况而定。第二步确定组距,组距=(最大值-最小值)/组数
某公司一个月的销售额(单位台) 销售额的分组的频数频率表 组距分组掩盖了各组之间数据的分布情况,为反应各个组数据的一般水平,通常用组中值为该组数据的代表,组中值=(组上线+组下限)/2.采用组中值作为组数据代表有一个前提,就是要求以组中值为中心点呈现均匀分布,否则就会出现一定的误差
2 数据展示 2.1分组数据:直方图。直方图是用于展示分组数据分布的一种图形,是用矩形的宽度和高度(面积)来表示频数分布的。直方图看起来和条形图很像,但是还是有很多不同之处。首先,条形图的矩形宽度是固定的并没有实际的意义,是用矩形的长度表示频数,但是直方图是用矩形的面积来表示频数,高度和宽度都有意义。其次那组数据是具有连续性的,直方图的矩形通常是连续排列,条形图每个矩形是没有这种连续性联系的。最后则是条形图主要用于展示分类数据,直方图用于展示数值型的数据。
某公司销售量分布直方图 2.2 未分组数据:茎叶图和箱线图 茎叶图 是反映原始数据分布的图形,图形是由数字组成的,通过茎叶图可以看出数据的分布形状他与直方图最大的区别是茎叶图保留了每一个原始数值,保留了原始数据的信息,直方图虽然能按时数据的分布但是不能保留原始数值。在小批量数据展示时通常选择茎叶图,大量数据时则会选择直方图。 茎叶图的制作,首先设计树茎,通常把数字分为两个部分,高位数作为树茎,叶子上保留最后一位,如36分为3|6,123分为12|3。
甲乙社区抽样年龄调查茎叶图 箱线图 箱线图是根据一组数据的最大值、最小值、中位数、两个四分位数这五个也正值绘制而成,主要反映原始数据的分布特征,还可以进行多组数据的分布比较。 某公司入职评分箱线图 2.3 时间序列数据:线图 如果数值类型数据是在不同时间采集的,即时间序列数据,则可以绘制线图。线图主要用于反映数据随时间变化的特征 2.4 多变量数据 散点图 气泡图 雷达图 以上都是数据都是单变量,当有两个或两个以上的变量时,可以采用多变量的图示方法,这里主要介绍三个,散点图、气泡图、雷达图
散点图。用二维坐标展示两个变量之间关系的一种图形,x轴代表一个变量,y轴代表一个变量 气泡图。气泡图可用于三个变量之间的关系,类似于散点图,但第三个变量用起泡大小爱展示一个变量的数值大小 雷达图 雷达图是显示多变量的常用图示方法,也叫蜘蛛图。要绘绘制n个变量的雷达图,首先画一个圆,然后将圆等分,得到n个点,n个点分别对应n个变量,再将这n个点与圆心连线,得到n个辐射状的半径,这n个半径分别作为n个变量的坐标轴,每个变量值的大小由半径上的店到圆心的距离表示,再将同意样本的值在n个坐标上的点连线。这样,n个样本形成的n个多边形就是一张雷达图
某产品评价调查雷达图
下图总结了数据的类型与主要图示方法
