当前位置：首页 > 科技 > 正文

Excel数据分析篇：如何用Excel做一次完整的数据分析

启示号
科技
9小时前
318

今天这篇讲实操，教大家用Excel做一次简单的分析。一是让大家了解资料分析是一个怎样的流程；其次熟练Excel的操作(学的知识要利用起来)，包括公式，数据透视表等。

这里我用Python在智联招聘上爬取了约1800条的BI工程师的职位信息，并且将岗位名称、公司名称、薪水、所在城市、所属行业、学历要求、工作年限这些关键信息用CSV文件保存下来。

操作版本：Excel 2016 ，WIN 10

一个完整的数据分析都需要经历这样几个步骤：

§ 数据采集 — — 这里我已经用Python爬好了；

§ 明确分析目的 — — 你拿这数据要得到什么信息，解决什么问题；

§ 观察资料 — — 各个数据字段的含义，中英文释义；

§ 数据清洗 — — 无效值、缺失值、重复值处理，数据结构是否一致等；

§ 分析过程 — — 围绕目的展开分析；

§ 制作可视化 — — 做图表做可视化报告。

一、明确目的

数据分析的大忌是不知道分析的方向和目的，拿着一堆数据不知所措。数据用来解决什么问题？

是进行汇总统计制作成报表？

是进行数据可视化，作为一张信息图？

是验证某一类业务假设？

是希望提高某一个指标的KPI？

要知道一切数据分析都是以业务为核心目的，所以要找到业务问题的思考点。关于找到问题的切入点，之前资料分析思维篇讲过。永远不要妄图在一堆数据中找结论，目标在前，数据在后，哪怕是把数据做个平均值比较，也比没有方向好。每一步尝试都会引发进一步思考，比如为什么这个值这么低，原因在哪里，这个差异波动有何规律……

所以，分析前不妨先来看一下我们爬的数据：

假设我是一个BI工程师，我想知道：

目前BI工程师的平均薪资水平如何，薪资的区间分布如何

各地区对BI工程师的需求量是多少，哪些地区设岗最多。

不同年限的BI工程师薪资差异如何，3年后我差不多是什么样的价位？

薪水较高的公司有哪些？

带着这样的问题，那我们的分析就有了方向，后续则是将目标拆解为实际分析展示的过程。

二、了解资料概况

拿到数据肯定是要先看一下的，你想要的数据全不全，拿到的数据有哪些可分析之处。主要就是看数据字段，要了解数据字段的含义：

JobName — — 岗位名称

Company — — 公司名

Salary — — 薪水

City — — 城市

Jobtype — — 岗位领域

Edulevel — — 学历要求

WorkingExp — — 工作年限要求

三、数据清洗

接下来进行数据清洗。数据清洗一般包括无效值、缺失值、重复值处理；资料是否有乱码，错位现象；资料口径问题，两张表的关联ID名是否一致；还有是否有统一的标准或命名，如公司名全写或缩写的区分。数据转换则是将数据规整为统一格式处理。因为这是只是Excel级别的数据分析，且就一张简单的数据表，不会有太多复杂的操作。这里简单总结下。

1、有无缺失值

数据的缺失会很大程度影响分析结果。资料缺失的原因很多，比如数据采集的时候，因为技术的原因，爬虫没有完全抓去。但工作上更多的原因是资料入库的时候就没有收集全，有没填有遗漏，这又是数据规范数据治理的话题了。一般来说，如果某一字段数据缺失超过40%~50%，就没有分析意义了，考虑删除或作其他措施。

看数据有没有缺失，只要在Excel中选中该列看计数。

这里，eduLevel有缺失（1759/1800）但不多，不影响实际分析。

2、脏数据处理

发现jobName列里面有一些类似BIM工程师的岗位信息，这些应该都是土木行业的工程师，爬去时没做过滤，还有包含“bim”“BIOS””BIW”等字段。

因为包含多重过滤，这里我建立辅助列，设立判断条件，然后进行筛选过滤。

=IF(OR(COUNTIF(A5,”*”&{“bim”,”BIM”,”BIOS”,”BIW”}&”*”)),1,”0")

公式的意思是，如果含有这些字段中的任何一个则为1，否则为0。这里我们需要筛选出结果为0的数据，总计筛选下来600多条，数据还是很脏的。

多重筛选，还可以用数据选项卡里的高级筛选功能，就不掩饰了。

3、重复数据

重复数据一般对唯一标识字段来处理，比如用户ID，订单ID，公司ID这些，这些字段都代表这一行数据是唯一存在的。严格来讲，这里的表应该存在公司ID这一字段，爬取数据的问题，我这就懒得再重爬了，就对Company字段做重复值处理。

这里有一个快速窍门，使用Excel的删除重复项功能，快速定位是否有重复数据。对company列进行重复项删除操作：

只剩下562个值了。到此，一些脏数据基本清理的差不多了。

最后，salary有一些数据是“薪资面议”，“校招”的，这里也一并过滤掉。Jobtype过滤掉汽车、电子等行业，只留包含IT互联网行业，最后剩下不到500条数据。

4、数据再加工

一者是salary薪水用了几K表示，这是文本，不能直接用于计算。而且还是一个范围，后续得按照最高薪水和最低薪水拆成两列。

二者由于城市字段存储有的数据为“城市-区域”格式，例如“上海-徐汇区”，为了方便分析每个城市的数据，最后新增列“城市”，截取“-”前面的真实城市数据。

为了方便整理，和原数据区分，也防止原数据丢失，这里把之前处理的数据复制粘贴到另一张表里。

① 薪水处理

将salary拆成最高薪水和最低薪水有三种办法。

一是直接分列，以”-”为拆分符，得到两列数据，然后利用替换功能删除 k这个字符串。得到结果。

二是自动填充功能，填写已填写的内容自动计算填充所有列。

三是利用文本查找，重点讲一下这个。

写公式的思路是，先查找第一个K出现的位置，然后再-1，去除掉K。所以公式是：

=LEFT(C2,FIND(“K”,C2,1)-1)

同样的思路，最高薪水需要利用find查找”-”位置,然后截取从”-” 到最后第二个位置的字符串。

=MID(C2,FIND(“-”,C2,1)+1,LEN(C2)-FIND(“-”,C2,1)-1)

这里，在新增数据列，平均薪水，来近似代表实际的准确薪资。平均薪水=(薪水下限+薪水上限)/2，即可得到每个岗位的平均薪水。

②真实城市截取

由于城市字段存储有的数据为“城市-区域”格式，例如“上海-徐汇区”，为了方便分析每个城市的数据，最后新增列“城市”，截取“-”前面的真实城市数据。

=IF(COUNTIF(G2,”*-*”)=0,G2,LEFT(G2,FIND(“-”,G2,1)-1))

至此，所有数据清洗加工完毕，食材已经全部准备好，下面可以正式开始数据可视化的美食下锅烹饪了。

四、分析过程

分析过程有很多玩法，因为这里主要数据均是文本格式，资料又很简单，所以偏向汇总统计的计算。如果数值型的资料比较多，就会涉及到统计、比例等概念。如果有时间类数据，那么还会有趋势、变化的概念。

整体分析使用数据透视表完成，先利用数据透视表获得汇总型统计。

1、BI工程师需求概况分析

这里我简单加了一下增材区分，增加数据大小的辨识度。（条件格式 — — 色阶）

看来北上广深的BI工程师岗位远多于其他城市，成都杭州武汉梯队次之。1~3年以及3~5年经验的缺口相当。

2、BI工程薪资情况分析

各经验年龄的平均薪资状况，差距梯度还是很明显的。

目前市面上BI工程的薪资主要分许在7~17K左右区间。23~26K，应该是5~10年左右经验的岗位也相当。

3、薪资变化随着经验的增长，学历影响力的大小

整体来说，BI工程师大专和本科的薪资差异并不是很大，3~5年经验，本科稍占优势。到5~10年，基本拉平，也就是说学历因素影响比重更弱，这时候更看重经验。

其他的分析过程就不多做赘述了，主要是使用数据透视表和数据透视图进行多维度（城市，学历，工作经验）的分析，没有其他复杂的技巧。

关于资料透视图和数据透视表。选中所要分析的数据列，2013版以上的Excel基本上都很智能的帮你推荐图标，生成透视接口，只要分清楚拖拽的字段事到列，到值还是到行即可。然后视情况多数据做一定筛选，因为数据清洗得不一定很彻底，我在制作的过程中就忽略了一些字段的空缺值，又回过头做了过滤。

最后

到此，一个简单的数据分析基本结束了。因为资料简单，并没有涉及过多的资料整合，表合并，专业资料统计回归等操作。

整个数据分析过程最费时间的数据清理，大约占据70%，只要明确了目的，可视化分析师很简单的。

其次，也可以看到，用Excel做分析，更多的优势是数据的简单处理。随便过滤、查询、定位救你呢了解数据的概况。但在可视化方面比较鸡肋，行列值选择，以及复杂的图表制作都有一些难度，一句话总结Excel可视化要想做的好看还是要费点时间的。

所以我在分析的时候，基本上就是用Excel看看数据全貌，简单处理下。分析、可视化什么的还是会交给BI。后面，我会再出一篇用BI制作的教程。

你可能想看：

Excel VBA 7.19 Excel跨工作薄多工作表数据合并之Excel表格多行表头

所以我们今天针对多行表头的数据汇总来分析下方法场景模拟假设我们要统计的Excel中每个表格都有表头，1) End If Next sth End If ActiveWorkbook.Close Fal...

如何用Excel2分钟制作一个自动抽奖小程序？

另一个当然是Excel教程---教你两分钟用Excel做出一个超有趣的抽奖小程序。有Excel函数公式视频，用Excel做一个简单的抽奖小程序，教你2分钟用Excel制作出自动抽奖小程序，先来认识几个...

办公小技巧：保护Excel数据重要资料轻松上锁

可以为特定的单元格设置保护密码，确保用户只能查看指定的内容（图1）。建立一个分配给每名员工的打开密码的列表（图2）。当在A2的数据输入符合辅助表中对应的密码字符即C13数值，此时在C2单元格显示辅助表...

办公小技巧：Excel数据列无损合并及灵活组合

我们可以使用连接符或连接函数来进行单元格合并，还可以实现合并内容的灵活组合（如添加自定义间隔符号或其他信息）。1. 用连接运算符与普通标点合并数据列 Excel中的连接符号“还需要与连接符与分隔符、标...

《Excel2003入门动画教程27、Excel拆分表格》

《Excel2003入门动画教程27、Excel拆分表格》。　　演示动画，　　操作步骤，　　有时候在Excel中：们需要比较浏览同一工作表中不同区域的数据时，可以通过折分窗口来实现“　　选中窗口中部的...

Excel 中Alt键的高手用法 Excel必学技巧

即可一键生成柱形图，Alt加Enter（回车键）单元格内强制换行五、Alt加数字键输入符号 (需要在带有小键盘的电脑上操作哦）Alt加41446输入温度符号Alt加41409输入错号Alt加41420...

VS2010操作Excel2010，报错解决及读写excel

加到模块std中:#include "CWorksheet.h";#include "CRange.h":5、将以上头文件的#import "C;\\Program Files\\Microsoft ...

Excel教程：30秒做好Excel超链接目录

工作表前面插入一张空白工作表Sheet。点击右键，查看代码会激活VBE编辑器界面，点击插入——模块，并且复制以下代码到右边编辑区。"选择目录起始单元格",Excel提示我们是否VB项目，选择文件保存类...

财务分析牛人喜欢用EXCEL动态图表，有逼格

不过大家一定要选择红框中的控件，接下来我说一下offset函数的使用，我们先看先看下他的参数的含义OFFSET(起点，2.做一个控件-滚动条，我们直接选中表单控件中第二行第三个，选择设置控件格式，红框...

EXCEL数学和三角函数汇总

ASIN”ATAN，FLOOR。ROUND“SQRT，TRUNC，【参数】number是需要计算其绝对值的一个实数”【用途】返回以弧度表示的参数的反余弦值，【参数】number是某一角度的余弦值=AC...

组织架构图，你还在手动画线么，直接套用Excel的SmartArt

可以快速的完成组织机构图的绘制，我们需要准备我们所有的文本数据，我们插入选项卡下，选择SmartArt，然后选择一个层次结构，点击右边的组织架构图，会弹出一个文本输入框，数据因为没有层次结构，来进行层...

经常自拍的你，会用Excel的照相机吗？

在Excel选项，快速访问工具栏，对于格式不同的表格，一般都采用将文档转换成图片。图片的大小调整比表格排版更方便，如果需要打印最好设置为无边框。就简单的模拟点数据说明，选择比图表大一点的区域。现在就可...

学生成绩的数据分析方法

学生成绩的数据分析方法，分析考试成绩是教师必做的工作之一，分析成绩是掌握学情的主要方式之一，还要分析学生各门学科成绩，一、班级整体的成绩分析。每次考试的分数就是绝对成绩。绝对成绩与试卷难易、学生的基础...

你的数据到底有多重要？这些惊艳的数据可视化案例告诉你 | TED演讲

在本文中他分享了数据背后所蕴含的令人意想不到的重量，今天我想跟大家聊聊两件非常振奋人心的内容，但对苹果公司我不想说太多。没有事物可以像电脑那样改变我们的生活，但我其实也不想聊电脑的事儿。我想聊聊电脑上...

excel怎么把筛选项一次性全部生成新表？

再次、设置公式从总表提取数据至新表；设置表格式后完成生成新表，最后、复制新表生成另一新表。替换公式参数完成另一类筛选，并把栏目的各项数据对应填入数据：设置好日期、品名、单位及数量等表头栏目。按日期顺序...

这5条Excel超牛公式，帮你搞定87%数据查询难题

LiRuiExcel520）微信服务号|跟李锐学Excel（ID：查找引用在工作中的需求太常见了，这篇教程中给大家科普一下工作中适用场景最多的查找引用方法！遇到从一个表格里按条件查找数据，场景演...

复制浏览器数据到excel中时较长数字串会变成科学计数法的解决办法

其他自定义单元格格式样式:mso-number-format:\#\#0\.000":"mm\/dd\/yy":01/03/1998:"d\-mmm\-yyyy"?mso-number-format...

Excel 2016数据透视表与条件格式

Excel2016数据透视表应用大全突出显示数据透视表中的特定数据。图5-40设置条件格式前的数据透视表步骤1选中; 在【背景色】颜色库中选择;图5-43新建格式规则图...

这是Excel中最强大的快捷键！按下它，表格立马自动处理数据！

表格立马帮你自动处理数据！二、转换成超级表格后可以实现哪些操作，将光标移动到表格首行或首列处时。即可快速选中表格的整行或整列，在超级表格的末尾添加新数据时，你可以按tab键跳到下一个单元格中，生成多个...

Excel公式技巧01：使用INDEX函数返回整行或整列

INDEX函数是我们经常使用的函数之一，如果将其行参数或者列参数指定为0（或者忽略）。那么会返回对指定列或行的引用，这里返回的不是单个值。返回数据区域A1:=INDEX(A1：返回数据区域A1，即单元...

excel查找定位：INDEX函数——精确制导导弹

一、认识INDEX函数Index函数：返回特定行列交叉处单元格的值或引用。二、INDEX函数基础用法1.单行、单列中提取数值”只需一个坐标值如果给定的区域是单行或者单列。INDEX通过坐标返回数值”实...

Excel VBA解读（53）：高级筛选——AdvancedFilter方法

我们先使用Excel的录制宏工具录制一段进行高级筛选操作的代码，先在单元格G1中输入标题，选择单元格区域A1”则可以选择整个数据区域“就用不着每次都要选择不同的列表区域了”表明将数据复制到由参数Cop...

拖后腿学徒居然也完成作业，理解RNA-seq数据分析结果

https;###一些常规的设置rm(list=ls())#清空环境变量options(stringsAsFactors=F)##字符不作为因子读入###读取数据。-read.table('GSE10...

电化学测试技术在锂离子电池中的原理、方法步骤、数据分析（CV、EIS、充放电、微分电压/电容、倍率、...

电极材料的比容量和放电平台决定电池的能量密度，而材料或者电池的阻抗决定离子的扩散过程及电池的功率密度。一般通过循环伏安、交流阻抗、充放电等电化学测试技术来研究锂离子电池等电化学储能器件中的电化学反应过...

如何构建一个完整的交易系统

没有给交易者留下任何主观思考的余地。首先需要作出的决策就是买什么品种，在其中某个品种存在趋势的可能性才会比较大。但是一般新手交易者往往会忽视，新手往往大多在单笔交易上投入过大，这往往是新手交易者最关心...

如何破解Excel打开密码？方法很简单！

如何破解Excel打开密码？今天教大家如何简单的破解表格打开密码！在你准备破解密码的时候，建议关闭全部应用软件，因为破解会自动比对密码，Sub crack()Dim i As LongDim File...

Excel如何批量对日期进行依次填充？

我们在使用Excel创建表格的时候会将原来合并单元格中的日期出现很多空白单元格，这个时候就需要进行批量的根据原有日期进行依次的填充，合并的单元格会分开，这就出现了很多空白单元格。点击——定位条件按钮。...

数据资料 BI 分析字段

上一篇
安康“三菜一宴”入选《中国菜一陕菜菜系经典名菜名宴录》

下一篇
行政事业单位收入管理存在的问题

Excel数据分析篇：如何用Excel做一次完整的数据分析

一、明确目的

二、了解资料概况

三、数据清洗

四、分析过程

最后

最新文章

2025十二生肖49码表

八段锦心得：拉筋、意念、气感才是精髓，初学做不到也要了解

2025年澳门49码表

2025年12生肖49码图

养老金计算方法与公式职工交纳养老金的计算方法

澳门生肖号码表历史记录

御定奇门宝鉴【故宫珍藏版】【四】【释气应】

万达飞凡：敢为天下先的O2O开创者

热门文章

欣赏丨世界著名的60幅女人体油画，裸露但不低俗~

小六壬完整解释

小六壬神断口诀大全，掐指一算直断生死！

亲戚关系图（关于中国亲戚称谓）家庭称谓大全，再也不用担心叫错了称呼

珍贵舌诊：脾肾阳虚、虚寒泄泻、胃阴虚的舌苔照，看完记得存！

倪海厦经典配方全集（六）——桂枝汤、大小青龙汤、五苓散等

“四川泸州油纸伞” 的第七代传承人余万伦古法制伞一辈子

5本甜肉的古言宠文推荐，男主个个都是宠妻狂魔～