离群值是什么意思?请列出一种识别连续变量离群值的方法?
参考答案:
离群值是指样本中的单个值,其值与它们所属的样本的其余观测值显着偏离. 在数学统计中,通常是指一组观测值与平均值的偏差超过两个标准偏差的测量值.
Grubbs检验(以Frank E. Grubbs命名)数据分析师笔试题,也称为最大范数残差检验,是一种统计检验,用于识别单变量数据集中的离群值. 它假定数据集来自具有正态分布的总体.
未知总体标准偏差σ. 在这五种测试方法中,优劣顺序为: t检验,Grubbs检验,峰度检验,Dixon检验和偏度检验.
什么是聚类分析?什么是聚类算法?请选择一种以详细描述其计算原理和步骤.
参考答案:
集群分析是一组统计分析技术,可将研究对象划分为相对同质的集群. 聚类分析也称为分类分析或数字分类法. 聚类和分类之间的区别在于,要被聚类划分的类是未知的.

聚类分析的计算方法主要包括: 分层方法,分区方法,基于密度的方法,基于网格的方法,基于模型的方法等. 其中,前两种算法使用统计定义的距离进行测量.
k-means算法的工作过程描述如下: 首先,从n个数据对象中任意选择k个对象作为初始聚类中心;对于其余的其他对象,根据它们与这些聚类中心的相似性(距离),将它们分配给与它们最相似的聚类(由聚类中心表示);然后计算获得的每个新群集的群集中心(群集中所有对象的平均值);连续重复此过程一直持续到标准测量功能开始收敛. 通常,均方误差用作标准测量函数. k个聚类具有以下特征: 每个聚类本身尽可能紧凑,每个聚类尽可能分离.
过程如下:
(1)从n个数据对象中任意选择k个对象作为初始聚类中心;
(2)根据每个聚类对象的平均值(中心对象)计算每个对象与这些中心对象之间的距离;并根据最小距离重新划分相应的对象;
(3)重新计算每个(变量)聚类的平均值(中心对象);
(4)循环(2),(3),直到每个簇不再变化(标准测量函数收敛).
优点: 由该算法确定的K分区到达平方误差最小. 当聚类密集且类别之间的差异明显时,效果会更好. 对于处理大型数据集,此算法相对可伸缩且高效. 计算复杂度为O(NKt),其中N是数据对象的数量,t是迭代的数量. 一般来说,K <

缺点: 1. K是预先给定的,但是很难选择; 2.初始聚类中心的选择对聚类结果影响更大.
三,根据需要编写SQL
表A的结构如下:
会员ID(用户ID,字符)
Log_time(用户访问页面时间,日期类型(仅一天的数据))
URL(访问页面的URL,字符类型)
要求: 提取每个用户(最早的时间)访问的第一个URL,并形成一个新表(新表名为B,表结构与表A相同)
参考答案:

创建表B作为选择Member_ID,分钟(Log_time),通过Member_ID从A组获取URL;
第四,销售数据分析
以下是B2C电子商务网站的每周销售数据. 该网站的主要用户群是办公室女性,销售主要集中在5种产品上. 如果您是这家公司的分析师,
a)您从数据中看到什么问题?您认为其背后的原因是什么?
b)如果老板要求您提出运营改进计划,您会怎么做?
下表如下: 每天网站的一组销售数据

参考答案:

a)从本周的数据可以看出,周末的销量明显下降. 产生这种情况的原因有两个方面: 从消费者的角度来看,您可能不需要在周末上班,因此没有购买产品的欲望. 从产品的角度来看,该产品不可能引起周末消费者的足够重视.
b)针对此问题背后的两个原因,我的运营改进计划也分为两个方面: 首先,对于不希望在周末购物的消费者,引导他们提醒消费者应该购买该产品在周末准备;第二个是通过类似于折扣促销的活动来增加周末产品的流行度和购买力.
五数据分析师笔试题,用户研究
一家公司针对三种类型的客户(A,B和C)提出了统一的改进计划. 该计划用于增加每周的客户消费量. 您需要制定测试前计划以支持决策. 请考虑以下问题:
a)实验需要为决策提供什么样的信息?
c)根据上述目的,请写下您的数据采样方法,要收集的数据索引项以及您选择的统计方法.
a)测试应证明改进计划可以显着增加A,B和C这三种类型客户的每周消费量.
b)根据三类客户的数量,使用分层比例抽样;
需要收集的数据指标是: 客户类别,计划改进前的周数和计划改进后的周数;
使用的统计方法是: 针对三种类型的客户A,B和C进行两次独立的样本T检验,以及改进前后的每周消费数量.
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/ruanjian/article-158293-1.html
不是网络文学的兴盛
那你去找天津市领导吧