数据挖掘试题(单选)

合集下载

数据挖掘考试题及答案

数据挖掘考试题及答案### 数据挖掘考试题及答案#### 一、选择题（每题2分，共20分）1. 数据挖掘的目的是发现数据中的：- A. 错误- B. 模式- C. 异常- D. 趋势答案：B2. 以下哪项不是数据挖掘的常用算法：- A. 决策树- B. 聚类分析- C. 线性回归- D. 神经网络答案：C3. 关联规则挖掘中，Apriori算法用于发现：- A. 频繁项集- B. 异常值- C. 趋势- D. 聚类答案：A4. K-means算法是一种：- A. 分类算法- B. 聚类算法- C. 预测算法- D. 关联规则挖掘算法答案：B5. 以下哪个指标用于评估分类模型的性能：- A. 准确率- B. 召回率- C. F1分数- D. 所有以上答案：D#### 二、简答题（每题10分，共30分）1. 描述数据挖掘中的“过拟合”现象，并给出避免过拟合的策略。

答案：过拟合是指模型对训练数据拟合得过于完美，以至于失去了泛化能力。

避免过拟合的策略包括：使用交叉验证、正则化技术、减少模型复杂度、获取更多的训练数据等。

2. 解释什么是“数据清洗”以及它在数据挖掘中的重要性。

答案：数据清洗是指从原始数据中识别并纠正（或删除）错误、重复或不完整的数据的过程。

它在数据挖掘中至关重要，因为脏数据会导致分析结果不准确，影响最终的决策。

3. 描述“特征选择”在数据挖掘中的作用。

答案：特征选择是数据挖掘中用来降低数据维度、提高模型性能和减少计算成本的过程。

通过选择最有信息量的特征，可以去除冗余或无关的特征，从而提高模型的准确性和效率。

#### 三、应用题（每题25分，共50分）1. 假设你正在分析一个电子商务网站的用户购买行为，描述你将如何使用数据挖掘技术来识别潜在的营销机会。

答案：首先，我会使用聚类分析来识别不同的用户群体。

然后，通过关联规则挖掘来发现不同用户群体的购买模式。

接着，利用分类算法来预测用户可能感兴趣的产品。

数据挖掘原理与应用---试题及答案试卷十二答案精选全文完整版

数据挖掘原理与应用试题及答案试卷一、（30分，总共30题，每题答对得1分，答错得0分）单选题1、在ID3算法中信息增益是指（ D ）A、信息的溢出程度B、信息的增加效益C、熵增加的程度最大D、熵减少的程度最大2、下面哪种情况不会影响K-means聚类的效果？（ B ）A、数据点密度分布不均B、数据点呈圆形状分布C、数据中有异常点存在D、数据点呈非凸形状分布3、下列哪个不是数据对象的别名 ( C )A、样品B、实例C、维度D、元组4、人从出生到长大的过程中，是如何认识事物的？ ( D )A、聚类过程B、分类过程C、先分类，后聚类D、先聚类，后分类5、决策树模型中应如何妥善处理连续型属性：（ C ）A、直接忽略B、利用固定阈值进行离散化C、根据信息增益选择阈值进行离散化D、随机选择数据标签发生变化的位置进行离散化6、假定用于分析的数据包含属性age。

数据元组中age的值如下（按递增序）：13，15，16，16，19，20，20，21，22，22，25，25，25，30，33，33，35，35，36，40，45，46，52，70。

问题：使用按箱平均值平滑方法对上述数据进行平滑，箱的深度为3。

第二个箱子值为：( A )A、18.3B、22.6C、26.8D、27.97、建立一个模型，通过这个模型根据已知的变量值来预测其他某个变量值属于数据挖掘的哪一类任务？( C )A、根据内容检索B、建模描述C、预测建模D、寻找模式和规则8、如果现在需要对一组数据进行样本个体或指标变量按其具有的特性进行分类，寻找合理的度量事物相似性的统计量，应该采取（ A ）A、聚类分析B、回归分析C、相关分析D、判别分析9、时间序列数据更适合用（ A ）做数据规约。

A、小波变换B、主成分分析C、决策树D、直方图10、下面哪些场景合适使用PCA？（ A ）A、降低数据的维度，节约内存和存储空间B、降低数据维度，并作为其它有监督学习的输入C、获得更多的特征D、替代线性回归11、数字图像处理中常使用主成分分析（PCA）来对数据进行降维，下列关于PCA算法错误的是：（ C ）A、PCA算法是用较少数量的特征对样本进行描述以达到降低特征空间维数的方法；B、PCA本质是KL-变换；C、PCA是最小绝对值误差意义下的最优正交变换；D、PCA算法通过对协方差矩阵做特征分解获得最优投影子空间，来消除模式特征之间的相关性、突出差异性；12、将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务？（ C ）A、频繁模式挖掘B、分类和预测C、数据预处理D、数据流挖掘13、假设使用维数降低作为预处理技术，使用PCA将数据减少到k维度。

数据挖掘(练习)考试答案

数据挖掘（练习）1、(单选，4分)以下哪项不属于知识发现的过程？( )A、数据清理B、数据挖掘C、知识可视化表达D、数据测试答案：D2、(单选，4分)以下哪些不属于数据挖掘的内容？（）A、分类B、聚类C、离群点检测D、递归分析答案：D3、(单选，4分)以下哪个不是常见的属性类型？（）A、A．标称属性B、数值属性C、高维属性D、序数属性答案：C4、(单选，4分)以下哪个度量属于数据散度的描述？（）A、均值B、中位数C、标准差D、众数答案：C5、(单选，4分)以下哪个度量不属于数据中心趋势度描述？（D ）A、A．均值B、中位数C、众数D、四分位数答案：D6、(单选，4分)对数据进行数据清理、集成、变换、规约是数据挖掘哪个步骤的任务？( )A、频繁模式挖掘B、分类和预测C、数据预处理D、噪声检测答案：C7、(单选，4分)聚类分析是数据挖掘的一种重要技术，以下哪个算法不属于聚类算法？( )A、K-MeansB、DBSCANC、SVMD、EM 答案：C8、(单选，4分)建立一个模型，通过这个模型根据已知的变量值来预测其他某个变量值属于数据挖掘的哪一类任务？( )A、根据内容检索B、建模描述C、预测建模D、寻找模式和规则答案：C9、(单选，4分)当不知道数据所带标签时. 可以使用哪种技术促使带同类标签的数据与带其他标签的数据相分离？( )A、分类B、聚类C、关联分析D、隐马尔可夫链答案：B10、(单选，4分)在构造决策树时，以下哪种不是选择属性的度量的方法？( )A、信息增益B、信息增益率C、基尼指数D、距离答案：D11、(单选，4分)知识发现流程最核心的步骤是什么？( )A、数据挖掘B、数据预处理C、模式评估D、知识表示答案：A12、(单选，4分)将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务？( )A、频繁模式挖掘B、分类和预测C、数据预处理D、数据流挖掘答案：C13、(单选，4分)以下哪个度量属于数据中心性的描述？（）A、均值B、极差C、众数D、标准差答案：A14、(单选，4分)类分析是数据挖掘的一种重要技术，以下哪个算法不属于聚类算法？( )A、K-MeansB、DBSCANC、KNND、EM 答案：C15、(单选，4分)某超市研究销售纪录数据后发现，买啤酒的人很大概率也会购买尿布，这种属于数据挖掘的哪类问题？( ) A、关联规则发现B、聚类C、分类D、自然语言处理答案：A16、(单选，4分)以下哪些算法是分类算法？( ) A、DBSCAN B、C4.5 C、K-Mean D、EM 答案：B17、(单选，4分)K-means算法的缺点不包括？( ) A、K必须是事先给定的B、选择初始聚类中心C、对于“噪声”和孤立点数据是敏感的D、可伸缩、高效答案：D18、(单选，4分)机器学习中，下面哪些方法不可以避免分类中的过拟合问题？（）A、增加样本数量B、增加模型复杂度C、去除噪声D、正则化答案：B19、(单选，4分)下面那个不属于知识发现过程。

数据挖掘考试题库及答案

数据挖掘考试题库及答案一、选择题1. 数据挖掘是从大量数据中提取有价值信息的过程，以下哪项不是数据挖掘的主要任务？A. 预测B. 分类C. 聚类D. 数据可视化答案：D2. 以下哪种技术不属于数据挖掘的常用方法？A. 决策树B. 支持向量机C. 关联规则D. 数据仓库答案：D3. 数据挖掘中，以下哪项技术常用于分类和预测？A. 神经网络B. K-均值聚类C. 主成分分析D. 决策树答案：D4. 在数据挖掘中，以下哪个概念表示数据集中的属性？A. 数据项B. 数据记录C. 数据属性D. 数据集答案：C5. 数据挖掘中，以下哪个算法用于求解关联规则？A. Apriori算法B. ID3算法C. K-Means算法D. C4.5算法答案：A二、填空题6. 数据挖掘的目的是从大量数据中提取______信息。

答案：有价值7. 在数据挖掘中，分类任务分为有监督学习和______学习。

答案：无监督8. 决策树是一种用于分类和预测的树形结构，其核心思想是______。

答案：递归划分9. 关联规则挖掘中，支持度表示某个项集在数据集中的出现频率，置信度表示______。

答案：包含项集的记录中同时包含结论的记录的比例10. 数据挖掘中，聚类分析是将数据集划分为若干个______的子集。

答案：相似三、判断题11. 数据挖掘只关注大量数据中的异常值。

（）答案：错误12. 数据挖掘是数据仓库的一部分。

（）答案：正确13. 决策树算法适用于处理连续属性的分类问题。

（）答案：错误14. 数据挖掘中的聚类分析是无监督学习任务。

（）答案：正确15. 关联规则挖掘中，支持度越高，关联规则越可靠。

（）答案：错误四、简答题16. 简述数据挖掘的主要任务。

答案：数据挖掘的主要任务包括预测、分类、聚类、关联规则挖掘、异常检测等。

17. 简述决策树算法的基本原理。

答案：决策树算法是一种自顶向下的递归划分方法。

它通过选择具有最高信息增益的属性进行划分，将数据集划分为若干个子集，直到满足停止条件。

2023年数据挖掘大赛赛题

大数据挖掘培训测试题
一、单选题
1、大数据挖掘的产出是（）[单选题]*
A、数据
B、报告
C、信息和知识
D、报表
2、大数据挖掘通用路径的第一步是（）[单选题]*
A、数据信息化
B、业务数据化
C、信息策略化
D、数据报表化
3、数据分析常见的产出是（）[单选题]*
A、分析报告
B、机器学习模型
C、微观操作策略
D、都不是
4、大数据挖掘通用流程中数据层的任务不包括（）[单选题]*
A、数据获取
B、模型训练
C、数据整理
D、数据清洗
5、数据分析基本过程的第一步是（）[单选题]*
A、明确目标和思路
B、数据采集
C、数据预处理
D、数据清洗
6、下列哪些不是数据分析中数据预处理阶段的动作（）[单选题]*
A、数据清洗
B、数据集成
C、数据派生
D、数据探索
7、数据分析报告通常采用下列哪种结构（）[单选题]*
A、总-分-总
B、分-总-分
C、总-分-分
D、分-分-总
8、把复杂问题拆解成简单项的数据分析思维方法是（）[单选题]*
A、5W2H方法
B、二八原则方法
C、逻辑树拆解法
D、假设验证法
9、精准营销过程数据分析通常使用下列哪种思维方法（）[单选题]*
A、5W2H方法
B、6R准则
C、矩阵分析法
D、漏洞分析法
10、列联分析中，用下列哪种方法来评价因子之间的影响显著性（）[单选题]*
A、相关系数大小
B、方差大小
C、包裹法
D、卡方验证。

数据挖掘练习

※:数据挖掘（练习）1、(单选，4分)以下哪项不属于知识发现的过程？()A、数据清理B、数据挖掘C、知识可视化表达D、数据测试答案：D※:数据挖掘（练习）2、(单选，4分)以下哪些不属于数据挖掘的内容？（）A、分类B、聚类C、离群点检测D、递归分析答案：D※:数据挖掘（练习）3、(单选，4分)以下哪个不是常见的属性类型？（）A、A．标称属性B、数值属性C、高维属性D、序数属性答案：C※:数据挖掘（练习）4、(单选，4分)以下哪个度量属于数据散度的描述？（）A、均值B、中位数C、标准差D、众数答案：C※:数据挖掘（练习）5、(单选，4分)以下哪个度量不属于数据中心趋势度描述？（D）A、A．均值B、中位数C、众数D、四分位数答案：D※:数据挖掘（练习）6、(单选，4分)对数据进行数据清理、集成、变换、规约是数据挖掘哪个步骤的任务？()A、频繁模式挖掘B、分类和预测C、数据预处理D、噪声检测答案：C※:数据挖掘（练习）7、(单选，4分)聚类分析是数据挖掘的一种重要技术，以下哪个算法不属于聚类算法？()A、K-MeansB、DBSCANC、SVMD、EM答案：C※:数据挖掘（练习）8、(单选，4分)建立一个模型，通过这个模型根据已知的变量值来预测其他某个变量值属于数据挖掘的哪一类任务？()A、根据内容检索B、建模描述C、预测建模D、寻找模式和规则答案：C※:数据挖掘（练习）9、(单选，4分)当不知道数据所带标签时.可以使用哪种技术促使带同类标签的数据与带其他标签的数据相分离？()A、分类B、聚类C、关联分析D、隐马尔可夫链答案：B※:数据挖掘（练习）10、(单选，4分)在构造决策树时，以下哪种不是选择属性的度量的方法？()A、信息增益B、信息增益率C、基尼指数D、距离答案：D※:数据挖掘（练习）11、(单选，4分)知识发现流程最核心的步骤是什么？()A、数据挖掘B、数据预处理C、模式评估D、知识表示答案：A※:数据挖掘（练习）12、(单选，4分)将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务？()A、频繁模式挖掘B、分类和预测C、数据预处理D、数据流挖掘答案：C※:数据挖掘（练习）13、(单选，4分)以下哪个度量属于数据中心性的描述？（）A、均值B、极差C、众数D、标准差答案：A※:数据挖掘（练习）14、(单选，4分)类分析是数据挖掘的一种重要技术，以下哪个算法不属于聚类算法？()A、K-MeansB、DBSCANC、KNND、EM答案：C※:数据挖掘（练习）15、(单选，4分)某超市研究销售纪录数据后发现，买啤酒的人很大概率也会购买尿布，这种属于数据挖掘的哪类问题？()A、关联规则发现B、聚类C、分类D、自然语言处理答案：A※:数据挖掘（练习）16、(单选，4分)以下哪些算法是分类算法？()A、DBSCANB、C4.5C、K-MeanD、EM答案：B※:数据挖掘（练习）17、(单选，4分)K-means算法的缺点不包括？()A、K必须是事先给定的B、选择初始聚类中心C、对于“噪声”和孤立点数据是敏感的D、可伸缩、高效答案：D※:数据挖掘（练习）18、(单选，4分)机器学习中，下面哪些方法不可以避免分类中的过拟合问题？（）A、增加样本数量B、增加模型复杂度C、去除噪声D、正则化答案：B※:数据挖掘（练习）19、(单选，4分)下面那个不属于知识发现过程。

大数据挖掘技术练习(试卷编号131)

大数据挖掘技术练习(试卷编号131)1.[单选题]非参数检验是针对( )分布情况做的假设。

A)总体B)局部C)个体答案:A解析:2.[单选题]对于下图, 一个比较好的主成分选择是多少 ?A)7B)30C)35D)不能确定答案:B解析:A)\dB)\DC)\sD)\w答案:A解析:4.[单选题]下面选项中t不是s的子序列的是 ( )A)S=<{2,4},{3,5,6},{8}> t=<{2},{3,6},{8}>B)S=<{2,4},{3,5,6},{8}> t=<{2},{8}>C)S=<{1,2},{3,4}> t=<{1},{2}>D)S=<{2,4},{2,4}> t=<{2},{4}>答案:C解析:5.[单选题]（）的目的缩小数据的取值范围，使其更适合于数据挖掘算法的需要，并且能够得到和原始数据相同的分析结果A)数据清洗B)数据集成C)数据变换D)数据归约答案:D解析:6.[单选题]通过代码”from sklearn import linear_model”引入线性模型模块,并通过代码“reg = linear_model.LinearRegression()”构造回归器对象后,在训练时要调用的方法是( )。

A)reg.learn()B)reg.predict()C)reg.train()D)reg.fit()答案:D解析:7.[单选题]OLAP 技术的核心是: ( )A)在线性;B)对用户的快速响应;C)互操作性.D)多维分析答案:D解析:d={123:'Tom', 'age':18, 'score':[91,92,93]}print(d[123][1],d['age'],d['score'][-1])输出的结果是:A)T,18,91B)o,18,91C)T,18,92D)o,18,93答案:D解析:9.[单选题]自动化高级分析实验室,实现与统一数据资源库互联,实现数据的自助组表、自助分析功能,满足不同层级、不同水平的用户需求的是( )A)初级分析;B)综合分析C)典型分析D)高级分析答案:D解析:10.[单选题]在计算时，取，是()A)一个学习率，取值为0~1B)一个学习率,取值为-1~1C)一个阈值,取值为0~1D)一个阈值,取值为一1~1答案:A解析:11.[单选题]下列属于间接数据挖掘的是（）A)分类B)估值C)聚集D)预言答案:C解析:12.[单选题]对于任一个频繁项集X和它的一个非空真子集Y, S=X-Y,规则S→Y成立的条件是( )。

数据挖掘测试题及答案

数据挖掘测试题及答案一、选择题1. 数据挖掘的目的是：A. 数据清洗B. 数据转换C. 模式发现D. 数据存储答案：C2. 以下哪项不是数据挖掘的常用算法？A. 决策树B. 聚类分析C. 线性回归D. 关联规则答案：C二、填空题1. 数据挖掘中的_________是指在大量数据中发现的有意义的模式。

答案：知识2. 一种常用的数据挖掘技术是_________，它用于发现数据中隐藏的分组。

答案：聚类三、简答题1. 简述数据挖掘与数据分析的区别。

答案：数据挖掘是一种自动或半自动的过程，旨在从大量数据中发现模式和知识。

数据分析通常涉及更具体的查询和问题，使用统计方法来理解数据。

2. 描述什么是关联规则挖掘，并给出一个例子。

答案：关联规则挖掘是一种用于发现变量之间有趣关系的技术，特别是变量之间的频繁模式、关联或相关性。

例如，在市场篮子分析中，关联规则挖掘可以用来发现顾客购买行为中的模式，如“购买面包的顾客中有80%也购买了牛奶”。

四、计算题1. 给定以下数据集，计算支持度和置信度：| 事务ID | 购买的商品 |||-|| 1 | A, B || 2 | A, C || 3 | B, C || 4 | A, B, C || 5 | B, D |(1) 计算项集{A}的支持度。

(2) 计算规则A => B的置信度。

答案：(1) 项集{A}的支持度为4/5，因为A出现在4个事务中。

(2) 规则A => B的置信度为3/4，因为A和B同时出现在3个事务中，而A出现在4个事务中。

五、论述题1. 论述数据挖掘在电子商务中的应用，并给出至少两个具体的例子。

答案：数据挖掘在电子商务中的应用非常广泛，包括：- 客户细分：通过数据挖掘技术，商家可以识别不同的客户群体，为每个群体提供定制化的服务或产品。

- 推荐系统：利用关联规则挖掘，电商平台可以推荐用户可能感兴趣的商品，提高用户满意度和购买率。

- 欺诈检测：通过分析交易模式，数据挖掘可以帮助识别异常行为，预防信用卡欺诈等风险。

大数据挖掘技术练习(习题卷6)

大数据挖掘技术练习(习题卷6)第1部分：单项选择题，共51题，每题只有一个正确答案,多选或少选均不得分。

1.[单选题]基于输入的用户信息,通过模型的训练学习,找出数据中的规律和趋势,以确定未来目标数据的预测值()A)聚类B)分类C)预测D)关联答案:C解析:2.[单选题]使用pip工具升级科学计算扩展库numpy的完整命令是（）A)pip install --upgrade numpyB)pip list --upgrade numpyC)upgrade numpyD)upg numpy--pip install答案:A解析:3.[单选题]在一个表中有字段“专业”,要查找包含“信息”两个字的记录,正确的表达式是______。

A)LEFT(专业, 2)="信息"B)LIKE "%信息%"C)LIKE "_信息_"D)RIGHT(专业, 2)="信息"答案:B解析:4.[单选题]两台路由器成为OSPF邻居关系的必要条件不包括A)两台路由器的Hello时间一致B)两台路由器的Dead时间一致C)两台路由器的Router ID一致D)两台路由器所属区域一致答案:C解析:5.[单选题]自动化高级分析实验室,实现与统一数据资源库互联,实现数据的自助组表、自助分析功能,满足不同层级、不同水平的用户需求的是( )A)初级分析;B)综合分析C)典型分析D)高级分析答案:D解析:6.[单选题]关于 K 均值和 DBSCAN 的比较，以下说法不正确的是( )。

A)KB)KC)KD)K答案:A解析:7.[单选题]属于定量的属性类型是A)标称B)序数C)区间D)相异答案:C解析:8.[单选题]终端支持的频段，在下列哪个流程中会得以体现A)ATTACHB)DETACHC)切换流程D)呼叫流程答案:A解析:9.[单选题]概念分层图是____图。

A)无向无环B)有向无环C)有向有环D)无向有环答案:B解析:10.[单选题]关于OLAP和OLTP的区别描述,不正确的是:A)OLAP主要是关于如何理解聚集的大量不同的数据.它与OTAP应用程序不同.B)与OLAP应用程序不同,OLTP应用程序包含大量相对简单的事务.C)OLAP的特点在于事务量大,但事务内容比较简单且重复率高.D)OLAP是以数据仓库为基础的,但其最终数据来源与OLTP一样均来自底层的数据库系统,两者面对的用户是相同的.答案:C解析:11.[单选题]在FP-GROWTH算法中，已构造FP-Tree如图则项 I3 的条件模式基为A)<(I1,I2:2)>、I2:2、 I1:2B)<(I2,I1:2)>、I2:1、 I1:1C)<(I2,I1:2)>、I2:2、 I1:2D)<(I2,I1:1)>、I2:2、 I1:2答案:C解析:12.[单选题]下面的代码其功能为（）>>> x = [range(3*i, 3*i+5) for i in range(2)]>>> x = list(map(list, x))>>> x = list(map(list, zip(*x)))A)首先生成一个随机的列表，然后生成矩阵B)首先生成一个包含列表的列表，然后生成矩阵C)首先生成一个包含列表的列表，然后模拟矩阵转置D)首先排序列表，然后模拟矩阵转置答案:C解析:13.[单选题]下述方法不属于聚类方法的是( )A)K-均值B)K-中心性C)DBSCAN算法D)神经网络答案:D解析:14.[单选题]设有一个回归方程为y=2-2.5x,则变量x增加一个单位时()A)y平均增加2.5个单位B)y平均增加2个单位C)y平均减少2.5个单位D)y平均减少2个单位答案:C解析:15.[单选题]JSON 中的中括号一般来表示( )。

大数据挖掘技术练习(习题卷2)

大数据挖掘技术练习(习题卷2)第1部分：单项选择题，共144题，每题只有一个正确答案,多选或少选均不得分。

1.[单选题]MGW 与RNC的连接介质采用A)IP传输B)PCM传输C)ATM传输答案:C解析:2.[单选题]在无线数据端到端指标体系中，即时通信首包响应时延的指标定义是？A)即时通信业务第一个HTTP响应包时延的平均值B)即时通信业务最后一个HTTP数据包时延的平均值C)即时通信业务所有HTTP数据包时延的平均值答案:A解析:3.[单选题]如果怀疑GPS跑偏，哪些说法是不对的？A)当UE工作在故障基站时，其测量得到的邻小区的PCCPCH RSCP都比实际值低很多；UE在正常站测故障站的PCCPCH RSCP值也比实际值低。

B)当故障GPS前偏时，周围基站与故障站主频点相同频点的UpPTS时隙都受到比较大的干扰C)可以通过进行站点的切换统计进行定位，对于故障站点，其特征是基站内部各小区之间切换正常，但是UE无法从该基站的小区切换到其它基站所属的小区上，也无法从其他基站的小区切换到故障基站包含的小区上。

D)通过将OMC-R统计的ISCP值导入MAPINFO地图，进行排查答案:B解析:4.[单选题]朴素贝叶斯分类中得到条件概率的方法错误的是( )。

A)对于定量属性,将取值离散化变为区间,再当做定性属性处理B)对于定性属性,将转化为定量属性,再计算相应的概率C)对于定量属性,假设变量服从某种概率分布,通过训练数据集估计分布的参数D)对于定性属性,计算某一类别的样本中某种属性取该值的样本所占比例来近似答案:B解析:5.[单选题]数据挖掘技术包括三个主要的部分 ( )A)数据、模型、技术B)算法、技术、领域知识C)数据、建模能力、算法与技术D)建模能力、算法与技术、领域知识答案:C解析:6.[单选题]关于 K均值和 DBSCAN的比较 , 以下说法不正确的是( )。

A)K均值丢弃被它识别为噪声的对象 , 而BSCAN一般聚类所有对象。

1、下载文档前请自行甄别文档内容的完整性，平台不提供额外的编辑、内容补充、找答案等附加服务。
2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
3、如文档侵犯您的权益，请联系客服反馈,我们会尽快为您处理(人工客服工作时间：9:00-18:30)。

单选题1. 某超市研究销售纪录数据后发现，买啤酒的人很大概率也会购买尿布，这种属于数据挖掘的哪类问题？(A)A. 关联规则发现B. 聚类C. 分类D. 自然语言处理2. 以下两种描述分别对应哪两种对分类算法的评价标准？ (A)(a)警察抓小偷，描述警察抓的人中有多少个是小偷的标准。

(b)描述有多少比例的小偷给警察抓了的标准。

A. Precision, RecallB. Recall, PrecisionA. Precision, ROC D. Recall, ROC3. 将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务？(C)A. 频繁模式挖掘B. 分类和预测C. 数据预处理D. 数据流挖掘4. 当不知道数据所带标签时，可以使用哪种技术促使带同类标签的数据与带其他标签的数据相分离？(B)A. 分类B. 聚类C. 关联分析D. 隐马尔可夫链5. 什么是KDD？ (A)A. 数据挖掘与知识发现B. 领域知识发现C. 文档知识发现D. 动态知识发现6. 使用交互式的和可视化的技术，对数据进行探索属于数据挖掘的哪一类任务？（A）A. 探索性数据分析B. 建模描述C. 预测建模D. 寻找模式和规则7. 为数据的总体分布建模；把多维空间划分成组等问题属于数据挖掘的哪一类任务？(B)A. 探索性数据分析B. 建模描述C. 预测建模D. 寻找模式和规则8. 建立一个模型，通过这个模型根据已知的变量值来预测其他某个变量值属于数据挖掘的哪一类任务？(C)A. 根据内容检索B. 建模描述C. 预测建模D. 寻找模式和规则9. 用户有一种感兴趣的模式并且希望在数据集中找到相似的模式，属于数据挖掘哪一类任务？(A)A. 根据内容检索B. 建模描述C. 预测建模D. 寻找模式和规则11.下面哪种不属于数据预处理的方法？ (D)A变量代换 B离散化 C 聚集 D 估计遗漏值12. 假设12个销售价格记录组已经排序如下：5, 10, 11, 13, 15, 35, 50, 55, 72, 92, 204, 215 使用如下每种方法将它们划分成四个箱。

等频（等深）划分时，15在第几个箱子内？ (B)A 第一个B 第二个C 第三个D 第四个13.上题中，等宽划分时（宽度为50），15又在哪个箱子里？ (A)A 第一个B 第二个C 第三个D 第四个14.下面哪个不属于数据的属性类型：(D)A 标称B 序数C 区间 D相异15. 在上题中，属于定量的属性类型是：(C)A 标称B 序数 C区间 D 相异16. 只有非零值才重要的二元属性被称作：( C )A 计数属性B 离散属性 C非对称的二元属性 D 对称属性17. 以下哪种方法不属于特征选择的标准方法： (D)A嵌入 B 过滤 C 包装 D 抽样18.下面不属于创建新属性的相关方法的是： (B)A特征提取 B特征修改 C映射数据到新的空间 D特征构造19. 考虑值集{1、2、3、4、5、90}，其截断均值（p=20%）是 (C)A 2B 3C 3.5D 520. 下面哪个属于映射数据到新的空间的方法？ (A)A 傅立叶变换 B特征加权 C 渐进抽样 D维归约21. 熵是为消除不确定性所需要获得的信息量，投掷均匀正六面体骰子的熵是： (B)A 1比特B 2.6比特C 3.2比特D 3.8比特22. 假设属性income的最大最小值分别是12000元和98000元。

利用最大最小规范化的方法将属性的值映射到0至1的范围内。

对属性income的73600元将被转化为：(D)A 0.821B 1.224C 1.458D 0.71623.假定用于分析的数据包含属性age。

数据元组中age的值如下（按递增序）：13，15，16，16，19，20，20，21，22，22，25，25，25，30，33，33，35，35，36，40，45，46，52，70, 问题：使用按箱平均值平滑方法对上述数据进行平滑，箱的深度为3。

第二个箱子值为：(A)A 18.3B 22.6C 26.8D 27.924. 考虑值集{12 24 33 2 4 55 68 26}，其四分位数极差是：(A)A 31B 24C 55D 325. 一所大学内的各年纪人数分别为：一年级200人，二年级160人，三年级130人，四年级110人。

则年级属性的众数是： (A)A 一年级 B二年级 C 三年级 D 四年级26. 下列哪个不是专门用于可视化时间空间数据的技术： (B)A 等高线图 B饼图 C 曲面图 D 矢量场图27. 在抽样方法中，当合适的样本容量很难确定时，可以使用的抽样方法是： (D)A 有放回的简单随机抽样 B无放回的简单随机抽样 C分层抽样 D 渐进抽样28. 数据仓库是随着时间变化的,下面的描述不正确的是 (C)A. 数据仓库随时间的变化不断增加新的数据内容;B. 捕捉到的新数据会覆盖原来的快照;C. 数据仓库随事件变化不断删去旧的数据内容;D. 数据仓库中包含大量的综合数据,这些综合数据会随着时间的变化不断地进行重新综合.29. 关于基本数据的元数据是指: (D)A. 基本元数据与数据源,数据仓库,数据集市和应用程序等结构相关的信息;B. 基本元数据包括与企业相关的管理方面的数据和信息;C. 基本元数据包括日志文件和简历执行处理的时序调度信息;D. 基本元数据包括关于装载和更新处理,分析处理以及管理方面的信息.30. 下面关于数据粒度的描述不正确的是: (C)A. 粒度是指数据仓库小数据单元的详细程度和级别;B. 数据越详细,粒度就越小,级别也就越高;C. 数据综合度越高,粒度也就越大,级别也就越高;D. 粒度的具体划分将直接影响数据仓库中的数据量以及查询质量.31. 有关数据仓库的开发特点,不正确的描述是: (A)A. 数据仓库开发要从数据出发;B. 数据仓库使用的需求在开发出去就要明确;C. 数据仓库的开发是一个不断循环的过程,是启发式的开发;D. 在数据仓库环境中,并不存在操作型环境中所固定的和较确切的处理流,数据仓库中数据分析和处理更灵活,且没有固定的模式32. 在有关数据仓库测试,下列说法不正确的是: (D)A. 在完成数据仓库的实施过程中,需要对数据仓库进行各种测试.测试工作中要包括单元测试和系统测试.B. 当数据仓库的每个单独组件完成后,就需要对他们进行单元测试.C. 系统的集成测试需要对数据仓库的所有组件进行大量的功能测试和回归测试.D. 在测试之前没必要制定详细的测试计划.33. OLAP技术的核心是: (D)A. 在线性;B. 对用户的快速响应;C. 互操作性.D. 多维分析;34. 关于OLAP的特性,下面正确的是: (D)(1)快速性 (2)可分析性 (3)多维性 (4)信息性 (5)共享性A. (1) (2) (3)B. (2) (3) (4)C. (1) (2) (3) (4)D. (1) (2) (3) (4) (5)35. 关于OLAP和OLTP的区别描述,不正确的是: (C)A. OLAP主要是关于如何理解聚集的大量不同的数据.它与OTAP应用程序不同.B. 与OLAP应用程序不同,OLTP应用程序包含大量相对简单的事务.C. OLAP的特点在于事务量大,但事务内容比较简单且重复率高.D. OLAP是以数据仓库为基础的,但其最终数据来源与OLTP一样均来自底层的数据库系统,两者面对的用户是相同的.36. OLAM技术一般简称为”数据联机分析挖掘”,下面说法正确的是: (D)A. OLAP和OLAM都基于客户机/服务器模式,只有后者有与用户的交互性;B. 由于OLAM的立方体和用于OLAP的立方体有本质的区别.C. 基于WEB的OLAM是WEB技术与OLAM技术的结合.D. OLAM服务器通过用户图形借口接收用户的分析指令,在元数据的知道下,对超级立方体作一定的操作.37. 关于OLAP和OLTP的说法,下列不正确的是: (A)A. OLAP事务量大,但事务内容比较简单且重复率高.B. OLAP的最终数据来源与OLTP不一样.C. OLTP面对的是决策人员和高层管理人员.D. OLTP以应用为核心,是应用驱动的.38. 设X={1，2，3}是频繁项集，则可由X产生__(C)__个关联规则。

A、4B、5C、6D、740. 概念分层图是__(B)__图。

A、无向无环B、有向无环C、有向有环D、无向有环41. 频繁项集、频繁闭项集、最大频繁项集之间的关系是： (C)A、频繁项集频繁闭项集 =最大频繁项集B、频繁项集 = 频繁闭项集最大频繁项集C、频繁项集频繁闭项集最大频繁项集D、频繁项集 = 频繁闭项集 = 最大频繁项集42. 考虑下面的频繁3-项集的集合：{1，2，3}，{1，2，4}，{1，2，5}，{1，3，4}，{1，3，5}，{2，3，4}，{2，3，5}，{3，4，5}假定数据集中只有5个项，采用合并策略，由候选产生过程得到4-项集不包含（C）A、1，2，3，4B、1，2，3，5C、1，2，4，5D、1，3，4，543.下面选项中t不是s的子序列的是 ( C )A、s=<{2,4},{3,5,6},{8}> t=<{2},{3,6},{8}>B、s=<{2,4},{3,5,6},{8}> t=<{2},{8}>C、s=<{1,2},{3,4}> t=<{1},{2}>D、s=<{2,4},{2,4}> t=<{2},{4}>44. 在图集合中发现一组公共子结构，这样的任务称为 ( B )A、频繁子集挖掘B、频繁子图挖掘C、频繁数据项挖掘D、频繁模式挖掘45. 下列度量不具有反演性的是 (D)A、系数B、几率C、Cohen度量D、兴趣因子46. 下列__(A)__不是将主观信息加入到模式发现任务中的方法。

A、与同一时期其他数据对比B、可视化C、基于模板的方法D、主观兴趣度量47. 下面购物篮能够提取的3-项集的最大数量是多少（C）ID 购买项1 牛奶，啤酒，尿布2 面包，黄油，牛奶3 牛奶，尿布，饼干4 面包，黄油，饼干5 啤酒，饼干，尿布6 牛奶，尿布，面包，黄油7 面包，黄油，尿布8 啤酒，尿布9 牛奶，尿布，面包，黄油10 啤酒，饼干A、1B、2C、3D、448. 以下哪些算法是分类算法，A，DBSCAN B，C4.5 C,K-Mean D,EM （B）49. 以下哪些分类方法可以较好地避免样本的不平衡问题， A，KNN B，SVM C，Bayes D，神经网络（A）50. 决策树中不包含一下哪种结点，A,根结点（root node) B,内部结点（internal node）C,外部结点（external node） D,叶结点（leaf node） (C)51. 不纯性度量中Gini计算公式为（其中c是类的个数） (A)A, B, C, D, （A）53. 以下哪项关于决策树的说法是错误的 (C)A. 冗余属性不会对决策树的准确率造成不利的影响B. 子树可能在决策树中重复多次C. 决策树算法对于噪声的干扰非常敏感D. 寻找最佳决策树是NP完全问题54. 在基于规则分类器的中，依据规则质量的某种度量对规则排序，保证每一个测试记录都是由覆盖它的“最好的”规格来分类，这种方案称为 (B)A. 基于类的排序方案B. 基于规则的排序方案C. 基于度量的排序方案D. 基于规格的排序方案。