机器学习-习题答案
1 2.5 (题目略) (a). 第一步:S0 {<(Q Q Q Q ), (Q Q Q Q)>} G0 {<(? ? ? ?), (? ? ? ?)>} 第二步:S1 {<(male brown tall US), (female black short US)> G1 {<(? ? ? ?), (? ? ? ?)>} 第三步:S2 {<(male brown ? ?), (female black short US)> G2 {<(? ? ? ?), (? ? ? ?)>} 第四步:S3 {<(male brown ? ?), (female black short US)> G3 {<(male ? ? ?), (? ? ? ?)>,,} 第五步:S4 {<(male brown ? ?), (female ? short ?)> G4 {<(male ? ? ?), (? ? ? ?)>} (b).假设中的每个属性可以取两个值,所以与题目例题一致的假设数目为: (2*2*2*2)*(2*2*2*2) = 256
(c). 这个最短序列应该为8,25628 如果只有一个训练样例,则假设空间有25628个假设,我们针对每一个属性来设置训练样例,使每次的假设空间减半。则经过8次训练后,可收敛到单个正确的假设。 , , , , , , , , (d). 若要表达该实例语言上的所有概念,那么我们需要扩大假设空间,使得每个可能的假设都包括在内,这样假设空间就远远大于256,而且这样没法得到最终的没法收敛,因为对每一个未见过的训练样例,投票没有任何效果,因此也就没有办法对未见样例分类。所以不存在一个最优的查询序列。
2.6 完成变型空间表示定理的证明(定理2.1) 定理2.1:变型空间表示定理 领X为一任意的实例集合,H为X上定义的布尔假设的集合。令c:X{0,1}为X上定义的任一目标概念,并令D为任一训练样例的集合{}。对所有的X,H,c,D以及良好定义的S和G:
})()((|{shgGgSsHhVSggHD
证明:对VSH,D中任一h: ①当h∈S时,取s=h,则有h≥gs成立 ②当hS时,即 (h1H)[(h>gh1)∧Consistent(h1,D)] 若h1S,显然h≥gs成立; 2
否则有 (h2H)[(h1>gh2)∧Consistent(h2,D)] 同样或者h2S,则h>gh1≥gs成立;或者 (h3H)[(h2>gh3)∧Consistent(h3,D)] 如此下去,必存在一个序列h>gh1>gh2>g…>ghnS 故也有 (sS)h≥gs 同理,对VSH,D中任一h: ①当hG时,取g=h,则有g≥gh成立 ②当hG时,即 (h1H)[(h1>gh)∧Consistent(h1,D)] 若h1G,显然g≥gh成立; 否则有 (h2H)[(h2>gh1)∧Consistent(h2,D)] 同样或者h2G,则g=h2>gh1≥gh成立;或者 (h3H)[(h3>gh2)∧Consistent(h3,D)] 如此下去,必存在一个序列g=hn>g …>gh2>gh1>gh,故也有 (gG)g≥gh
2.9 (题目略) 对每个属性进行如下操作: 令ai=T,遍历样例集,如果样例全部为正例,则向假设中添加ai=T, 否则,令ai=F,遍历样例集,如果样例全部为正例,则向假设中添加ai=F, 否则,舍弃ai,不向假设中添加ai。 时间最大复杂度:2*n*样例集大小
3.2 15.0log5.05.0log5.0log)(2212ciiippSEntropy
01*621*641)(62)(641)(||||)()()(FTvAValuesvvSEntropySEntropySEntropysSSEntropyASGain
3.4 假设u1:EnjoySport=Yes ,u2:EnjoySport=No H(U)=-P(u1) log P(u1) – P(u2) log P(u2)= -(3/4)log(3/4)-(1/4)log(1/4) 对Sky假设v1:Sky=Sunny v2:Sky=Rainy H(U|v1)=-P(u1|v1) log P(u1|v1)-P(u2|v1) log P(u2|v1) = -1*log(1)-(0)*log(0)=0 H(U|v2)=-P(u1|v2) log P(u1|v2)-P(u2|v2) log P(u2|v2) = -(0)*log(0)-(1)*log(1)=0 H(U|V)=P(v1) H(U|v1)+P(v2) H(U|v2)=(3/4)*0+(1/4)*0=0 所以I(U, V)=H(U)-H(U|V)=H(U) 此时显然信息增益最大,所以Sky作为决策树根节点,又由于对Sky取两个值对应的EnjoySport值都是确定的,因此可画出决策树为: 3
使用变型空间算法得到的变型空间为,决策树对应变型空间为,显然,决策树得到的变型空间更一般。树等价于变型空间中的一个或多个成员。 假设u1:EnjoySport=Yes ,u2:EnjoySport=No H(U)=-P(u1) log P(u1) – P(u2) log P(u2)= -(3/5)log(3/5)-(2/5)log(2/5)=0.971 ①对Sky假设v1:Sky=Sunny v2:Sky=Rainy H(U|v1)=-P(u1|v1) log P(u1|v1)-P(u2|v1) log P(u2|v1) =-(3/4)*log(3/4)-(1/4)*log(1/4)=0.811 H(U|v2)=-P(u1|v2) log P(u1|v2)-P(u2|v2) log P(u2|v2) = -(0)*log(0)-(1)*log(1)=0 H(U|V)=P(v1) H(U|v1)+P(v2) H(U|v2)=(4/5)* 0.811+(1/5)*0=0.6488 I(U, V)=H(U)-H(U|V)=0.971-0.6488=0.3222 ②对AirTemp假设v1:AirTemp=Warm v2:AirTemp=Cold H(U|v1)=-P(u1|v1) log P(u1|v1)-P(u2|v1) log P(u2|v1) =-(3/4)*log(3/4)-(1/4)*log(1/4)=0.811 H(U|v2)=-P(u1|v2) log P(u1|v2)-P(u2|v2) log P(u2|v2) = -(0)*log(0)-(1)*log(1)=0 H(U|V)=P(v1) H(U|v1)+P(v2) H(U|v2)=(4/5)*0.811+(1/5)*0=0.6488 I(U, V)=H(U)-H(U|V)=0.971-0.6488=0.3222 ③对Humidity假设v1:Humidity=Normal v2:Humidity =High H(U|v1)=-P(u1|v1) log P(u1|v1)-P(u2|v1) log P(u2|v1) =-(1/2)*log(1/2)-(1/2)*log(1/2)=1 H(U|v2)=-P(u1|v2) log P(u1|v2)-P(u2|v2) log P(u2|v2) =-(2/3)*log(2/3)-(1/3)*log(1/3)=0.918 H(U|V)=P(v1) H(U|v1)+P(v2) H(U|v2)=(2/5)*1+(3/5)*0.918=0.9508 I(U, V)=H(U)-H(U|V)=0.971-0.9508=0.0202 ④对Wind假设v1:Wind=Strong v2:Wind =Weak H(U|v1)=-P(u1|v1) log P(u1|v1)-P(u2|v1) log P(u2|v1) =-(3/4)*log(3/4)-(1/4)*log(1/4)=0.811 H(U|v2)=-P(u1|v2) log P(u1|v2)-P(u2|v2) log P(u2|v2) =-(0)*log(0)-(1)*log(1)=0 H(U|V)=P(v1) H(U|v1)+P(v2) H(U|v2)=(4/5)*0.811+(1/5)*0=0.6488 I(U, V)=H(U)-H(U|V)=0.971-0.6488=0.3222 ⑤对Water假设v1:Water=Warm v2:Water =Cool H(U|v1)=-P(u1|v1) log P(u1|v1)-P(u2|v1) log P(u2|v1) =-(1/2)*log(1/2)-(1/2)*log(1/2)=1 H(U|v2)=-P(u1|v2) log P(u1|v2)-P(u2|v2) log P(u2|v2) =-(1)*log(1)-(0)*log(0)=0 H(U|V)=P(v1) H(U|v1)+P(v2) H(U|v2)=(4/5)*1+(1/5)*0=0.8 I(U, V)=H(U)-H(U|V)=0.971-0.8=0.171 ⑥对Forecast假设v1:Forecast=Same v2:Forecast=Change H(U|v1)=-P(u1|v1) log P(u1|v1)-P(u2|v1) log P(u2|v1) =-(2/3)*log(2/3)-(1/3)*log(1/3)=0.918 H(U|v2)=-P(u1|v2) log P(u1|v2)-P(u2|v2) log P(u2|v2) =-(1/2)*log(1/2)-(1/2)*log(1/2)=1 H(U|V)=P(v1) H(U|v1)+P(v2) H(U|v2)=(3/5)*0.918+(2/5)*1=0.9580 I(U, V)=H(U)-H(U|V)=0.971-0.9580=0.013
Sky Yes No Sunny Rainy
机器学习(传统机器学习)期末测试练习题
1、使用K-means算法得到了三个聚类中心,分别是[1,2],[-3,0],[4,2],现输入数据X=[3,1],则X属于第几类A.1B.3C. 2D.不能确定正确答案:B2、对一组无标签的数据X,使用不同的初始化值运行K-means算法50次,如何评测这50次聚类的结果哪个最优A.优化目标函数值最小的一组最优B.需要获取到数据的标签才能评测C.暂无方法D.最后一次运行结果最优正确答案:A3、下图是某个二维高斯混合模型的聚类结果,该GMM的输出矩阵的形式为A.对角阵且非单位矩阵B.普通方阵C.单位矩阵D.不能确定正确答案:A二、多选题1、以下关于PCA算法的描述正确的有哪些A.即使输入数据X各个维度上的数值相似度较高,依旧需要对其去均值B.使用PCA算法时,数据压缩后的维度M可以设置的偏小一点C.在使用PCA算法时,有可能陷入局部最小值,所以需要使用不同的初始化数值多次计算以获得更好的结果D.已知使用PCA算法压缩后的数据Y以及压缩矩阵A,但是无法大致还原压缩前的数据X正确答案:A、B2、有L个输入样本,每个样本的特征维度是N。
在设置压缩后的维度M时,以下哪些设置方式是合理的A.M = 0.1*NB.M= 0.1*LC.根据能量百分比准则,保留占据5%能量的M值D.根据能量百分比准则,保留占据95%能量的M值正确答案:A、D3、以下哪些是PCA算法可以解决的问题A.对维度较小的数据进行维度扩充B.对特征相关性较高的数据进行降维C.对维度大于3的数据进行可视化处理D.数据维度压缩正确答案:B、C、D4、以下关于K-means的说法正确的有A.初始化聚类中心时,一定要将各个聚类中心的坐标设置为相同的值B.该算法会存在陷入局部极值的情况,可以使用不同的初始化值,多次实验来解决该问题C.K值的选取往往需要依靠经验或者数据集的情况来确定D.因为该算法是无监督学习算法,所以不存在过拟合问题,所以K设置的越大,效果越好正确答案:B、C5、以下哪些特征选取方式是无监督的A.使用协方差矩阵抽取协方差值较高的特征B.使用卷积层,pooling层处理输入图像,得到降维后的特征图C.使用线性神经网络抽取特征D.使用PCA进行特征抽取正确答案:A、D三、判断题1、特征向量对[1,1,1,1],[1,-1,-1,1]有可能来自转换矩阵A。
机器学习期末测试练习题3
一、单选题1、以下关于感知器算法与支持向量机算法说法有误的是A. 由于支持向量机是基于所有训练数据寻找最大化间隔的超平面,而感知器算法却是相对随意的找一个分开两类的超平面,因此大多数时候,支持向量机画出的分类面往往比感知器算法好一些。
B.支持向量机是把所有训练数据都输入进计算机,让计算机解全局优化问题C.感知器算法相比于支持向量机算法消耗的计算资源和内存资源更少,但是耗费的计算资源更多D. 以上选项都正确正确答案:C2、假设你在训练一个线性回归模型,有下面两句话:如果数据量较少,容易发生过拟合。
如果假设空间较小,容易发生过拟合。
关于这两句话,下列说法正确的是?A.1正确,2错误B.1和2都错误C.1和2都正确D.1错误,2正确正确答案:A3、下面哪一项不是比较好的学习率衰减方法?t表示为epoch数。
α0A.α=11+2∗tα0B. α=√tC. α=0.95tα0D.α=e tα0正确答案:D4、你正在构建一个识别足球(y = 1)与篮球(y = 0)的二元分类器。
你会使用哪一种激活函数用于输出层?A.ReLUB. tanhC.sigmoidD. Leaky ReLU正确答案:C5、假设你建立一个神经网络。
你决定将权重和偏差初始化为零。
以下哪项陈述是正确的?A.第一个隐藏层中的每个神经元将在第一次迭代中执行相同的计算。
但经过一次梯度下降迭代后,他们将会计算出不同的结果。
B.第一个隐藏层中的每个神经元节点将执行相同的计算。
所以即使经过多次梯度下降迭代后,层中的每个神经元节点都会计算出与其他神经元节点相同的结果。
C.第一个隐藏层中的每一个神经元都会计算出相同的结果,但是不同层的神经元会计算不同的结果。
D.即使在第一次迭代中,第一个隐藏层的神经元也会执行不同的计算,他们的参数将以各自方式进行更新。
正确答案:B6、某个神经网络中所有隐藏层神经元使用tanh激活函数。
那么如果使用np.random.randn(…,…)* 1000将权重初始化为相对较大的值。
机器学习口算练习题及答案2023
机器学习口算练习题及答案2023一、选择题1. 下面哪个不是机器学习常见的算法分类?A. 监督学习B. 非监督学习C. 强化学习D. 自然语言处理答案:D2. 机器学习中的回归任务是指:A. 分类问题B. 预测数值问题C. 聚类问题D. 强化学习问题答案:B3. 以下哪个算法适用于文本分类任务?A. K均值算法B. 支持向量机算法C. 决策树算法D. 随机森林算法答案:B4. 在机器学习中,过拟合问题可以通过以下方法解决:A. 增加训练数据B. 减少模型复杂度C. 使用正则化技术D. 所有选项都适用答案:D5. 以下哪个评估指标适用于非平衡数据集的分类任务?A. 准确率B. 精确率C. 召回率D. F1-score答案:D二、填空题1. 在机器学习中,模型的训练数据被称为________。
答案:训练集2. 机器学习中常用的特征选择方法有________和________。
答案:过滤法,包装法3. 机器学习中,用于评估模型性能的常用方法是________。
答案:交叉验证4. 以下是监督学习算法的例子:________和________。
答案:决策树,随机森林5. 机器学习中常用的集成学习方法有________和________。
答案:Bagging,Boosting三、解答题1. 请简要说明机器学习中的监督学习和非监督学习的区别。
答:监督学习是指通过已有的标记数据集来训练模型,从而能够根据输入数据进行预测或分类。
而非监督学习则是指在没有标记的数据集中寻找数据的结构和模式,通过聚类和降维等技术进行数据分析。
监督学习需要有标签的数据作为输入和输出的对应关系,而非监督学习则不需要。
2. 请解释机器学习中的过拟合问题,并提供解决方法。
答:过拟合是指机器学习模型在训练集上表现良好,但在新的数据上表现较差的问题。
过拟合的原因是模型过于复杂,过度拟合了训练集中的噪音或细节。
解决过拟合问题的方法包括增加训练数据以减少过拟合的可能性、减少模型复杂度以避免过度拟合、使用正则化技术对模型参数进行约束等。
人工智能机器学习技术章节习题及答案期末考试试卷题库及答案 (5)
1.什么是推理,请从多种角度阐述推理?(1)推理:按照某种策略从已有事实与知识推出结论地过程。
(2)正向推理正向推理(事实驱动推理)是由已知事实出发向结论方向地推理。
基本思想是:系统根据用户提供地初始事实,在知识库中搜索能与之匹配地规则即当前可用地规则,构成可适用地规则集RS,然后按某种冲突解决策略从RS 中选择一条知识进行推理,并将推出地结论作为中间结果加入到数据库DB中作为下一步推理地事实,在此之后,再在知识库中选择可适用地知识进行推理,如此重复进行这一过程,直到得出最终结论或者知识库中没有可适用地知识为止。
正向推理简单,易实现,但目地性不强,效率低。
需求用启发性知识解除冲突并控制中间结果地选取,其中包含必要地回溯。
由于不能反推,系统地解释功能受到影响。
(3)反向推理反向推理是以某个假设目标作为出发点地一种推理,又称为目标驱动推理或逆向推理。
反向推理地基本思想是:首先提出一个假设目标,然后由此出发,进一步寻找支持该假设地证据,若所需地证据都能找到,则该假设成立,推理成功;若无法找到支持该假设地所有证据,则说明此假设不成立,需求另作新地假设。
与正向推理相比,反向推理地主要优点是不必使用与目标无关地知识,目地性强,同时它还有利于向用户提供解释。
反向推理地缺点是在选择初始目标时具有很大地盲目性,若假设不正确,就有可能要多次提出假设,影响了系统地效率。
反向推理比较适合结论单一或直接提出结论要求证实地系统。
(4)推理方式分类演绎推理,归纳推理,默认推理确定性推理,不精确推理单调推理,非单调推理启发式推理,非启发式推理2.什么是逆向推理?它地基本过程是什么?解:逆向推理是以某个假设目标作为出发点地推理方法过程:(1)将问题地初始证据与要求证地目标(称为假设)分别放入综合数据库与假设集;(2)从假设集中选出一个假设,检查该假设是否在综合数据库中,若在,则该假设成立。
此时,若假设集为空,则成功退出。
否则,扔执行(2)。
机器学习与人工智能(聚类分析)习题与答案
一、填空题1.EM算法中,E代表期望,M代表()。
正确答案:最大化2.无监督学习中除了聚类,另一种是()。
正确答案:建模3.我们将一个数据可以属于多个类(概率)的聚类称作()。
正确答案:软聚类二、判断题1.聚类算法中的谱聚类算法是一种分层算法。
正确答案:×解析:聚类算法中的谱聚类算法是一种扁平算法。
2.两个向量之间的余弦距离等于1减这两个向量的余弦相似度。
正确答案:√3.K-均值++算法能够克服最远点不能处理离群值的问题。
正确答案:√4.K-means和EM聚类之间的主要区别之一是EM聚类是一种“软”聚类算法。
正确答案:√5.监督学习的训练集时有标签的数据。
正确答案:√6.在文本聚类中,欧氏距离是比较适合的。
正确答案:×三、单选题1.以下哪些方法可以确定K-均值算法已经收敛?()A.划分不再改变B.聚类中心不再改变C.固定次数的迭代D.以上三种均是正确答案:D2.以下哪些算法可以处理非高斯数据?()A.K-means算法B.EM算法C.谱聚类算法D.以上三种算法都可以正确答案:C四、多选题1、无监督学习可以应用于哪些方面?()A.图像压缩B.生物信息学:学习基因组C.客户细分(即分组)D.学习没有任何标签的聚类/群组正确答案:A、B、C、D2、以下哪些选项是K-均值聚类面临的问题?()A.K的选择具有挑战性B.硬聚类并不总是正确的C.贪婪算法存在的问题D.关于数据的球形假设(到聚类中心的距离)正确答案:A、B、C、D3、聚类可以应用于哪些方面?()A.基因表达数据的研究B.面部聚类C.搜索结果聚类D.新闻搜索正确答案:A、B、C、D4、在K-均值算法中,以下哪些方法可以用于随机种子的选择?()A.随机选择数据作为中心B.空间中的随机位置作为中心C.尝试多个初始起点D.使用另一个聚类方法的结果进行初始化正确答案:A、B、C、D5、EM算法可以应用于以下哪些方面?()A.学习贝叶斯网络的概率B.EM-聚类C.训练HMMD.学习微信好友网络正确答案:A、B、C、D。
模式识别与机器学习:模式识别基本概念习题与答案
一、单选题
1、聚类技术属于()。
A.超监督式学习
B.无监督式学习
C.半监督式学习
D.有监督式学习
正确答案:B
2、泛化误差指的是()。
A.训练误差
B.测量误差
C.学习误差
D.测试误差
正确答案:D
二、多选题
1、以下函数为判别函数的是()。
A.min函数
B.sum函数
C.sign函数
D.max函数
正确答案:A、C、D
三、判断题
1、特征的个数越多,模式识别的效果越准确。
()
正确答案:×
2、无监督式学习算法的难度低于监督式学习算法。
()
正确答案:×
3、监督式学习指的是训练样本及输出真值都给定的机器学习算法。
()
正确答案:√
4、“过拟合”只在监督学习中出现,在非监督学习中,没有“过拟合”。
()
正确答案:×
5、对于k折交叉验证,k越大不一定越好,选择大的k会加大评估时间。
()
正确答案:√。
机器学习SVM习题集
SVM1.判断题(1) 在SVM训练好后,我们可以抛弃非支持向量的样本点,仍然可以对新样本进行分类。
(T)(2) SVM对噪声(如来自其他分布的噪声样本)鲁棒。
(F)2.简答题现有一个点能被正确分类且远离决策边界。
如果将该点加入到训练集,为什么SVM的决策边界不受其影响,而已经学好的logistic回归会受影响?答:因为SVM采用的是hinge loss,当样本点被正确分类且远离决策边界时,SVM给该样本的权重为0,所以加入该样本决策边界不受影响。
而logistic回归采用的是log损失,还是会给该样本一个小小的权重。
3.产生式模型和判别式模型。
(30分,每小题10分)图2:训练集、最大间隔线性分类器和支持向量(粗体)(1)图中采用留一交叉验证得到的最大间隔分类器的预测误差的估计是多少(用样本数表示即可)?从图中可以看出,去除任意点都不影响SVM的分界面。
而保留所有样本时,所有的样本点都能被正确分类,因此LOOCV的误差估计为0。
(2)说法“最小结构风险保证会找到最低决策误差的模型”是否正确,并说明理由。
(F)最小结构风险(SRM)只能保证在所有考虑的模型中找到期望风险上界最小的模型。
(3)若采用等协方差的高斯模型分别表示上述两个类别样本的分布,则分类器的VC维是多少?为什么?等协方差的高斯模型的决策边界为线性,因为其VC维维D+1。
题中D=2.4、SVM 分类。
(第1~5题各4分,第6题5分,共25分)下图为采用不同核函数或不同的松弛因子得到的SVM 决策边界。
但粗心的实验者忘记记录每个图形对应的模型和参数了。
请你帮忙给下面每个模型标出正确的图形。
(1)、211min , s.t.2Ni i C ξ=⎛⎫+ ⎪⎝⎭∑w()00, 1, 1,....,, T i i i y w i N ξξ≥+≥-=w x其中0.1C =。
线性分类面,C 较小,正则较大,||w||较小,Margin 较大, 支持向量较多(c )(2)、211min , s.t.2Ni i C ξ=⎛⎫+ ⎪⎝⎭∑w()00, 1, 1,....,, T i i i y w i N ξξ≥+≥-=w x其中1C =。
《机器学习》西瓜书习题第4章
《机器学习》西⽠书习题第4章习题4.1 试证明对于不含冲突数据 (即特征向量完全相同但标记不同) 的训练集, 必存在与训练集⼀致 (即训练误差为 0)的决策树. 既然每个标记不同的数据特征向量都不同, 只要树的每⼀条 (从根解点到⼀个叶节点算⼀条) 枝⼲代表⼀种向量, 这个决策树就与训练集⼀致.4.2 试析使⽤ "最⼩训练误差" 作为决策树划分选择准则的缺陷. 4.1 说明了如果数据不冲突, 可以完全拟合数据集, 这正是使⽤ "最⼩训练误差" 作为决策树划分选择准则的结果. ⽽这是绝对的过拟合.4.3 试编程实现基于信息熵进⾏划分选择的决策树算法, 并为表 4.3 中数据⽣成⼀棵决策树.4.4 试编程实现基于基尼指数进⾏划分选择的决策树算法, 为表 4.2 中数据⽣成预剪枝、后剪枝决策树, 并与未剪枝决策树进⾏⽐较.4.5 试编程实现基于対率回归进⾏划分选择的决策树算法, 并为表 4.3 中数据⽣成⼀棵决策树.4.6 试选择 4 个 UCI 数据集, 对上述 3 种算法所产⽣的未剪枝、预剪枝、后剪枝决策树进⾏实验⽐较, 并进⾏适当的统计显著性检验.4.7 图 4.2 是⼀种递归算法, 若⾯临巨量数据, 则决策树的层数会很深, 使⽤递归⽅法易导致 "栈" 溢出. 试使⽤ "队列" 数据结构, 以参数 MaxDepth 控制树的最⼤深度, 写出与图 4.2 等价、但不使⽤递归的决策树⽣成算法. 伪代码:4.8* 试将决策树⽣成的深度优先搜索过程修改为⼴度优先搜索, 以参数 MaxNode 控制树的最⼤结点数, 将题 4.7 中基于队列的决策树算法进⾏改写. 对⽐题 4.7 中的算法, 试析哪种⽅式更易于控制决策树所需存储不超出内存. 4.7 其实已经是⼴度优先搜索了... 防⽌内存溢出就是要让深度优先搜索不要递归过深, ⼴度优先搜索不要太多结点在同⼀个深度, 因此如果树⽐较长, 建议⽤⼴度优先搜索, 如果树⽐较宽, 建议⽤深度优先搜索.4.9 试将 4.4.2 节对缺失值的处理机制推⼴到基尼指数的计算中去.ρ=∑x ∈˜D w x∑x ∈D w x ˜p k =∑x ∈˜D k w x∑x ∈˜D w x (1⩽\tilde{r}_v = \frac{\sum_{\boldsymbol{x}\in \tilde{D}^v}w_{\boldsymbol{x}}}{\sum_{\boldsymbol{x}\in \tilde{D}}w_{\boldsymbol{x}}}\quad{(1 \leqslant v \leqslant V)} w_{\boldsymbol{x}} 是权值, 初始化为 1 . 那么推⼴后的基尼指数为:# 输⼊: 训练集 D# 属性集 A array[0] = [D, A]for D, A in array:⽣成节点node;if D 中样本全属于同⼀类别C:将node 标记为C 类叶节点continueelif A = 空 or D 中样本在A 上取值相同:将node 标记为叶节点, 其类别标记为D 中样本数最多的类continue从A 中选择最优划分属性afor a_v in a 每个取值:为node ⽣成⼀个分⽀, 令D_v 表⽰D 在a 上取值为a_v 的样本⼦集if D_v == null:将分⽀节点标记为叶节点, 其类别标记为D 中样本最多的类continueelifarray.append([D_v, A \ {a}])# 输出: 以node 为根节点的⼀棵决策树Loading [MathJax]/jax/element/mml/optable/SuppMathOperators.js\mathrm{Gini}(D) = 1 - \sum_{k = 1}^{| \mathcal{Y}|}\tilde{p}_k^2\mathrm{Gini\_index}(D, a) = \rho\sum_{v = 1}^{V}\tilde{r}_v\mathrm{Gini}(\tilde{D}^v) 同时如果按某属性a划分, 那么某个缺失该属性的样本按照总体属性⽐例改变权值进⼊下⼀结点 (见书\mathrm{P}88).4.10 从⽹上下载或⾃⼰编程实现任意⼀种多变量决策树算法, 并观察其在西⽠数据集3.0上产⽣的结果.。
人工智能英语(进阶级):人工智能与机器学习习题与答案
一、单选题1. Machine Learning is an application _____.A. that used to be an academic discipline of AI in early daysB. aimed to guide the computers to learn and adjust actions under human assistanceC. to provide AI with the capability to learn by itself and from experienceD. with observations on data to make a better decision at the moment正确答案:C2. How can Machine Learning deal with massive information more effectively? _____A. By using more time and resources in training it properly.B. By analyzing massive quantities of data.C. By combining itself with AI and cognitive technologies.D. By identifying results of profitable opportunities or dangerous risks.正确答案:C3. According to the passage, Machine Learning has been used in some fields EXCEPT _____.A. in medical diagnosisB. in film recommendationC. in self-driving vehiclesD. in financial crisis prediction正确答案:A4. What may be the reason(s) that Machine Learning programs fail to deliver expected results? _____A. Lack of visiting on appropriate data.B. Wrong choices of tasks and algorithms.C. Privacy problems.D. All of above.正确答案:D5. What can we learn in the last paragraph? _____A. A Machine Learning system can predict the needs of new customer groups that are not represented in the training data.B. Data biases may occur when Machine Learning is trained on man-made data.C. Google photos can now recognize real gorillas.D. It takes a short time to use Machine Learning effectively in every field. 正确答案:B6. One advantage of having _____limbs is that you can upgrade them.A. crucialB. financialC. influentialD. artificial正确答案:D7. I don’t want to _____any bad habits from those people.B. get upC. pick upD. give up正确答案:C8. Staff wore name _____ and called inmates by their first names.A. tagsB. brandsC. signsD. images正确答案:A9. Make a list of your child’s toys and then ______ them as sociable or antisocial.A. modifyB. categorizeC. representD. adjust正确答案:B10. If you _______ a solution to a problem or the reason for something, you succeed in solving it or understanding it.A. watch outB. put outD. figure out 正确答案:D。
机器学习期末测试练习题1
1、给人脸打上标签再让模型进行学习训练的方法,属于()A.强化学习B.半监督学习C.监督学习D.无监督学习正确答案:C2、机器学习进行的第一步是()A.数据收集B.特征提取C.交叉验证D.模型训练正确答案:B3、一般来说,在机器学习中,用计算机处理一幅的图像,维度是:A.上万维B.二维C.三维D.一维正确答案:A4、在讲解“没有免费午餐定理”的时候,我们假设以上每一种情况出现的概率相同,请问这样的假设是基于如下哪种经验?A.实践经验B.无经验C.常识经验D.学习经验正确答案:B二、多选题1、在本课程中,我们把机器学习分成了哪几类?A.自监督学习B.传统监督学习C.无监督学习D.半监督学习正确答案:B、C、D2、以下哪些算法是非显著式编程?A.编程实现扫地机器人的路径规划B.编程判断医疗CT片中的病变区域C.编程统计一个地区的GDPD.编程求解棋盘上的八皇后问题正确答案:A、B3、下面哪几种机器学习的分类,完全不需要人工标注数据?A.半监督学习B.强化学习C.无监督学习D.监督学习正确答案:B、C4、以下哪些算法是无监督学习算法?A.空间聚类B.主成分分析C.支持向量机D.Q-LEARNING正确答案:A、B5、以下哪些算法是监督学习算法?A.人工神经网络B.高斯混合模型概率密度估计C.ACTOR-CRITIC 算法D.支持向量机正确答案:A、D6、机器学习中E、T、P分别表示:A.Performance MeasureB.TaskC.PerformanceD.Experience正确答案:A、B、D。
