大数据技术及应用题库
《大数据技术原理与应用(第3版)》期末复习题库(含答案)
第一章大数据概述单选题1、第一次信息化浪潮主要解决什么问题?B(A)信息传输(B)信息处理(C)信息爆炸(D)信息转换2、下面哪个选项属于大数据技术的“数据存储和管理”技术层面的功能?A(A)利用分布式文件系统、数据仓库、关系数据库等实现对结构化、半结构化和非结构化海量数据的存储和管理(B)利用分布式并行编程模型和计算框架,结合机器学习和数据挖掘算法,实现对海量数据的处理和分析(C)构建隐私数据保护体系和数据安全体系,有效保护个人隐私和数据安全(D)把实时采集的数据作为流计算系统的输入,进行实时处理分析3、在大数据的计算模式中,流计算解决的是什么问题?D(A)针对大规模数据的批量处理(B)针对大规模图结构数据的处理(C)大规模数据的存储管理和查询分析(D)针对流数据的实时计算4、大数据产业指什么?A(A)一切与支撑大数据组织管理和价值发现相关的企业经济活动的集合(B)提供智能交通、智慧医疗、智能物流、智能电网等行业应用的企业(C)提供数据分享平台、数据分析平台、数据租售平台等服务的企业(D)提供分布式计算、数据挖掘、统计分析等服务的各类企业5、下列哪一个不属于大数据产业的产业链环节?A(A)数据循环层(B)数据源层(C)数据分析层(D)数据应用层6、下列哪一个不属于第三次信息化浪潮中新兴的技术?A(A)互联网(B)云计算(C)大数据(D)物联网7、云计算平台层(PaaS)指的是什么?A(A)操作系统和围绕特定应用的必需的服务(B)将基础设施(计算资源和存储)作为服务出租(C)从一个集中的系统部署软件,使之在一台本地计算机上(或从云中远程地)运行的一个模型(D)提供硬件、软件、网络等基础设施以及提供咨询、规划和系统集成服务8、下面关于云计算数据中心的描述正确的是:A(A)数据中心是云计算的重要载体,为各种平台和应用提供运行支撑环境(B)数据中心就是放在企业内部的一台中心服务器(C)每个企业都需要建设一个云计算数据中心(D)数据中心不需要网络带宽的支撑9、下列哪个不属于物联网的应用?D(A)智能物流(B)智能安防(C)环保监测(D)数据清洗10、下列哪项不属于大数据的发展历程?D(A)成熟期(B)萌芽期(C)大规模应用期(D)迷茫期多选题1、第三次信息化浪潮的标志是哪些技术的兴起?BCD(A)个人计算机(B)物联网(C)云计算(D)大数据2、信息科技为大数据时代提供哪些技术支撑?ABC(A)存储设备容量不断增加(B)网络带宽不断增加(C)CPU 处理能力大幅提升(D)数据量不断增大3、大数据具有哪些特点?ABCD(A)数据的“大量化”(B)数据的“快速化”(C)数据的“多样化”(D)数据的“价值密度比较低”4、下面哪个属于大数据的应用领域?ABCD(A)智能医疗研发(B)监控身体情况(C)实时掌握交通状况(D)金融交易5、大数据的两个核心技术是什么?AC(A)分布式存储(B)分布式应用(C)分布式处理(D)集中式存储6、云计算关键技术包括什么?ABCD(A)分布式存储(B)虚拟化(C)分布式计算(D)多租户7、云计算的服务模式和类型主要包括哪三类?ABC(A)软件即服务(SaaS)(B)平台即服务(PaaS)(C)基础设施即服务(IaaS)(D)数据采集即服务(DaaS)8、物联网主要由下列哪些部分组成的?ABCD(A)应用层(B)处理层(C)感知层(D)网络层9、物联网的关键技术包括哪些?ABC(A)识别和感知技术(B)网络与通信技术(C)数据挖掘与融合技术(D)信息处理一体化技术10、大数据对社会发展的影响有哪些?ABC(A)大数据成为一种新的决策方式(B)大数据应用促进信息技术与各行业的深度融合(C)大数据开发推动新技术和新应用的不断涌现(D)大数据对社会发展没有产生积极影响第二章大数据处理架构Hadoop单选题1、下列哪个不属于Hadoop的特性?A(A)成本高(B)高可靠性(C)高容错性(D)运行在Linux平台上2、Hadoop框架中最核心的设计是什么?A(A)为海量数据提供存储的HDFS和对数据进行计算的MapReduce(B)提供整个HDFS文件系统的NameSpace(命名空间)管理、块管理等所有服务(C)Hadoop不仅可以运行在企业内部的集群中,也可以运行在云计算环境中(D)Hadoop被视为事实上的大数据处理标准3、在一个基本的Hadoop集群中,DataNode主要负责什么?D(A)负责执行由JobTracker指派的任务(B)协调数据计算任务(C)负责协调集群中的数据存储(D)存储被拆分的数据块4、Hadoop最初是由谁创建的?B(A)Lucene(B)Doug Cutting(C)Apache(D)MapReduce5、下列哪一个不属于Hadoop的大数据层的功能?C(A)数据挖掘(B)离线分析(C)实时计算(D)BI分析6、在一个基本的Hadoop集群中,SecondaryNameNode主要负责什么?A(A)帮助NameNode收集文件系统运行的状态信息(B)负责执行由JobTracker指派的任务(C)协调数据计算任务(D)负责协调集群中的数据存储7、下面哪一项不是Hadoop的特性?B(A)可扩展性高(B)只支持少数几种编程语言(C)成本低(D)能在linux上运行8、在Hadoop项目结构中,HDFS指的是什么?A(A)分布式文件系统(B)分布式并行编程模型(C)资源管理和调度器(D)Hadoop上的数据仓库9、在Hadoop项目结构中,MapReduce指的是什么?A(A)分布式并行编程模型(B)流计算框架(C)Hadoop上的工作流管理系统(D)提供分布式协调一致性服务10、下面哪个不是Hadoop1.0的组件:(C)(A)HDFS(B)MapReduce(C)YARN(D)NameNode和DataNode多选题1、Hadoop的特性包括哪些?ABCD(A)高可扩展性(B)支持多种编程语言(C)成本低(D)运行在Linux平台上2、下面哪个是Hadoop2.0的组件?AD(A)ResourceManager(B)JobTracker(C)TaskTracker(D)NodeManager3、一个基本的Hadoop集群中的节点主要包括什么?ABCD(A)DataNode:存储被拆分的数据块(B)JobTracker:协调数据计算任务(C)TaskTracker:负责执行由JobTracker指派的任务(D)SecondaryNameNode:帮助NameNode收集文件系统运行的状态信息4、下列关于Hadoop的描述,哪些是正确的?ABCD(A)为用户提供了系统底层细节透明的分布式基础架构(B)具有很好的跨平台特性(C)可以部署在廉价的计算机集群中(D)曾经被公认为行业大数据标准开源软件5、Hadoop集群的整体性能主要受到什么因素影响?ABCD(A)CPU性能(B)内存(C)网络(D)存储容量6、下列关于Hadoop的描述,哪些是错误的?AB(A)只能支持一种编程语言(B)具有较差的跨平台特性(C)可以部署在廉价的计算机集群中(D)曾经被公认为行业大数据标准开源软件7、下列哪一项不属于Hadoop的特性?AB(A)较低可扩展性(B)只支持java语言(C)成本低(D)运行在Linux平台上第三章分布式文件系统HDFS单选题1、分布式文件系统指的是什么?A(A)把文件分布存储到多个计算机节点上,成千上万的计算机节点构成计算机集群(B)用于在Hadoop与传统数据库之间进行数据传递(C)一个高可用的,高可靠的,分布式的海量日志采集、聚合和传输的系统(D)一种高吞吐量的分布式发布订阅消息系统,可以处理消费者规模的网站中的所有动作流数据2、下面哪一项不属于计算机集群中的节点?B(A)主节点(Master Node)(B)源节点(SourceNode)(C)名称结点(NameNode)(D)从节点(Slave Node)3、在HDFS中,默认一个块多大?A(A)64MB(B)32KB(C)128KB(D)16KB4、下列哪一项不属于HDFS采用抽象的块概念带来的好处?C(A)简化系统设计(B)支持大规模文件存储(C)强大的跨平台兼容性(D)适合数据备份5、在HDFS中,NameNode的主要功能是什么?D(A)维护了block id 到datanode本地文件的映射关系(B)存储文件内容(C)文件内存保存在磁盘中(D)存储元数据6、下面对FsImage的描述,哪个是错误的?D(A)FsImage文件没有记录每个块存储在哪个数据节点(B)FsImage文件包含文件系统中所有目录和文件inode的序列化形式(C)FsImage用于维护文件系统树以及文件树中所有的文件和文件夹的元数据(D)FsImage文件记录了每个块具体被存储在哪个数据节点7、下面对SecondaryNameNode第二名称节点的描述,哪个是错误的?A(A)SecondaryNameNode一般是并行运行在多台机器上(B)它是用来保存名称节点中对HDFS元数据信息的备份,并减少名称节点重启的时间(C)SecondaryNameNode通过HTTPGET方式从NameNode上获取到FsImage和EditLog文件,并下载到本地的相应目录下(D)SecondaryNameNode是HDFS架构中的一个组成部分8、HDFS采用了什么模型?B(A)分层模型(B)主从结构模型(C)管道-过滤器模型(D)点对点模型9、在Hadoop项目结构中,HDFS指的是什么?A(A)分布式文件系统(B)流数据读写(C)资源管理和调度器(D)Hadoop上的数据仓库10、下列关于HDFS的描述,哪个不正确?D(A)HDFS还采用了相应的数据存放、数据读取和数据复制策略,来提升系统整体读写响应性能(B)HDFS采用了主从(Master/Slave)结构模型(C)HDFS采用了冗余数据存储,增强了数据可靠性(D)HDFS采用块的概念,使得系统的设计变得更加复杂多选题1、HDFS要实现以下哪几个目标?ABC(A)兼容廉价的硬件设备(B)流数据读写(C)大数据集(D)复杂的文件模型2、HDFS特殊的设计,在实现优良特性的同时,也使得自身具有一些应用局限性,主要包括以下哪几个方面?BCD(A)较差的跨平台兼容性(B)无法高效存储大量小文件(C)不支持多用户写入及任意修改文件(D)不适合低延迟数据访问3、HDFS采用抽象的块概念可以带来以下哪几个明显的好处?ACD(A)支持大规模文件存储(B)支持小规模文件存储(C)适合数据备份(D)简化系统设计4、在HDFS中,名称节点(NameNode)主要保存了哪些核心的数据结构?AD(A)FsImage(B)DN8(C)Block(D)EditLog5、数据节点(DataNode)的主要功能包括哪些?ABC(A)负责数据的存储和读取(B)根据客户端或者是名称节点的调度来进行数据的存储和检索(C)向名称节点定期发送自己所存储的块的列表(D)用来保存名称节点中对HDFS元数据信息的备份,并减少名称节点重启的时间6、HDFS的命名空间包含什么?BCD(A)磁盘(B)文件(C)块(D)目录7、下列对于客服端的描述,哪些是正确的?ABCD(A)客户端是用户操作HDFS最常用的方式,HDFS在部署时都提供了客户端(B)HDFS客户端是一个库,暴露了HDFS文件系统接口(C)严格来说,客户端并不算是HDFS的一部分(D)客户端可以支持打开、读取、写入等常见的操作8、HDFS只设置唯一一个名称节点,这样做虽然大大简化了系统设计,但也带来了哪些明显的局限性?ABCD(A)命名空间的限制(B)性能的瓶颈(C)隔离问题(D)集群的可用性9、HDFS数据块多副本存储具备以下哪些优点?ABC(A)加快数据传输速度(B)容易检查数据错误(C)保证数据可靠性(D)适合多平台上运行10、HDFS具有较高的容错性,设计了哪些相应的机制检测数据错误和进行自动恢复?BCD(A)数据源太大(B)数据节点出错(C)数据出错(D)名称节点出错第四章分布式数据库HBase单选题1、下列关于BigTable的描述,哪个是错误的?A(A)爬虫持续不断地抓取新页面,这些页面每隔一段时间地存储到BigTable里(B)BigTable是一个分布式存储系统(C)BigTable起初用于解决典型的互联网搜索问题(D)网络搜索应用查询建立好的索引,从BigTable得到网页2、下列选项中,关于HBase和BigTable的底层技术对应关系,哪个是错误的?B(A)GFS与HDFS相对应(B)GFS与Zookeeper相对应(C)MapReduce与Hadoop MapReduce相对应(D)Chubby与Zookeeper相对应3、在HBase中,关于数据操作的描述,下列哪一项是错误的?C(A)HBase采用了更加简单的数据模型,它把数据存储为未经解释的字符串(B)HBase操作不存在复杂的表与表之间的关系(C)HBase不支持修改操作(D)HBase在设计上就避免了复杂的表和表之间的关系4、在HBase访问接口中,Pig主要用在哪个场合?D(A)适合Hadoop MapReduce作业并行批处理HBase表数据(B)适合HBase管理使用(C)适合其他异构系统在线访问HBase表数据(D)适合做数据统计5、HBase中需要根据某些因素来确定一个单元格,这些因素可以视为一个“四维坐标”,下面哪个不属于“四维坐标”?B(A)行键(B)关键字(C)列族(D)时间戳6、关于HBase的三层结构中各层次的名称和作用的说法,哪个是错误的?A(A)Zookeeper文件记录了用户数据表的Region位置信息(B)-ROOT-表记录了.META.表的Region位置信息(C).META.表保存了HBase中所有用户数据表的Region位置信息(D)Zookeeper文件记录了-ROOT-表的位置信息7、下面关于主服务器Master主要负责表和Region的管理工作的描述,哪个是错误的?D(A)在Region分裂或合并后,负责重新调整Region的分布(B)对发生故障失效的Region服务器上的Region进行迁移(C)管理用户对表的增加、删除、修改、查询等操作(D)不支持不同Region服务器之间的负载均衡8、HBase只有一个针对行健的索引,如果要访问HBase表中的行,下面哪种方式是不可行的?B(A)通过单个行健访问(B)通过时间戳访问(C)通过一个行健的区间来访问(D)全表扫描9、下面关于Region的说法,哪个是错误的?C(A)同一个Region不会被分拆到多个Region服务器(B)为了加快访问速度,.META.表的全部Region都会被保存在内存中(C)一个-ROOT-表可以有多个Region(D)为了加速寻址,客户端会缓存位置信息,同时,需要解决缓存失效问题多选题1、关系数据库已经流行很多年,并且Hadoop已经有了HDFS和MapReduce,为什么需要HBase?ABCD(A)Hadoop可以很好地解决大规模数据的离线批量处理问题,但是,受限于Hadoop MapReduce编程框架的高延迟数据处理机制,使得Hadoop无法满足大规模数据实时处理应用的需求上(B)HDFS面向批量访问模式,不是随机访问模式(C)传统的通用关系型数据库无法应对在数据规模剧增时导致的系统扩展性和性能问题(D)传统关系数据库在数据结构变化时一般需要停机维护;空列浪费存储空间2、HBase与传统的关系数据库的区别主要体现在以下哪几个方面?ABCD(A)数据类型(B)数据操作(C)存储模式(D)数据维护3、HBase访问接口类型包括哪些?ABCD(A)Native Java API(B)HBase Shell(C)Thrift Gateway(D)REST Gateway4、下列关于数据模型的描述,哪些是正确的?ABCD(A)HBase采用表来组织数据,表由行和列组成,列划分为若干个列族(B)每个HBase表都由若干行组成,每个行由行键(row key)来标识(C)列族里的数据通过列限定符(或列)来定位(D)每个单元格都保存着同一份数据的多个版本,这些版本采用时间戳进行索引5、HBase的实现包括哪三个主要的功能组件?ABC(A)库函数:链接到每个客户端(B)一个Master主服务器(C)许多个Region服务器(D)廉价的计算机集群6、HBase的三层结构中,三层指的是哪三层?ABC(A)Zookeeper文件(B)-ROOT-表(C).META.表(D)数据类型7、以下哪些软件可以对HBase进行性能监视?ABCD(A)Master-status(自带)(B)Ganglia(C)OpenTSDB(D)Ambari8、Zookeeper是一个很好的集群管理工具,被大量用于分布式计算,它主要提供什么服务?ABC(A)配置维护(B)域名服务(C)分布式同步(D)负载均衡服务9、下列关于Region服务器工作原理的描述,哪些是正确的?ABCD(A)每个Region服务器都有一个自己的HLog 文件(B)每次刷写都生成一个新的StoreFile,数量太多,影响查找速度(C)合并操作比较耗费资源,只有数量达到一个阈值才启动合并(D)Store是Region服务器的核心10、下列关于HLog工作原理的描述,哪些是正确的?ABCD(A)分布式环境必须要考虑系统出错。
大数据技术与应用考试 选择题 63题
1. 大数据的4V特征不包括以下哪一项?A. VolumeB. VelocityC. VarietyD. Visibility2. Hadoop生态系统中,用于存储结构化和半结构化数据的组件是?A. HDFSB. HiveC. HBaseD. Pig3. 在数据仓库中,ETL过程指的是什么?A. Extract, Transform, LoadB. Encrypt, Transfer, LoadC. Extract, Transfer, LoadD. Encrypt, Transform, Load4. 以下哪个不是NoSQL数据库的类型?A. Key-ValueB. Column-FamilyC. DocumentD. Relational5. 数据挖掘中的分类算法不包括以下哪一项?A. Decision TreesB. Neural NetworksC. ClusteringD. Support Vector Machines6. 在Hadoop中,MapReduce的主要作用是什么?A. 数据存储B. 数据处理C. 数据查询D. 数据可视化7. 以下哪个工具不是用于大数据分析的?A. RB. PythonC. ExcelD. Spark8. 在数据预处理中,数据清洗的主要目的是什么?A. 增加数据量B. 减少数据量C. 提高数据质量D. 提高数据速度9. 以下哪个不是大数据处理框架?A. FlinkB. KafkaC. StormD. Docker10. 在数据可视化中,热力图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势D. 数据密度11. 以下哪个是大数据安全的关键技术?A. 数据加密B. 数据压缩C. 数据存储D. 数据传输12. 在数据分析中,OLAP是什么的缩写?A. Online Analytical ProcessingB. Online Application ProcessingC. Offline Analytical ProcessingD. Offline Application Processing13. 以下哪个不是数据仓库的特点?A. 面向主题B. 集成性C. 时变性D. 实时性14. 在数据挖掘中,关联规则挖掘主要用于发现什么?A. 数据模式B. 数据异常C. 数据关系D. 数据趋势15. 以下哪个不是大数据的应用领域?A. 金融B. 医疗C. 教育D. 娱乐16. 在Hadoop中,YARN的主要作用是什么?A. 数据存储B. 资源管理C. 数据处理D. 数据查询17. 以下哪个不是数据湖的特点?A. 存储原始数据B. 存储结构化数据C. 灵活的数据结构D. 支持多种数据类型18. 在数据分析中,数据集市是什么?A. 数据仓库的子集B. 数据仓库的超集C. 独立的数据仓库D. 数据仓库的备份19. 以下哪个不是数据治理的关键组成部分?A. 数据质量B. 数据安全C. 数据存储D. 数据政策20. 在数据挖掘中,聚类算法主要用于什么?A. 数据分类B. 数据分组C. 数据预测D. 数据关联21. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印22. 在数据可视化中,散点图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势D. 数据密度23. 以下哪个不是大数据分析的步骤?A. 数据收集B. 数据清洗C. 数据存储D. 数据分析24. 在数据仓库中,维度表和事实表的关系是什么?A. 一对一B. 一对多C. 多对一D. 多对多25. 以下哪个不是数据挖掘的应用场景?A. 市场篮分析B. 客户细分C. 风险评估D. 数据备份26. 在Hadoop中,HDFS的主要作用是什么?A. 数据存储B. 数据处理C. 数据查询D. 数据可视化27. 以下哪个不是数据湖的优势?A. 存储原始数据B. 灵活的数据结构C. 支持多种数据类型D. 实时数据处理28. 在数据分析中,数据立方体是什么?A. 数据仓库的子集B. 数据仓库的超集C. 数据仓库的备份D. 数据仓库的多维数据模型29. 以下哪个不是数据治理的目标?A. 提高数据质量B. 确保数据安全C. 提高数据速度D. 确保数据合规30. 在数据挖掘中,异常检测主要用于发现什么?A. 数据模式B. 数据异常C. 数据关系D. 数据趋势31. 以下哪个不是大数据的应用优势?A. 提高决策效率B. 降低成本C. 提高数据质量D. 提高服务质量32. 在Hadoop中,MapReduce的主要优势是什么?A. 数据存储B. 数据处理C. 数据查询D. 数据可视化33. 以下哪个不是数据湖的挑战?A. 数据管理B. 数据安全C. 数据处理D. 数据备份34. 在数据分析中,数据集成的目的是什么?A. 提高数据质量B. 确保数据安全C. 提高数据速度D. 确保数据合规35. 以下哪个不是数据挖掘的步骤?A. 数据收集B. 数据清洗C. 数据存储D. 数据分析36. 在数据仓库中,数据集成的关键技术是什么?A. 数据采集B. 数据存储C. 数据分析D. 数据清洗37. 以下哪个不是大数据分析的工具?A. RB. PythonC. ExcelD. Photoshop38. 在数据可视化中,折线图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势D. 数据密度39. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印40. 在数据仓库中,数据集成的关键技术是什么?A. 数据采集B. 数据存储C. 数据分析D. 数据清洗41. 以下哪个不是大数据分析的工具?A. RB. PythonC. ExcelD. Photoshop42. 在数据可视化中,折线图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势D. 数据密度43. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印44. 在数据仓库中,数据集成的关键技术是什么?A. 数据采集B. 数据存储C. 数据分析D. 数据清洗45. 以下哪个不是大数据分析的工具?A. RB. PythonC. ExcelD. Photoshop46. 在数据可视化中,折线图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势47. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印48. 在数据仓库中,数据集成的关键技术是什么?A. 数据采集B. 数据存储C. 数据分析D. 数据清洗49. 以下哪个不是大数据分析的工具?A. RB. PythonC. ExcelD. Photoshop50. 在数据可视化中,折线图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势D. 数据密度51. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印52. 在数据仓库中,数据集成的关键技术是什么?A. 数据采集B. 数据存储C. 数据分析D. 数据清洗53. 以下哪个不是大数据分析的工具?A. RB. PythonC. ExcelD. Photoshop54. 在数据可视化中,折线图主要用于展示什么?A. 数据分布C. 数据趋势D. 数据密度55. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印56. 在数据仓库中,数据集成的关键技术是什么?A. 数据采集B. 数据存储C. 数据分析D. 数据清洗57. 以下哪个不是大数据分析的工具?A. RB. PythonC. ExcelD. Photoshop58. 在数据可视化中,折线图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势D. 数据密度59. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印60. 在数据仓库中,数据集成的关键技术是什么?A. 数据采集B. 数据存储C. 数据分析D. 数据清洗61. 以下哪个不是大数据分析的工具?A. RB. PythonC. ExcelD. Photoshop62. 在数据可视化中,折线图主要用于展示什么?A. 数据分布B. 数据关系C. 数据趋势D. 数据密度63. 以下哪个不是大数据处理的关键技术?A. 数据采集B. 数据存储C. 数据分析D. 数据打印答案1. D2. B3. A4. D5. C6. B7. C8. C9. D10. D11. A12. A13. D14. C15. D16. B17. B18. A19. C20. B21. D22. A23. C24. B25. D26. A27. D28. D29. C30. B31. C32. B33. D34. A35. C36. D37. D38. C39. D40. D41. D42. C43. D44. D45. D46. C47. D48. D49. D50. C51. D52. D53. D54. C55. D56. D57. D58. C59. D60. D61. D62. C63. D。
大数据技术及应用试题库
1从大量数据中提取知识的过程通常称为(A)。
a..数据挖掘b..人工智能c..数据清洗d..数据仓库2下列论据中,能够支撑“大数据无所不能”的观点的是(A)。
A、互联网金融打破了传统的观念和行为B、大数据存在泡沫C、大数据具有非常高的成本D、个人隐私泄露与信息安全担忧3数据仓库的最终目的是(D)。
a..收集业务需求b..建立数据仓库逻辑模型c..开发数据仓库的应用分析d..为用户和业务部门提供决策支持4大数据处理技术和传统的数据挖掘技术最大的区别是(A)。
a..处理速度快(秒级定律)b..算法种类更多c..精度更高d..更加智能化5大数据的起源是(C)。
a..金融b..电信c..互联网d..公共管理6大数据不是要教机器像人一样思考。
相反,它是(A)。
a..把数学算法运用到海量的数据上来预测事情发生的可能性b..被视为人工智能的一部c..被视为一种机器学习d..预测与惩罚7人与人之间沟通信息、传递信息的技术,这指的是(D)。
a..感测技术b..微电子技术c..计算机技术d..通信技术8数据清洗的方法不包括(D)。
a..缺失值处理b..噪声数据清除c..一致性检查d..重复数据记录处理9.下列关于舍恩伯格对大数据特点的说法中,错误的是(D)A. 数据规模大B. 数据类型多样C. 数据处理速度快D. 数据价值密度高10规模巨大且复杂,用现有的数据处理工具难以获取、整理、管理以及处理的数据,这指的是(D)。
a..富数据b..贫数据c..繁数据d..大数据11 大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的。
)。
a..新一代信息技术b..新一代服务业态c..新一代技术平台d..新一代信息技术和服务业态12万维网之父是(C)A.彼得•德鲁克B. 舍恩伯格C. 蒂姆•伯纳斯一季D. 斯科特•布朗13下列演示方式中,不属于传统统计图方式的是(D)。
大数据技术与应用考试 选择题 64题
1. 大数据的“4V”特征不包括以下哪一项?A. 大量性B. 高速性C. 多样性D. 价值性2. Hadoop的核心组件包括哪些?A. HDFS和MapReduceB. HDFS和YARNC. MapReduce和YARND. HDFS、MapReduce和YARN3. 以下哪个不是NoSQL数据库的类型?A. 键值存储B. 列存储C. 文档存储D. 关系型数据库4. 在Hadoop生态系统中,用于数据仓库和数据分析的工具是?A. HiveB. HBaseC. PigD. Zookeeper5. 以下哪个工具不是用于大数据处理的?A. SparkB. FlinkC. KafkaD. MySQL6. 在数据挖掘中,K-means算法属于哪一类算法?A. 分类算法B. 聚类算法C. 关联规则算法D. 回归算法7. 以下哪个是大数据处理框架Spark的核心组件?A. RDDB. DataFrameC. DatasetD. 以上都是8. 在Hadoop中,用于管理集群资源的组件是?A. HDFSB. MapReduceC. YARND. Zookeeper9. 以下哪个是用于实时数据处理的工具?A. StormB. HiveC. PigD. Sqoop10. 在数据仓库中,用于数据抽取、转换和加载的工具是?A. ETLB. OLAPC. OLTPD. BI11. 以下哪个是大数据分析的典型应用场景?A. 社交媒体分析B. 电子商务推荐系统C. 金融风险管理D. 以上都是12. 在Spark中,用于处理结构化数据的API是?A. RDDB. DataFrameC. DatasetD. 以上都是13. 以下哪个是用于大数据存储的分布式文件系统?A. HDFSB. NFSC. CIFSD. FTP14. 在Hadoop中,用于数据处理的编程模型是?A. HDFSB. MapReduceC. YARND. Zookeeper15. 以下哪个是用于大数据实时流处理的框架?A. KafkaB. FlinkC. Spark StreamingD. 以上都是16. 在数据挖掘中,Apriori算法属于哪一类算法?A. 分类算法B. 聚类算法C. 关联规则算法D. 回归算法17. 以下哪个是用于大数据查询和分析的工具?A. HiveB. HBaseC. PigD. Zookeeper18. 在Hadoop中,用于分布式协调服务的组件是?A. HDFSB. MapReduceC. YARND. Zookeeper19. 以下哪个是用于大数据批处理的框架?A. SparkB. FlinkC. StormD. Kafka20. 在数据仓库中,用于多维数据分析的工具是?A. ETLB. OLAPC. OLTPD. BI21. 以下哪个是大数据存储的典型应用场景?A. 云存储B. 数据备份C. 数据归档D. 以上都是22. 在Spark中,用于处理非结构化数据的API是?A. RDDB. DataFrameC. DatasetD. 以上都是23. 以下哪个是用于大数据处理的分布式计算框架?A. HadoopB. SparkC. FlinkD. 以上都是24. 在Hadoop中,用于数据存储的编程模型是?A. HDFSB. MapReduceC. YARND. Zookeeper25. 以下哪个是用于大数据实时处理的工具?A. StormB. HiveC. PigD. Sqoop26. 在数据挖掘中,决策树算法属于哪一类算法?A. 分类算法B. 聚类算法C. 关联规则算法D. 回归算法27. 以下哪个是用于大数据存储和管理的工具?A. HBaseB. HiveC. PigD. Zookeeper28. 在Hadoop中,用于数据处理的分布式协调服务是?A. HDFSB. MapReduceC. YARND. Zookeeper29. 以下哪个是用于大数据处理的实时流处理框架?A. KafkaB. FlinkC. Spark StreamingD. 以上都是30. 在数据仓库中,用于数据抽取和加载的工具是?A. ETLB. OLAPC. OLTPD. BI31. 以下哪个是大数据分析的典型应用场景?A. 客户行为分析B. 市场趋势分析C. 产品推荐系统D. 以上都是32. 在Spark中,用于处理半结构化数据的API是?B. DataFrameC. DatasetD. 以上都是33. 以下哪个是用于大数据存储的分布式数据库?A. HBaseB. MySQLC. OracleD. SQL Server34. 在Hadoop中,用于数据处理的分布式文件系统是?A. HDFSB. NFSC. CIFSD. FTP35. 以下哪个是用于大数据实时处理的工具?A. StormB. HiveC. PigD. Sqoop36. 在数据挖掘中,随机森林算法属于哪一类算法?A. 分类算法B. 聚类算法C. 关联规则算法D. 回归算法37. 以下哪个是用于大数据查询和分析的工具?A. HiveB. HBaseC. PigD. Zookeeper38. 在Hadoop中,用于分布式协调服务的组件是?A. HDFSB. MapReduceC. YARND. Zookeeper39. 以下哪个是用于大数据批处理的框架?A. SparkB. FlinkC. StormD. Kafka40. 在数据仓库中,用于多维数据分析的工具是?B. OLAPC. OLTPD. BI41. 以下哪个是大数据存储的典型应用场景?A. 云存储B. 数据备份C. 数据归档D. 以上都是42. 在Spark中,用于处理非结构化数据的API是?A. RDDB. DataFrameC. DatasetD. 以上都是43. 以下哪个是用于大数据处理的分布式计算框架?A. HadoopB. SparkC. FlinkD. 以上都是44. 在Hadoop中,用于数据存储的编程模型是?A. HDFSB. MapReduceC. YARND. Zookeeper45. 以下哪个是用于大数据实时处理的工具?A. StormB. HiveC. PigD. Sqoop46. 在数据挖掘中,逻辑回归算法属于哪一类算法?A. 分类算法B. 聚类算法C. 关联规则算法D. 回归算法47. 以下哪个是用于大数据存储和管理的工具?A. HBaseB. HiveC. PigD. Zookeeper48. 在Hadoop中,用于数据处理的分布式协调服务是?A. HDFSB. MapReduceC. YARND. Zookeeper49. 以下哪个是用于大数据处理的实时流处理框架?A. KafkaB. FlinkC. Spark StreamingD. 以上都是50. 在数据仓库中,用于数据抽取和加载的工具是?A. ETLB. OLAPC. OLTPD. BI51. 以下哪个是大数据分析的典型应用场景?A. 客户行为分析B. 市场趋势分析C. 产品推荐系统D. 以上都是52. 在Spark中,用于处理半结构化数据的API是?A. RDDB. DataFrameC. DatasetD. 以上都是53. 以下哪个是用于大数据存储的分布式数据库?A. HBaseB. MySQLC. OracleD. SQL Server54. 在Hadoop中,用于数据处理的分布式文件系统是?A. HDFSB. NFSC. CIFSD. FTP55. 以下哪个是用于大数据实时处理的工具?A. StormB. HiveC. PigD. Sqoop56. 在数据挖掘中,支持向量机算法属于哪一类算法?A. 分类算法B. 聚类算法C. 关联规则算法D. 回归算法57. 以下哪个是用于大数据查询和分析的工具?A. HiveB. HBaseC. PigD. Zookeeper58. 在Hadoop中,用于分布式协调服务的组件是?A. HDFSB. MapReduceC. YARND. Zookeeper59. 以下哪个是用于大数据批处理的框架?A. SparkB. FlinkC. StormD. Kafka60. 在数据仓库中,用于多维数据分析的工具是?A. ETLB. OLAPC. OLTPD. BI61. 以下哪个是大数据存储的典型应用场景?A. 云存储B. 数据备份C. 数据归档D. 以上都是62. 在Spark中,用于处理非结构化数据的API是?A. RDDB. DataFrameC. DatasetD. 以上都是63. 以下哪个是用于大数据处理的分布式计算框架?A. HadoopB. SparkC. FlinkD. 以上都是64. 在Hadoop中,用于数据存储的编程模型是?A. HDFSB. MapReduceC. YARND. Zookeeper答案:1. D2. D3. D4. A5. D6. B7. D8. C9. A10. A11. D12. D13. A14. B15. D16. C17. A18. D19. A20. B21. D22. A23. D24. A25. A26. A27. A28. D29. D30. A31. D32. B33. A34. A35. A36. A37. A38. D39. A40. B41. D42. A43. D44. A45. A46. D47. A48. D49. D50. A51. D52. B53. A54. A55. A56. A57. A58. D59. A60. B61. D62. A63. D64. A。
大学生大数据技术原理与应用章节测验期末考试答案
大数据技术原理与应用第1章大数据概述1单选(2分)第三次信息化浪潮的标志是:A.个人电脑的普及B.云计算、大数据、物联网技术的普及C.虚拟现实技术的普及D.互联网的普及正确答案:B你选对了2单选(2分)就数据的量级而言,1PB数据是多少TB?A.2048B.1000C.512D.1024正确答案:D你选对了3单选(2分)以下关于云计算、大数据和物联网之间的关系,论述错误的是:A.云计算侧重于数据分析B.物联网可借助于云计算实现海量数据的存储C.物联网可借助于大数据实现海量数据的分析D.云计算、大数据和物联网三者紧密相关,相辅相成正确答案:A你选对了4单选(2分)以下哪个不是大数据时代新兴的技术:A.SparkB.HadoopC.HBaseD.MySQL正确答案:D你选对了5单选(2分)每种大数据产品都有特定的应用场景,以下哪个产品是用于批处理的:A.MapReduceB.DremelC.StormD.Pregel正确答案:A你选对了6单选(2分)每种大数据产品都有特定的应用场景,以下哪个产品是用于流计算的:A.GraphXB.S4C.ImpalaD.Hive正确答案:B你选对了7单选(2分)每种大数据产品都有特定的应用场景,以下哪个产品是用于图计算的:A.PregelB.StormC.CassandraD.Flume正确答案:A你选对了8单选(2分)每种大数据产品都有特定的应用场景,以下哪个产品是用于查询分析计算的:A.HDFSB.S4C.DremelD.MapReduce正确答案:C你选对了9多选(3分)数据产生方式大致经历三个阶段,包括:A.运营式系统阶段B.感知式系统阶段C.移动互联网数据阶段D.用户原创内容阶段正确答案:ABD你选对了10多选(3分)大数据发展三个阶段是:A.低谷期B.成熟期C.大规模应用期D.萌芽期正确答案:BCD你选对了11多选(3分)大数据的特性包括:A.价值密度低B.处理速度快C.数据类型繁多D.数据量大正确答案:ABCD你选对了12多选(3分)图领奖获得者、著名数据库专家Jim Gray博士认为,人类自古以来在科学研究上先后经历哪几种范式:A.计算科学B.数据密集型科学C.实验科学D.理论科学正确答案:ABCD你选对了13多选(3分)大数据带来思维方式的三个转变是:A.效率而非精确B.相关而非因果C.精确而非全面D.全样而非抽样正确答案:ABD你选对了14多选(3分)大数据主要有哪几种计算模式:B.图计算C.查询分析计算D.批处理计算正确答案:ABCD你选对了15多选(3分)云计算的典型服务模式包括三种:A.SaaSB.IaaSC.MaaSD.PaaS正确答案:ABD你选对了第2章大数据处理架构Hadoop1单选(2分)启动hadoop所有进程的命令是:A.start-dfs.shB.start-all.shC.start-hadoop.shD.start-hdfs.sh正确答案:B你选对了2单选(2分)以下对Hadoop的说法错误的是:A.Hadoop是基于Java语言开发的,只支持Java语言编程B.Hadoop2.0增加了NameNode HA和Wire-compatibility两个重大特性C.Hadoop MapReduce是针对谷歌MapReduce的开源实现,通常用于大规模数据集的并行计算D.Hadoop的核心是HDFS和MapReduce正确答案:A你选对了3单选(2分)以下哪个不是Hadoop的特性:A.成本高B.支持多种编程语言C.高容错性正确答案:A你选对了4单选(2分)以下名词解释不正确的是:A.Zookeeper:针对谷歌Chubby的一个开源实现,是高效可靠的协同工作系统B.HBase:提供高可靠性、高性能、分布式的行式数据库,是谷歌BigTable的开源实现C.Hive:一个基于Hadoop的数据仓库工具,用于对Hadoop文件中的数据集进行数据整理、特殊查询和分析存储D.HDFS:分布式文件系统,是Hadoop项目的两大核心之一,是谷歌GFS的开源实现正确答案:B你选对了5多选(3分)以下哪些组件是Hadoop的生态系统的组件:A.HBaseB.OracleC.HDFSD.MapReduce正确答案:ACD你选对了6多选(3分)以下哪个命令可用来操作HDFS文件:A.hadoop fsB.hadoop dfsC.hdfs fsD.hdfs dfs正确答案:ABD你选对了第3章分布式文件系统HDFS1单选(2分)HDFS的命名空间不包含:A.字节B.文件C.块D.目录正确答案:A你选对了2单选(2分)对HDFS通信协议的理解错误的是:A.客户端与数据节点的交互是通过RPC(Remote Procedure Call)来实现的B.客户端通过一个可配置的端口向名称节点主动发起TCP连接,并使用客户端协议与名称节点进行交互C.名称节点和数据节点之间则使用数据节点协议进行交互D.HDFS通信协议都是构建在IoT协议基础之上的正确答案:D你选对了3单选(2分)采用多副本冗余存储的优势不包含:A.保证数据可靠性B.容易检查数据错误C.加快数据传输速度D.节约存储空间正确答案:D你选对了4单选(2分)假设已经配置好环境变量,启动Hadoop和关闭Hadoop的命令分别是:A.start-dfs.sh,stop-hdfs.shB.start-hdfs.sh,stop-hdfs.shC.start-dfs.sh,stop-dfs.shD.start-hdfs.sh,stop-dfs.sh正确答案:C你选对了5单选(2分)分布式文件系统HDFS采用主从结构模型,由计算机集群中的多个节点构成的,这些节点分为两类,一类存储元数据叫,另一类存储具体数据叫 :A.名称节点,主节点B.从节点,主节点C.名称节点,数据节点D.数据节点,名称节点正确答案:C你选对了6单选(2分)下面关于分布式文件系统HDFS的描述正确的是:A.分布式文件系统HDFS是Google Bigtable的一种开源实现B.分布式文件系统HDFS是谷歌分布式文件系统GFS(Google File System)的一种开源实现C.分布式文件系统HDFS比较适合存储大量零碎的小文件D.分布式文件系统HDFS是一种关系型数据库正确答案:B你选对了7多选(3分)以下对名称节点理解正确的是:A.名称节点作为中心服务器,负责管理文件系统的命名空间及客户端对文件的访问B.名称节点用来负责具体用户数据的存储C.名称节点通常用来保存元数据D.名称节点的数据保存在内存中正确答案:ACD你选对了8多选(3分)以下对数据节点理解正确的是:A.数据节点通常只有一个B.数据节点用来存储具体的文件内容C.数据节点的数据保存在磁盘中D.数据节点在名称节点的统一调度下进行数据块的创建、删除和复制等操作正确答案:BCD你选对了9多选(3分)HDFS只设置唯一一个名称节点带来的局限性包括:A.集群的可用性B.性能的瓶颈C.命名空间的限制D.隔离问题正确答案:ABCD你选对了10多选(3分)以下HDFS相关的shell命令不正确的是:A.hadoop dfs mkdir <path>:创建<path>指定的文件夹B.hdfs dfs -rm <path>:删除路径<path>指定的文件C.hadoop fs -copyFromLocal <path1> <path2>:将路径<path2>指定的文件或文件夹复制到路径<path1>指定的文件夹中D.hadoop fs -ls <path>:显示<path>指定的文件的详细信息正确答案:AC你选对了第4章分布式数据库HBase1单选(2分)HBase是一种数据库A.行式数据库B.关系数据库C.文档数据库D.列式数据库正确答案:D你选对了2单选(2分)下列对HBase数据模型的描述错误的是:A.每个HBase表都由若干行组成,每个行由行键(row key)来标识B.HBase是一个稀疏、多维度、排序的映射表,这张表的索引是行键、列族、列限定符和时间戳C.HBase中执行更新操作时,会删除数据旧的版本,并生成一个新的版本D.HBase列族支持动态扩展,可很轻松地添加一个列族或列正确答案:C你选对了3单选(2分)下列说法正确的是:A.如果不启动Hadoop,则HBase完全无法使用B.HBase的实现包括的主要功能组件是库函数,一个Master主服务器和一个Region服务器C.如果通过HBase Shell插入表数据,可以插入一行数据或一个单元格数据D.Zookeeper是一个集群管理工具,常用于分布式计算,提供配置维护、域名服务、分布式同步等正确答案:D你选对了4单选(2分)在HBase数据库中,每个Region的建议最佳大小是:A.2GB-4GBB.100MB-200MBC.500MB-1000MBD.1GB-2GB正确答案:D你选对了5单选(2分)HBase三层结构的顺序是:A.Zookeeper文件,.MEATA.表,-ROOT-表B.-ROOT-表,Zookeeper文件,.MEATA.表C.Zookeeper文件,-ROOT-表,.MEATA.表D..MEATA.表,Zookeeper文件,-ROOT-表正确答案:C你选对了6单选(2分)客户端是通过级寻址来定位Region:A.三B.二C.一D.四正确答案:A你选对了7单选(2分)关于HBase Shell命令解释错误的是:A.create:创建表B.put:向表、行、列指定的单元格添加数据C.list:显示表的所有数据D.get:通过表名、行、列、时间戳、时间范围和版本号来获得相应单元格的值正确答案:C你选对了8多选(3分)下列对HBase的理解正确的是:A.HBase是针对谷歌BigTable的开源实现B.HBase是一种关系型数据库,现成功应用于互联网服务领域C.HBase是一个行式分布式数据库,是Hadoop生态系统中的一个组件D.HBase多用于存储非结构化和半结构化的松散数据正确答案:AD你选对了9多选(3分)HBase和传统关系型数据库的区别在于哪些方面:A.数据操作B.数据索引C.数据模型D.存储模式正确答案:ABCD你选对了10多选(3分)访问HBase表中的行,有哪些方式:A.通过某列的值区间B.全表扫描C.通过一个行健的区间来访问D.通过单个行健访问正确答案:BCD你选对了第5章 NoSQL数据库1单选(2分)下列关于NoSQL数据库和关系型数据库的比较,不正确的是:A.NoSQL数据库很容易实现数据完整性,关系型数据库很难实现数据完整性B.NoSQL数据库缺乏统一的查询语言,而关系型数据库有标准化查询语言C.NoSQL数据库的可扩展性比传统的关系型数据库更好D.NoSQL数据库具有弱一致性,关系型数据库具有强一致性正确答案:A你选对了2单选(2分)以下对各类数据库的理解错误的是:A.键值数据库的键是一个字符串对象,值可以是任意类型的数据,比如整型和字符型等B.文档数据库的数据是松散的,XML和JSON 文档等都可作为数据存储在文档数据库中C.图数据库灵活性高,支持复杂的图算法,可用于构建复杂的关系图谱D.HBase数据库是列族数据库,可扩展性强,支持事务一致性正确答案:D你选对了3单选(2分)下列数据库属于文档数据库的是:A.MySQLB.RedisC.MongoDBD.HBase正确答案:C你选对了4单选(2分)NoSQL数据库的三大理论基石不包括:A.最终一致性B.BASEC.ACIDD.CAP正确答案:C你选对了5多选(3分)关于NoSQL数据库和关系数据库,下列说法正确的是:A.NoSQL数据库可支持超大规模数据存储,具有强大的横向扩展能力B.NoSQL数据库和关系数据库各有优缺点,但随着NoSQL的发展,终将取代关系数据库C.大多数NoSQL数据库很难实现数据完整性D.关系数据库有关系代数理论作为基础,NoSQL数据库没有统一的理论基础正确答案:ACD你选对了6多选(3分)NoSQL数据库的类型包括:A.键值数据库B.列族数据库C.文档数据库D.图数据库正确答案:ABCD你选对了7多选(3分)CAP是指:A.一致性B.可用性C.持久性D.分区容忍性正确答案:ABD你选对了8多选(3分)NoSQL数据库的BASE特性是指:A.软状态B.持续性C.最终一致性D.基本可用正确答案:ACD你选对了第6章云数据库1单选(2分)下列Amazon的云数据库属于关系数据库的是:A.Amazon SimpleDBB.Amazon DynamoDBC.Amazon RDSD.Amazon Redshift正确答案:C你选对了2单选(2分)下列关于UMP系统的说法不正确的是:A.Controller服务器向UMP集群提供各种管理服务,实现集群成员管理、元数据存储等功能B.Agent服务器部署在运行MySQL进程的机器上,用来管理每台物理机上的MySQL实例C.UMP系统是低成本和高性能的MySQL云数据库方案D.Mnesia是UMP系统的一个组件,是一个分布式数据库管理系统,且不支持事务正确答案:D你选对了3多选(3分)UMP依赖的开源组件包括A.LVSB.ZooKeeperC.MnesiaD.RabbitMQ正确答案:ABCD你选对了4多选(3分)在UMP系统中,Zookeeper主要发挥的作用包括:A.监控所有MySQL实例B.负责集群负载均衡C.提供分布式锁,选出一个集群的“总管”D.作为全局的配置服务器正确答案:ACD你选对了5多选(3分)UMP系统设计了哪些机制来保证数据安全:A.记录用户操作日志B.数据访问IP白名单C.SSL数据库连接D.SQL拦截正确答案:ABCD你选对了第7章 MapReduce1单选(2分)下列说法错误的是:A.Map函数将输入的元素转换成<key,value>形式的键值对B.Hadoop框架是用Java实现的,MapReduce应用程序则一定要用Java来写C.MapReduce框架采用了Master/Slave架构,包括一个Master和若干个SlaveD.不同的Map任务之间不能互相通信正确答案:B你选对了2单选(2分)在使用MapReduce程序WordCount进行词频统计时,对于文本行“hello hadoop hello world”,经过WordCount程序的Map函数处理后直接输出的中间结果,应是下面哪种形式:A.<"hello",1,1>、<"hadoop",1>和<"world",1>B.<"hello",2>、<"hadoop",1>和<"world",1>C.<"hello",<1,1>>、<"hadoop",1>和<"world",1>D.<"hello",1>、<"hello",1>、<"hadoop",1>和<"world",1>正确答案:D你选对了3单选(2分)对于文本行“hello hadoop hello world”,经过WordCount的Reduce函数处理后的结果是:A.<"hello",<1,1>><"hadoop",1><"world",1>B.<"hello",1><"hello",1><"hadoop",1><"world",1>C.<"hello",1,1><"hadoop",1><"world",1>D.<"hello",2><"hadoop",1><"world",1>正确答案:B你选对了4多选(3分)下列关于传统并行计算框架(比如MPI)和MapReduce并行计算框架比较正确的是:A.前者所需硬件价格贵,可扩展性差,后者硬件便宜,扩展性好B.前者相比后者学习起来更难C.前者是共享式(共享内存/共享存储),容错性差,后者是非共享式的,容错性好D.前者适用于实时、细粒度计算、计算密集型,后者适用于批处理、非实时、数据密集型正确答案:ABCD你选对了5多选(3分)MapReduce1.0的体系结构主要由哪几个部分组成:A.JobTrackerB.TaskTrackerC.ClientD.Task正确答案:ABCD你选对了第8章 Hadoop再探讨1单选(2分)下列说法正确的是:A.HDFS HA可用性不好B.第二名称节点是热备份C.HDFS HA提供高可用性,可实现可扩展性、系统性能和隔离性D.第二名称节点无法解决单点故障问题正确答案:D你选对了2单选(2分)HDFS Federation设计不能解决“单名称节点”存在的哪个问题:A.单点故障问题B.HDFS集群扩展性C.性能更高效D.良好的隔离性正确答案:A你选对了3多选(3分)下列哪些是Hadoop1.0存在的问题:A.抽象层次低B.表达能力有限C.开发者自己管理作业之间的依赖关系D.执行迭代操作效率低正确答案:ABCD你选对了下列对Hadoop各组件的理解正确的是:A.Oozie:工作流和协作服务引擎B.Pig:处理大规模数据的脚本语言C.Kafka:分布式发布订阅消息系统D.Tez:支持DAG作业的计算框架正确答案:ABCD你选对了5多选(3分)对新一代资源管理调度框架YARN的理解正确的是:A.YARN既是资源管理调度框架,也是一个计算框架B.MapReduce2.0是运行在YARN之上的计算框架,由YARN来为MapReduce提供资源管理调度服务C.YARN可以实现“一个集群多个框架”,即在一个集群上部署一个统一的资源调度管理框架D.YARN的体系结构包含三个组件:ResourceManager,NodeManager,ApplicationMaster正确答案:BCD你选对了第9章数据仓库Hive1单选(2分)下列有关Hive和Impala的对比错误的是:A.Hive与Impala中对SQL的解释处理比较相似,都是通过词法分析生成执行计划B.Hive与Impala使用相同的元数据C.Hive适合于长时间的批处理查询分析,而Impala适合于实时交互式SQL查询D.Hive在内存不足以存储所有数据时,会使用外存,而Impala也是如此正确答案:D你选对了2单选(2分)下列关于Hive基本操作命令的解释错误的是:A.create table if not exists usr(id bigint,name string,age int);//如usr表不存在,创建表usr,含三个属性id,name,ageB.load data local inpath ‘/usr/local/data’ overwrite into table usr; //把目录’/usr/local/data’下的数据文件中的数据以追加的方式装载进usr表C.create database userdb;//创建数据库userdbD.insert overwrite table student select * from user where age>10; //向表usr1中插入来自usr表的age大于10的数据并覆盖student表中原有数据正确答案:B你选对了下列说法正确的是:A.Impala和Hive、HDFS、HBase等工具可统一部署在一个Hadoop平台上B.数据仓库Hive不需要借助于HDFS就可完成数据的存储C.Hive本身不存储和处理数据,依赖HDFS存储数据,依赖MapReduce处理数据D.HiveQL语法与传统的SQL语法很相似正确答案:ACD你选对了4多选(3分)Impala主要由哪几个部分组成:A.HiveB.ImpaladC.State StoreD.CLI正确答案:BCD你选对了5多选(3分)以下属于Hive的基本数据类型是:A.BINARYB.STRINGC.FLOATD.TINYINT正确答案:ABCD你选对了第10章 Spark1单选(2分)Spark SQL目前暂时不支持下列哪种语言:A.PythonB.JavaC.ScalaD.Lisp正确答案:D你选对了2单选(2分)RDD操作分为转换(Transformation)和动作(Action)两种类型,下列属于动作(Action)类型的操作的是:A.groupByB.filterC.countD.map正确答案:C你选对了3单选(2分)下列说法错误的是:A.在选择Spark Streaming和Storm时,对实时性要求高(比如要求毫秒级响应)的企业更倾向于选择流计算框架StormB.RDD采用惰性调用,遇到“转换(Transformation)”类型的操作时,只会记录RDD生成的轨迹,只有遇到“动作(Action)”类型的操作时才会触发真正的计算C.Spark支持三种类型的部署方式:Standalone,Spark on Mesos,Spark on YARND.RDD提供的转换接口既适用filter等粗粒度的转换,也适合某一数据项的细粒度转换正确答案:D你选对了4单选(2分)下列关于常见的动作(Action)和转换(Transformation)操作的API解释错误的是:A.filter(func):筛选出满足函数func的元素,并返回一个新的数据集B.map(func):将每个元素传递到函数func中,并将结果返回为一个新的数据集C.count():返回数据集中的元素个数D.take(n):返回数据集中的第n个元素正确答案:D你选对了5单选(2分)下列大数据处理类型与其对应的软件框架不匹配的是:A.复杂的批量数据处理:MapReduceB.基于历史数据的交互式查询:ImpalaC.基于实时数据流的数据处理:StormD.图结构数据的计算:Hive正确答案:D你选对了6多选(3分)Apache软件基金会最重要的三大分布式计算系统开源项目包括:A.OracleB.HadoopC.StormD.Spark正确答案:ABC你选对了7多选(3分)Spark的主要特点包括:A.运行模式多样B.运行速度快C.通用性好D.容易使用正确答案:ABCD你选对了8多选(3分)下列关于Scala的说法正确的是:A.Scala运行于Java平台,兼容现有的Java程序B.Scala具备强大的并发性,支持函数式编程C.Scala是一种多范式编程语言D.Scala是Spark的主要编程语言,但Spark还支持Java、Python、R作为编程语言正确答案:ABCD你选对了9多选(3分)Spark的运行架构包括:A.运行作业任务的工作节点 Worker NodeB.每个工作节点上负责具体任务的执行进程 ExecutorC.每个应用的任务控制节点 DriverD.集群资源管理器 Cluster Manager正确答案:ABCD你选对了第11章流计算1单选(2分)流计算秉承一个基本理念,即数据的价值随着时间的流逝而,如用户点击流:A.降低B.不确定C.不变D.升高正确答案:A你选对了2单选(2分)Hadoop运行的是MapReduce任务,类似地,Storm运行的任务叫做A.SpoutB.BoltC.TupleD.Topology正确答案:D你选对了3多选(3分)对于一个流计算系统来说,它应达到如下哪些需求:A.海量式B.高性能C.分布式D.实时性正确答案:A、B、C、D你选对了4多选(3分)数据采集系统的基本架构包括哪些部分:A.ControllerB.StoreC.AgentD.Collector正确答案:B、C、D你选对了5多选(3分)以下哪些是开源的流计算框架:A.Facebook PumaB.Yahoo! S4C.IBM InfoSphere StreamsD.Twitter Storm正确答案:B、D你选对了6多选(3分)下面哪几个属于Storm中的Stream Groupings的分组方式:A.按照字段分组B.广播发送C.随机分组D.全局分组正确答案:A、B、C、D你选对了第12章 Flink1单选(2分)以下哪个不是Flink的优势:A.同时支持高吞吐、低延迟、高性能B.不支持增量迭代C.同时支持流处理和批处理D.支持有状态计算正确答案:B你选对了2单选(2分)在Flink中哪个是基于批处理的图计算库:A.SQL&Table库B.FlinkMLC.GellyD.CEP正确答案:C你选对了3多选(3分)下面关于Flink的说法正确的是:A.Flink起源于Stratosphere 项目,该项目是在2010年到2014年间由柏林工业大学、柏林洪堡大学和哈索普拉特纳研究所联合开展的B.Flink可以同时支持实时计算和批量计算C.Flink不是Apache软件基金会的项目D.Flink是Apache软件基金会的5个最大的大数据项目之一正确答案:A、B、D你选对了4多选(3分)Flink的主要特性包括:A.精确一次的状态一致性保障B.批流一体化C.精密的状态管理D.事件时间支持正确答案:A、B、C、D你选对了5多选(3分)下面论述正确的是:A.Spark Streaming通过采用微批处理方法实现高吞吐和容错性,但是牺牲了低延迟和实时处理能力B.Storm虽然可以做到低延迟,但是无法实现高吞吐,也不能在故障发生时准确地处理计算状态C.流处理架构需要具备低延迟、高吞吐和高性能的特性,而目前从市场上已有的产品来看,只有Flink 可满足要求D.Flink实现了Google Dataflow流计算模型,是一种兼具高吞吐、低延迟和高性能的实时流计算框架,并且同时支持批处理和流处理正确答案:A、B、C、D你选对了6多选(3分)Flink常见的应用场景包括:A.数据流水线应用B.事件驱动型应用C.地图应用D.数据分析应用正确答案:A、B、D你选对了7多选(3分)Flink核心组件栈分为哪三层:A.物理部署层B.Runtime核心层C.Core层D.API&Libraries层正确答案:A、B、D你选对了8多选(3分)Flink有哪几种部署模式:A.运行在GCE(谷歌云服务)和EC2(亚马逊云服务)上B.YARN集群模式C.Standalone集群模式D.Local模式正确答案:A、B、C、D你选对了9多选(3分)Flink系统主要由两个组件组成,分别为:A.JobManagerB.JobSchedulerC.TaskSchedulerD.TaskManager正确答案:A、D你选对了10多选(3分)在编程模型方面,Flink 提供了不同级别的抽象,以开发流或批处理作业,主要包括哪几个级别的抽象:A.DataStream API(有界或无界流数据)以及 DataSet API(有界数据集)B.Table APIC.状态化的数据流接口D. SQL正确答案:A、B、C、D你选对了第13章图计算1单选(2分)Pregel是一种基于模型实现的并行图处理系统:A.TSPB.STPC.BSPD.SBP正确答案:C你选对了2单选(2分)谷歌在后Hadoop时代的新“三驾马车”不包括:A.CaffeineB.DremelC. PregelD.Hama正确答案:D你选对了3多选(3分)下列哪些是以图顶点为中心的,基于消息传递批处理的并行图计算框架:A.HamaB.GiraphC.PregelD.Neo4j正确答案:A、B、C你选对了4多选(3分)以下关于Pregel图计算框架说法正确的是:A.通常只对满足交换律和结合律的操作才会开启Combiner功能B.Pregel采用检查点机制来实现容错C.对于全局拓扑改变,Pregel采用了惰性协调机制D.Aggregator提供了一种全局通信、监控和数据查看的机制正确答案:A、B、C、D你选对了第14章大数据在不同领域的应用1单选(2分)下列说法错误的是:A.ItemCF算法推荐的是那些和目标用户之前喜欢的物品类似的其他物品B.基于用户的协同过滤算法(简称UserCF算法)是目前业界应用最多的算法erCF算法推荐的是那些和目标用户有共同兴趣爱好的其他用户所喜欢的物品erCF算法的推荐更偏向社会化,而ItemCF算法的推荐更偏向于个性化正确答案:B你选对了2多选(3分)推荐方法包括哪些类型:A.专家推荐B.协同过滤推荐C.基于内容的推荐D.基于统计的推荐正确答案:A、B、C、D你选对了期末试卷1单选(2分)数据产生方式的变革主要经历了三个阶段,以下哪个不属于这三个阶段:A.运营式系统阶段B.感知式系统阶段C.数据流阶段D.用户原创内容阶段正确答案:C你选对了2单选(2分)第三次信息化浪潮的发生标志是以下哪种技术的普及:A.互联网B.CPUC.物联网、云计算和大数据D.个人计算机正确答案:C你选对了3单选(2分)在Flink中哪个是基于批处理的图计算库:A.SQL&Table库B.CEPC. GellyD. FlinkML正确答案:C你选对了4单选(2分)Hadoop的两大核心是和A.MapReduce; HBaseB. HDFS; HBaseC.HDFS; MapReduceD.GFS; MapReduce正确答案:C你选对了5单选(2分)HDFS默认的一个块大小是A.64MBB.8KBC. 32KBD.16KB正确答案:A你选对了6单选(2分)在分布式文件系统HDFS中,负责数据的存储和读取:A.数据节点B.第二名称节点C.名称节点D.主节点正确答案:A你选对了7单选(2分)上传当前目录下的本地文件file.txt到分布式文件系统HDFS的“/path”目录下的Shell命令是:A.hdfs dfs -put /path file.txtB.hadoop dfs -put /path file.txtC.hdfs fs -put file.txt /pathD.hdfs dfs -put file.txt /path正确答案:D你选对了8单选(2分)在HDFS根目录下创建一个文件夹/test,且/test文件夹内还包含一个文件夹dir,正确的shell命令是:A.hadoop fs -mkdir -p /test/dirB.hdfs fs -mkdir -p /test/dirC.hadoop dfs -mkdir /test/dirD.hdfs dfs *mkdir -p /test/dir正确答案:A你选对了9单选(2分)下列有关HBase的说法正确的是:A.在向数据库中插入记录时,HBase和关系数据库一样,每次都是以“行”为单位把整条记录插入数据库B.HBase是针对谷歌BigTable的开源实现,是高可靠、高性能的图数据库C.HBase是一种NoSQL数据库。
大数据技术及应用题库
大数据技术及应用题库单选题:1从大量数据中提取知识的过程通常称为(A)。
a..数据挖掘b..人工智能c..数据清洗d..数据仓库2下列论据中,能够支撑“大数据无所不能”的观点的是(A)。
A、互联网金融打破了传统的观念和行为B、大数据存在泡沫C、大数据具有非常高的成本D、个人隐私泄露与信息安全担忧3数据仓库的最终目的是(D)。
a..收集业务需求b..建立数据仓库逻辑模型c..开发数据仓库的应用分析d..为用户和业务部门提供决策支持4大数据处理技术和传统的数据挖掘技术最大的区别是(A)。
a..处理速度快(秒级定律)b..算法种类更多c..精度更高d..更加智能化5大数据的起源是(C)。
a..金融b..电信c..互联网d..公共管理6大数据不是要教机器像人一样思考。
相反,它是(A)。
a..把数学算法运用到海量的数据上来预测事情发生的可能性b..被视为人工智能的一部c..被视为一种机器学习d..预测与惩罚7人与人之间沟通信息、传递信息的技术,这指的是(D)。
a..感测技术b..微电子技术c..计算机技术d..通信技术8数据清洗的方法不包括(D)。
a..缺失值处理b..噪声数据清除c..一致性检查d..重复数据记录处理9.下列关于舍恩伯格对大数据特点的说法中,错误的是(D)A.数据规模大B.数据类型多样C.数据处理速度快D.数据价值密度高10规模巨大且复杂,用现有的数据处理工具难以获取、整理、管理以及处理的数据,这指的是(D)。
a..富数据b..贫数据c..繁数据d..大数据11大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的(D)。
a..新一代信息技术b..新一代服务业态c..新一代技术平台d..新一代信息技术和服务业态12万维网之父是(C)A.彼得·德鲁克B.舍恩伯格C.蒂姆·伯纳斯—李D.斯科特·布朗13下列演示方式中,不属于传统统计图方式的是(D)。
大数据技术及应用题库
1从大量数据中提取知识的过程通常称为( A )。
a. .数据挖掘b. .人工智能c. .数据清洗d. .数据仓库2下列论据中,能够支撑“大数据无所不能”的观点的是(A)。
A、互联网金融打破了传统的观念和行为B、大数据存在泡沫C、大数据具有非常高的成本D、个人隐私泄露与信息安全担忧3数据仓库的最终目的是(D)。
a. .收集业务需求b. .建立数据仓库逻辑模型c. .开发数据仓库的应用分析d. .为用户和业务部门提供决策支持4大数据处理技术和传统的数据挖掘技术最大的区别是(A)。
a. .处理速度快(秒级定律)b. .算法种类更多c. .精度更高d. .更加智能化5大数据的起源是(C)。
a. .金融b. .电信c. .互联网d. .公共管理6大数据不是要教机器像人一样思考。
相反,它是(A )。
a. .把数学算法运用到海量的数据上来预测事情发生的可能性b. .被视为人工智能的一部c. .被视为一种机器学习d. .预测与惩罚7人与人之间沟通信息、传递信息的技术,这指的是(D)。
a. .感测技术b. .微电子技术c. .计算机技术叮叮小文库d. .通信技术8数据清洗的方法不包括(D )。
a. .缺失值处理b. .噪声数据清除c. . 一致性检查d. .重复数据记录处理9.下列关于舍恩伯格对大数据特点的说法中,错误的是(D)A. 数据规模大B.数据类型多样C.数据处理速度快D.数据价值密度高10规模巨大且复杂,用现有的数据处理工具难以获取、整理、管理以及处理的数据,这指的是(D)oa. .富数据b. .贫数据c. .繁数据d. .大数据11大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的(D)oa. .新一代信息技术b. .新一代服务业态c. .新一代技术平台d. .新一代信息技术和服务业态12万维网之父是(C)A. 彼得•德鲁克B.舍恩伯格C.蒂姆•伯纳斯一李D.斯科特•布朗13下列演示方式中,不属于传统统计图方式的是(D)oA、柱形图B、饼状图C、曲线图D、网络图14当前社会中,最为突出的大数据环境是(A)oA、互联网B、物联网C、综合国力D、自然资源叮叮小文库16大数据的起源是(C)。
2024年大数据应用及处理技术能力知识考试题库与答案
2024年大数据应用及处理技术能力知识考试题库与答案一、单选题1.当图像通过信道传输时,噪声一般与()无关。
A、信道传输的质量B、出现的图像信号C、是否有中转信道的过程D、图像在信道前后的处理参考答案:B2.在留出法、交叉验证法和自助法三种评估方法中,()更适用于数据集较小、难以划分训练集和测试集的情况。
A、留出法B、交叉验证法C、自助法D、留一法参考答案:C3.在数据科学中,通常可以采用()方法有效避免数据加工和数据备份的偏见。
A、A/B测试B、训练集和测试集的划分C、测试集和验证集的划分D、图灵测试参考答案:A4.下列不属于深度学习内容的是(_)oA、深度置信网络B、受限玻尔兹曼机C、卷积神经网络D、贝叶斯学习参考答案:D5.在大数据项目中,哪个阶段可能涉及使用数据工程师来优化数据查询性能?A、数据采集B、数据清洗C、数据存储与管理D、数据分析与可视化参考答案:C6.假定你现在训练了一个线性SVM并推断出这个模型出现了欠拟合现象,在下一次训练时,应该采取下列什么措施()A、增加数据点B、减少数据点C、增加特征D、减少特征参考答案:C7.两个变量相关,它们的相关系数r可能为0?这句话是否正确0A、正确B、错误参考答案:A8.一幅数字图像是()。
A、一个观测系统B、一个由许多像素排列而成的实体C、一个2-D数组中的元素D、一个3-D空间中的场景参考答案:C9.以下说法正确的是:()。
一个机器学习模型,如果有较高准确率,总是说明这个分类器是好的如果增加模型复杂度,那么模型的测试错误率总是会降低如果增加模型复杂度,那么模型的训练错误率总是会降低A、1B、2C、3D、land3参考答案:c10.从网络的原理上来看,结构最复杂的神经网络是0。
A、卷积神经网络B、长短时记忆神经网络C、GRUD、BP神经网络参考答案:B11.LSTM中,(_)的作用是确定哪些新的信息留在细胞状态中,并更新细胞状态。
A、输入门B、遗忘门G输出门D、更新门参考答案:A12.Matplotiib的核心是面向()。
大数据技术及应用_东北师范大学中国大学mooc课后章节答案期末考试题库2023年
大数据技术及应用_东北师范大学中国大学mooc课后章节答案期末考试题库2023年1.关系数据库是基于行模式存储的,而HBase也是基于行模式存储的。
参考答案:错误2.对于Hive中分区的概念,下列描述错误的是()。
参考答案:分区字段只能有一个3.Action API完成返回数据集中的元素个数的操作命令是()。
参考答案:count()4.HDFS是基于流数据模式访问和处理超大文件的需求而开发的,具有高容错、高可靠性、高可扩展性、高吞吐率等特征,适合的读写任务是()。
参考答案:一次写入,多次读写5.MapReduce作业的初始化调用的方法是()。
参考答案:JobTracker.initJob()6.下述关于 Hadoop的阐述,正确的是()。
参考答案:是一个分布式存储与分布式并行运算系统7.Hadoop是一个能够对大量数据进行分布式处理的软件框架。
参考答案:正确8.以下选项中,不是HBase添加数据需要用到的类和接口的是()。
参考答案:Scan9.关于HDFS的文件写入操作描述正确的是()。
参考答案:默认将文件块复制成三份存放10.HDFS是基于流数据模式访问和处理超大文件的需求而开发的,具有高容错、高可靠性、高可扩展性、高吞吐率等特征,适合的读写任务是?参考答案:一次写入,多次读写11.分布式文件系统HDFS 中的 block 默认保存几份?参考答案:3 份12.Hbase是一个针对结构化数据的可申缩、高可靠,高性能、分布式和面向()的动态模式数据库。
参考答案:列13.YARN是新一代Hadoop(),用户可以运行和管理同一个物理集群机上多种作业。
参考答案:资源管理器14.HDFS采用块的概念,默认的一个块大小是64MB。
参考答案:正确15.MapReduce框架采用了Master/Slave架构,包括一个Master和若干个Slave。
Master上运行JobTracker,Slave上运行TaskTracker 。
大数据技术及应用题库
大数据技术及应用题库单选题:1从大量数据中提取知识的过程通常称为(A)。
a. . 数据挖掘b. . 人工智能c. . 数据清洗d. . 数据仓库2下列论据中,能够支撑“大数据无所不能”的观点的是(A)。
A、互联网金融打破了传统的观念和行为B、大数据存在泡沫C、大数据具有非常高的成本D、个人隐私泄露与信息安全担忧3数据仓库的最终目的是(D)。
a. . 收集业务需求b. . 建立数据仓库逻辑模型c. . 开发数据仓库的应用分析d. . 为用户和业务部门提供决策支持4大数据处理技术和传统的数据挖掘技术最大的区别是(A)。
a. . 处理速度快(秒级定律)b. . 算法种类更多c. . 精度更高d. . 更加智能化5大数据的起源是(C)。
a. . 金融b. . 电信c. . 互联网d. . 公共管理6大数据不是要教机器像人一样思考。
相反,它是(A)。
a. . 把数学算法运用到海量的数据上来预测事情发生的可能性b. . 被视为人工智能的一部c. . 被视为一种机器学习d. . 预测与惩罚7人与人之间沟通信息、传递信息的技术,这指的是(D)。
a. . 感测技术b. . 微电子技术c. . 计算机技术d. . 通信技术8数据清洗的方法不包括(D)。
a. . 缺失值处理b. . 噪声数据清除c. . 一致性检查d. . 重复数据记录处理9. 下列关于舍恩伯格对大数据特点的说法中,错误的是(D)A. 数据规模大B. 数据类型多样C. 数据处理速度快D. 数据价值密度高10规模巨大且复杂,用现有的数据处理工具难以获取、整理、管理以及处理的数据,这指的是(D)。
a. . 富数据b. . 贫数据c. . 繁数据d. . 大数据11大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的(D)。
a. . 新一代信息技术b. . 新一代服务业态c. . 新一代技术平台d. . 新一代信息技术和服务业态12万维网之父是(C)A. 彼得·德鲁克B. 舍恩伯格C. 蒂姆·伯纳斯—李D. 斯科特·布朗13下列演示方式中,不属于传统统计图方式的是(D)。
《大数据技术原理及应用》题目
大数据技术原理与应用第一卷一:判断题(每小题5分)1:对于大数据而言,最基本、最重要的要求就是减少错误、保证质量。
因此,大数据收集的信息量要尽量精确。
A:对B:错答案:B2:Spark是一个高效的分布式计算系统,它有MapReduce所有优点,同时性能与Hadoop一样高。
A:对B:错答案:B3:信息生命周期管理是据生命周期管理的来源,最早由英国企业提出。
A:对B:错答案:B4:简单随机抽样,是从总体N 个对象中任意抽取n 个对象作为样本,最终以这些样本作为调查对象。
在抽取样本时,总体中每个对象被抽中为调查样本的概率可能会有差异。
A:对B:错答案:B5:大数据预测能够分析和挖掘出人们不知道或没有注意到的模式,确定判断事件必然会发生。
A:对B:错答案:B二:单选题(每小题5分)6:数据清洗的方法不包括______A缺失值处理B噪声数据清除C一致性检查D重复数据记录处理答案:D7:大数据的基本特征不包括______A数据量大B数据类型繁多C处理速度快D价值密度高答案:D8:HDFS中当前block大小为128M,如果当前要上传到HDFS中的文件大小为300M,那么在存储时会分配_______个block进行存储A1 B2 C3 D4答案:C9:下列______程序通常与NameNode在一个节点启动A SecondNameNodeB DataNodeC TaskTrackerD JobTracker答案:D10:配置Hadoop时,JAVA_HOME包含在______配置文件中A hadoop-default.xmlB hadoop-env.shC hadoop-site.xmlD configuration.xs答案:B11:在数据生命周期管理实践中______是执行方法A数据存储和备份规范B数据管理和维护C数据价值发觉和利用D数据应用开发和管理答案:B12:HBase系统基本架构中主服务器Master的作用是______A包含访问HBase的接口,同时在缓存中维护着已经访问过的Region位置信息,用来加快后续数据访问过程B可以帮助选举出一个Master作为集群的总管,并保证在任何时刻总有唯一一个Master在运行C主要负责表和Region的管理工作D是HBase中最核心的模块,负责维护分配给自己的Region,并响应用户的读写请求答案:C13:Hadoop具有特性不包括______A高可靠性B高效性C高可扩展性D低容错性,答案:D14:YARN的http端口默认是______A80 B8080 C 8090 D8088答案:D15:大数据时代,数据使用的关键是______A数据收集B数据存储C数据分析D数据再利用答案:D三:多选题(每小题5分)16:大数据人才整体上需要具备______等核心知识A数学与统计知识B计算机相关知识C马克思主义哲学知识D市场运营管理知识E在特定业务领域的知识答案:ABE17:下列关于数据生命周期管理的核心认识中,正确的是______A数据从产生到被删除销毁的过程中,具有多个不同的数据存在阶段B在不同的数据存在阶段,数据的价值是不同的C根据数据价值的不同应该对数据采取不同的管理策略D数据生命周期管理旨在产生效益的同时,降低生产成本答案:ABC18:数据研究经历了几种范式,包括______A实验B理论C计算D数据答案:ABCD19:按照涉及自变量的多少,可以将回归分析分为______A线性回归分析B非线性回归分析C一元回归分析D多元回归分析答案:CD20:大数据产业发展特点______A规模较大B规模较小C增速较快D增速缓慢E多产业交叉融合答案:ACE第二卷一:判断题(每小题5分)1:HDFS能提供高吞吐量的数据访问,非常适合于大规模数据集上的应用。
大数据技术与应用考试试题
大数据技术与应用考试试题
1. 简答题
请解释什么是大数据技术,以及它在实际应用中的作用和意义。
2. 填空题
大数据的三个特点是______、______和______。
3. 选择题
关于大数据技术的发展历程,以下哪项描述是正确的?
A. 大数据技术始于20世纪50年代
B. Hadoop是大数据技术的第一个开源项目
C. 云计算和物联网技术的兴起推动了大数据技术的发展
D. 大数据技术目前已经进入了衰退期
4. 简答题
请简要介绍Hadoop和Spark这两种常用的大数据处理框架,并比较它们之间的优劣。
5. 计算题
假设一个数据集包含100万条记录,每条记录占用10KB的存储空间,现需对该数据集进行排序操作。
若采用分布式处理方式,每个节
点能处理1000条记录,共有1000个节点参与计算。
请计算完成此排序操作所需的总时间。
6. 问答题
在大数据分析中,数据清洗和数据可视化分别扮演着怎样的角色?请结合实际案例进行说明。
7. 实操题
请编写一个简单的MapReduce程序,实现对一个文本文件中的单词进行词频统计。
8. 综合题
结合你对大数据技术的理解和实际案例,谈谈大数据技术对企业经营管理、市场营销和决策分析等方面的影响和应用。
以上为《大数据技术与应用考试试题》,请同学们按照实际情况尽快完成。
祝大家考试顺利!。
大数据技术与应用考试 选择题 50题
1. 大数据的核心特征不包括以下哪一项?A. 大量性B. 高速性C. 多样性D. 单一性2. Hadoop生态系统中,用于数据仓库的组件是?A. HBaseB. HiveC. PigD. Zookeeper3. 在数据挖掘中,以下哪种技术主要用于分类?A. 聚类分析B. 关联规则C. 决策树D. 回归分析4. 大数据处理框架Apache Spark的核心抽象是?A. RDDB. DataFrameC. DatasetD. GraphX5. 以下哪个不是NoSQL数据库的类型?A. 键值存储B. 文档存储C. 关系数据库D. 图数据库6. 在Hadoop中,负责数据存储的组件是?A. HDFSB. MapReduceC. YARND. Oozie7. 大数据分析中,以下哪个步骤通常最先进行?A. 数据清洗B. 数据可视化C. 数据建模D. 数据收集8. 以下哪个编程语言常用于大数据处理?A. PythonB. RubyC. SwiftD. Perl9. 在Spark中,用于处理实时数据流的组件是?A. Spark SQLB. Spark StreamingC. MLlibD. GraphX10. 以下哪个工具不是用于大数据可视化的?A. TableauB. Power BIC. ExcelD. D3.js11. 在数据仓库中,ETL过程指的是?A. 提取、转换、加载B. 加密、传输、登录C. 编辑、测试、发布D. 评估、培训、学习12. 以下哪个是大数据处理中的批处理技术?A. Spark StreamingB. KafkaC. MapReduceD. Storm13. 在Hadoop中,负责资源管理的组件是?A. HDFSB. MapReduceC. YARND. Oozie14. 大数据技术中,以下哪个不是数据存储技术?A. HBaseB. CassandraC. MongoDBD. MapReduce15. 在数据分析中,以下哪个方法用于发现数据中的异常值?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析16. 以下哪个是大数据技术中的内存计算框架?A. HadoopB. SparkC. FlinkD. Storm17. 在数据仓库设计中,以下哪个模型用于表示数据的关系?A. 星型模型B. 雪花模型C. 实体-关系模型D. 维度模型18. 以下哪个不是大数据分析的应用领域?A. 金融B. 医疗C. 教育D. 农业19. 在Spark中,以下哪个组件用于机器学习?A. Spark SQLB. Spark StreamingC. MLlibD. GraphX20. 以下哪个是大数据技术中的流处理框架?A. HadoopB. SparkC. FlinkD. Storm21. 在数据分析中,以下哪个方法用于预测未来趋势?A. 聚类分析B. 关联规则C. 时间序列分析D. 回归分析22. 以下哪个是大数据技术中的图计算框架?A. HadoopB. SparkC. FlinkD. GraphX23. 在数据仓库中,以下哪个步骤用于将数据从源系统转移到数据仓库?A. 数据提取B. 数据转换C. 数据加载D. 数据清洗24. 以下哪个不是大数据技术的优势?A. 提高决策效率B. 降低成本C. 增加数据冗余D. 增强数据洞察力25. 在数据分析中,以下哪个方法用于发现数据中的模式?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析26. 以下哪个是大数据技术中的列存储数据库?A. HBaseB. CassandraC. MongoDBD. HDFS27. 在数据仓库中,以下哪个步骤用于将数据转换为适合分析的格式?A. 数据提取B. 数据转换C. 数据加载D. 数据清洗28. 以下哪个不是大数据技术的挑战?A. 数据安全B. 数据隐私C. 数据冗余D. 数据质量29. 在数据分析中,以下哪个方法用于发现数据中的关联?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析30. 以下哪个是大数据技术中的键值存储数据库?A. HBaseB. CassandraC. MongoDBD. HDFS31. 在数据仓库中,以下哪个步骤用于将数据加载到数据仓库中?A. 数据提取B. 数据转换C. 数据加载D. 数据清洗32. 以下哪个不是大数据技术的应用场景?A. 个性化推荐B. 风险管理C. 数据备份D. 智能分析33. 在数据分析中,以下哪个方法用于将数据分组?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析34. 以下哪个是大数据技术中的文档存储数据库?A. HBaseB. CassandraC. MongoDBD. HDFS35. 在数据仓库中,以下哪个步骤用于将数据从源系统提取出来?A. 数据提取B. 数据转换C. 数据加载D. 数据清洗36. 以下哪个不是大数据技术的特点?A. 数据量大B. 数据种类多C. 数据处理速度快D. 数据处理精度低37. 在数据分析中,以下哪个方法用于预测数值?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析38. 以下哪个是大数据技术中的图存储数据库?A. HBaseB. CassandraC. MongoDBD. Neo4j39. 在数据仓库中,以下哪个步骤用于将数据清洗干净?A. 数据提取B. 数据转换C. 数据加载40. 以下哪个不是大数据技术的应用领域?A. 零售B. 制造C. 娱乐D. 军事41. 在数据分析中,以下哪个方法用于发现数据中的异常?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析42. 以下哪个是大数据技术中的内存数据库?A. HBaseB. CassandraC. MongoDBD. Redis43. 在数据仓库中,以下哪个步骤用于将数据转换为适合分析的格式?A. 数据提取B. 数据转换C. 数据加载D. 数据清洗44. 以下哪个不是大数据技术的优势?A. 提高决策效率B. 降低成本C. 增加数据冗余D. 增强数据洞察力45. 在数据分析中,以下哪个方法用于发现数据中的模式?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析46. 以下哪个是大数据技术中的列存储数据库?A. HBaseB. CassandraC. MongoDBD. HDFS47. 在数据仓库中,以下哪个步骤用于将数据加载到数据仓库中?A. 数据提取C. 数据加载D. 数据清洗48. 以下哪个不是大数据技术的应用场景?A. 个性化推荐B. 风险管理C. 数据备份D. 智能分析49. 在数据分析中,以下哪个方法用于将数据分组?A. 聚类分析B. 关联规则C. 异常检测D. 回归分析50. 以下哪个是大数据技术中的文档存储数据库?A. HBaseB. CassandraC. MongoDBD. HDFS答案:1. D2. B3. C4. A5. C6. A7. D8. A9. B10. C11. A12. C13. C14. D15. C16. B17. C18. D19. C20. D21. C22. D23. A24. C25. A26. B27. B28. C29. B30. A31. C32. C33. A34. C35. A36. D37. D38. D39. D40. D41. C42. D43. B44. C45. A46. B47. C48. C49. A50. C。
大数据技术及应用题库
大数据技术及应用题库单选题:1 从大量数据中提取知识的过程通常称为(A)。
a. . 数据挖掘b. . 人工智能c. . 数据清洗d. . 数据仓库2 下列论据中,能够支撑“大数据无所不能”的观点的是( A )。
A、互联网金融打破了传统的观念和行为B、大数据存在泡沫C、大数据具有非常高的成本D、个人隐私泄露与信息安全担忧3 数据仓库的最终目的是(D)。
a. . 收集业务需求b. . 建立数据仓库逻辑模型c. . 开发数据仓库的应用分析d. . 为用户和业务部门提供决策支持4 大数据处理技术和传统的数据挖掘技术最大的区别是(A)。
a. . 处理速度快(秒级定律)b. . 算法种类更多c. . 精度更高d. . 更加智能化5 大数据的起源是( C )。
a. . 金融b. . 电信c. . 互联网d. . 公共管理6 大数据不是要教机器像人一样思考。
相反,它是( A )。
a. . 把数学算法运用到海量的数据上来预测事情发生的可能性b. . 被视为人工智能的一部c. . 被视为一种机器学习d. . 预测与惩罚7 人与人之间沟通信息、传递信息的技术,这指的是(D)。
a. . 感测技术b. . 微电子技术c. . 计算机技术d. . 通信技术8 数据清洗的方法不包括(D)。
a. . 缺失值处理b. . 噪声数据清除c. . 一致性检查d. . 重复数据记录处理9. 下列关于舍恩伯格对大数据特点的说法中,错误的是(D)A. 数据规模大B. 数据类型多样C. 数据处理速度快D. 数据价值密度高10规模巨大且复杂,用现有的数据处理工具难以获取、整理、管理以及处理的数据,这指的是(D)。
a. . 富数据b. . 贫数据c. . 繁数据d. . 大数据1大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的(D)。
a. . 新一代信息技术b. . 新一代服务业态c. . 新一代技术平台d. . 新一代信息技术和服务业态12万维网之父是( C )A. 彼得·德鲁克B. 舍恩伯格C. 蒂姆·伯纳斯—李D. 斯科特·布朗13下列演示方式中,不属于传统统计图方式的是(D)。
大数据技术与应用分析考试 选择题 63题
1. 大数据的“4V”特性不包括以下哪一项?A. VolumeB. VelocityC. VarietyD. Value2. Hadoop生态系统中用于数据处理的框架是?A. HBaseB. HiveC. MapReduceD. Zookeeper3. 以下哪个不是NoSQL数据库的类型?A. 键值存储B. 列存储C. 文档存储D. 关系型数据库4. 在数据仓库中,ETL过程指的是什么?A. Extract, Transform, LoadB. Encrypt, Transfer, LoadC. Extract, Transfer, LoadD. Encrypt, Transform, Load5. 以下哪个工具常用于大数据的可视化?A. TableauB. ExcelC. PowerPointD. Word6. 云计算的三种服务模型不包括以下哪一项?A. IaaSB. PaaSC. SaaSD. DaaS7. 以下哪个是大数据分析的常用编程语言?A. PythonB. JavaC. RD. 以上都是8. 数据挖掘中的分类算法不包括以下哪一项?A. 决策树B. 神经网络C. 聚类分析D. 支持向量机9. 以下哪个是Hadoop的分布式文件系统?A. HDFSB. NFSC. CIFSD. AFS10. 大数据处理中的流处理技术主要用于?A. 批量处理B. 实时处理C. 离线处理D. 分布式处理11. 以下哪个是Apache Spark的核心组件?A. Spark SQLB. Spark StreamingC. MLlibD. 以上都是12. 数据治理的主要目的是?A. 数据安全B. 数据质量C. 数据合规D. 以上都是13. 以下哪个是数据湖的特点?A. 结构化数据B. 非结构化数据C. 半结构化数据D. 以上都是14. 大数据分析中的机器学习算法不包括以下哪一项?A. 监督学习B. 非监督学习C. 强化学习D. 随机学习15. 以下哪个是Apache Kafka的主要功能?A. 数据存储B. 数据处理C. 数据流处理D. 数据分析16. 数据仓库与数据湖的主要区别在于?A. 数据结构B. 数据存储C. 数据处理D. 数据访问17. 以下哪个是大数据分析的生命周期阶段?A. 数据收集B. 数据存储C. 数据分析D. 以上都是18. 以下哪个是数据清洗的主要步骤?A. 数据去重B. 数据转换C. 数据验证D. 以上都是19. 以下哪个是数据集成的主要挑战?A. 数据一致性B. 数据质量C. 数据安全D. 以上都是20. 以下哪个是数据隐私的主要关注点?A. 数据加密B. 数据访问控制C. 数据匿名化D. 以上都是21. 以下哪个是数据备份的主要目的?A. 数据恢复B. 数据安全C. 数据存储D. 数据处理22. 以下哪个是数据恢复的主要步骤?A. 数据备份B. 数据验证C. 数据还原D. 以上都是23. 以下哪个是数据安全的主要措施?A. 数据加密B. 数据访问控制C. 数据审计D. 以上都是24. 以下哪个是数据质量的主要指标?A. 准确性B. 完整性C. 一致性D. 以上都是25. 以下哪个是数据治理的主要组成部分?A. 数据政策B. 数据标准C. 数据流程D. 以上都是26. 以下哪个是数据分析的主要方法?A. 描述性分析B. 预测性分析C. 规范性分析D. 以上都是27. 以下哪个是数据挖掘的主要技术?A. 聚类分析B. 关联规则C. 序列模式D. 以上都是28. 以下哪个是数据可视化的主要工具?A. TableauB. Power BIC. QlikViewD. 以上都是29. 以下哪个是数据仓库的主要功能?A. 数据存储B. 数据处理C. 数据分析D. 以上都是30. 以下哪个是数据湖的主要优势?A. 数据灵活性B. 数据可扩展性C. 数据多样性D. 以上都是31. 以下哪个是数据治理的主要挑战?A. 数据政策制定B. 数据标准实施C. 数据流程优化D. 以上都是32. 以下哪个是数据分析的主要挑战?A. 数据质量B. 数据安全C. 数据隐私D. 以上都是33. 以下哪个是数据挖掘的主要挑战?A. 数据质量B. 数据安全C. 数据隐私D. 以上都是34. 以下哪个是数据可视化的主要挑战?A. 数据质量B. 数据安全C. 数据隐私D. 以上都是35. 以下哪个是数据仓库的主要挑战?A. 数据质量B. 数据安全C. 数据隐私D. 以上都是36. 以下哪个是数据湖的主要挑战?A. 数据质量B. 数据安全C. 数据隐私D. 以上都是37. 以下哪个是数据治理的主要优势?A. 数据质量提升B. 数据安全增强C. 数据合规性提高D. 以上都是38. 以下哪个是数据分析的主要优势?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是39. 以下哪个是数据挖掘的主要优势?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是40. 以下哪个是数据可视化的主要优势?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是41. 以下哪个是数据仓库的主要优势?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是42. 以下哪个是数据湖的主要优势?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是43. 以下哪个是数据治理的主要目标?A. 数据质量提升B. 数据安全增强C. 数据合规性提高D. 以上都是44. 以下哪个是数据分析的主要目标?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是45. 以下哪个是数据挖掘的主要目标?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是46. 以下哪个是数据可视化的主要目标?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是47. 以下哪个是数据仓库的主要目标?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是48. 以下哪个是数据湖的主要目标?A. 数据洞察力提升B. 数据决策支持C. 数据创新能力增强D. 以上都是49. 以下哪个是数据治理的主要方法?A. 数据政策制定B. 数据标准实施C. 数据流程优化D. 以上都是50. 以下哪个是数据分析的主要方法?A. 描述性分析B. 预测性分析C. 规范性分析D. 以上都是51. 以下哪个是数据挖掘的主要方法?A. 聚类分析B. 关联规则C. 序列模式D. 以上都是52. 以下哪个是数据可视化的主要方法?A. 图表制作B. 仪表板设计C. 报告生成D. 以上都是53. 以下哪个是数据仓库的主要方法?A. 数据存储B. 数据处理C. 数据分析D. 以上都是54. 以下哪个是数据湖的主要方法?A. 数据存储B. 数据处理C. 数据分析D. 以上都是55. 以下哪个是数据治理的主要工具?A. 数据政策管理工具B. 数据标准实施工具C. 数据流程优化工具D. 以上都是56. 以下哪个是数据分析的主要工具?A. 数据分析软件B. 数据挖掘工具C. 数据可视化工具D. 以上都是57. 以下哪个是数据挖掘的主要工具?A. 数据挖掘软件B. 数据分析工具C. 数据可视化工具D. 以上都是58. 以下哪个是数据可视化的主要工具?A. 数据可视化软件B. 数据分析工具C. 数据挖掘工具D. 以上都是59. 以下哪个是数据仓库的主要工具?A. 数据仓库软件B. 数据分析工具C. 数据挖掘工具D. 以上都是60. 以下哪个是数据湖的主要工具?A. 数据湖软件B. 数据分析工具C. 数据挖掘工具D. 以上都是61. 以下哪个是数据治理的主要流程?A. 数据政策制定B. 数据标准实施C. 数据流程优化D. 以上都是62. 以下哪个是数据分析的主要流程?A. 数据收集B. 数据处理C. 数据分析D. 以上都是63. 以下哪个是数据挖掘的主要流程?A. 数据收集B. 数据处理C. 数据分析D. 以上都是答案:1. D2. C3. D4. A5. A6. D7. D8. C9. A10. B11. D12. D13. D14. D15. C16. A17. D18. D19. D20. D21. A22. D23. D24. D25. D26. D27. D28. D29. D30. D31. D32. D33. D34. D35. D36. D37. D38. D39. D40. D41. D42. D43. D44. D45. D46. D47. D48. D49. D50. D51. D52. D53. D54. D55. D56. D57. D58. D59. D60. D61. D62. D63. D。
大数据技术及应用试题库
大数据技术及应用题库单选题:1从大量数据中提取知识的过程通常称为(A)。
a. . 数据挖掘b. . 人工智能c. . 数据清洗d. . 数据仓库2下列论据中,能够支撑“大数据无所不能”的观点的是(A)。
A、互联网金融打破了传统的观念和行为B、大数据存在泡沫C、大数据具有非常高的成本D、个人隐私泄露与信息安全担忧3数据仓库的最终目的是(D)。
a. . 收集业务需求b. . 建立数据仓库逻辑模型c. . 开发数据仓库的应用分析d. . 为用户和业务部门提供决策支持4大数据处理技术和传统的数据挖掘技术最大的区别是(A)。
a. . 处理速度快(秒级定律)b. . 算法种类更多c. . 精度更高d. . 更加智能化5大数据的起源是(C)。
a. . 金融b. . 电信c. . 互联网d. . 公共管理6大数据不是要教机器像人一样思考。
相反,它是(A)。
a. . 把数学算法运用到海量的数据上来预测事情发生的可能性b. . 被视为人工智能的一部c. . 被视为一种机器学习d. . 预测与惩罚7人与人之间沟通信息、传递信息的技术,这指的是(D)。
a. . 感测技术b. . 微电子技术c. . 计算机技术d. . 通信技术8数据清洗的方法不包括(D)。
a. . 缺失值处理b. . 噪声数据清除c. . 一致性检查d. . 重复数据记录处理9. 下列关于舍恩伯格对大数据特点的说法中,错误的是(D)A. 数据规模大B. 数据类型多样C. 数据处理速度快D. 数据价值密度高10规模巨大且复杂,用现有的数据处理工具难以获取、整理、管理以及处理的数据,这指的是(D)。
a. . 富数据b. . 贫数据c. . 繁数据d. . 大数据11大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的(D)。
a. . 新一代信息技术b. . 新一代服务业态c. . 新一代技术平台d. . 新一代信息技术和服务业态12万维网之父是(C)A. 彼得·德鲁克B. 舍恩伯格C. 蒂姆·伯纳斯—李D. 斯科特·布朗13下列演示方式中,不属于传统统计图方式的是(D)。
《大数据技术与应用》考核试题及答案
大数据技术与应用考核试题一、选择题(每小题2分,共20分)1、大数据的定义是()A. 数据量大B. 数据质量高C. 数据结构复杂D. 数据价值高答案:A2、大数据的特点是()A. 存储量大B. 运算速度快C. 结构复杂D. 可视化好答案:A3、Hadoop是一个()A. 数据库B. 操作系统C. 编程语言D. 分布式计算框架答案:D4、MapReduce是一个()A. 数据库B. 操作系统C. 编程语言D. 分布式计算框架答案:D5、HBase是一个()A. 关系型数据库B. 非关系型数据库C. 搜索引擎D. 分布式文件系统答案:B二、填空题(每小题2分,共20分)1、Hadoop的核心是________ 和________ 。
答案:HDFS、MapReduce2、MapReduce的两个阶段是________ 和________ 。
答案:Map、Reduce3、HBase是一个________ 的分布式数据库。
答案:非关系型4、Hive是一个________ 的分布式数据仓库。
答案:基于Hadoop5、Spark是一个________ 的分布式内存计算框架。
答案:内存密集型三、问答题(共60分)1、请介绍大数据的定义及特点。
答:大数据是指海量、高速生成和处理的数据,它的特点有存储量大、运算速度快、结构复杂、可视化好。
大数据不仅仅是数量上的海量,还包含了数据的多样性、复杂性和动态性。
大数据可以带来新的商业价值,可以帮助企业做出正确的决策。
2、请介绍Hadoop的特点以及应用场景。
答:Hadoop是一个开源的分布式计算框架,它的特点有:1、可扩展性强,可以通过增加节点来扩展集群的规模;2、容错性强,可以在出现故障时保证数据的安全性和可靠性;3、低成本,使用Hadoop可以节省成本。
Hadoop的应用场景包括:1、大数据存储和分析;2、机器学习和人工智能;3、实时流处理和事件处理;4、图形计算和图形处理。
- 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
- 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
- 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
大数据技术及应用题库单选题:1从大量数据中提取知识的过程通常称为(A)。
a. . 数据挖掘b. . 人工智能c. . 数据清洗d. . 数据仓库2下列论据中,能够支撑“大数据无所不能”的观点的是(A)。
A、互联网金融打破了传统的观念和行为B、大数据存在泡沫C、大数据具有非常高的成本D、个人隐私泄露与信息安全担忧3数据仓库的最终目的是(D)。
a. . 收集业务需求b. . 建立数据仓库逻辑模型c. . 开发数据仓库的应用分析d. . 为用户和业务部门提供决策支持4大数据处理技术和传统的数据挖掘技术最大的区别是(A)。
a. . 处理速度快(秒级定律)b. . 算法种类更多c. . 精度更高d. . 更加智能化5大数据的起源是(C)。
a. . 金融b. . 电信c. . 互联网d. . 公共管理6大数据不是要教机器像人一样思考。
相反,它是(A)。
a. . 把数学算法运用到海量的数据上来预测事情发生的可能性b. . 被视为人工智能的一部c. . 被视为一种机器学习d. . 预测与惩罚7人与人之间沟通信息、传递信息的技术,这指的是(D)。
a. . 感测技术b. . 微电子技术c. . 计算机技术d. . 通信技术8数据清洗的方法不包括(D)。
a. . 缺失值处理b. . 噪声数据清除c. . 一致性检查d. . 重复数据记录处理9. 下列关于舍恩伯格对大数据特点的说法中,错误的是(D)A. 数据规模大B. 数据类型多样C. 数据处理速度快D. 数据价值密度高10规模巨大且复杂,用现有的数据处理工具难以获取、整理、管理以及处理的数据,这指的是(D)。
a. . 富数据b. . 贫数据c. . 繁数据d. . 大数据11大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的(D)。
a. . 新一代信息技术b. . 新一代服务业态c. . 新一代技术平台d. . 新一代信息技术和服务业态12万维网之父是(C)A. 彼得·德鲁克B. 舍恩伯格C. 蒂姆·伯纳斯—李D. 斯科特·布朗13下列演示方式中,不属于传统统计图方式的是(D)。
A、柱形图B、饼状图C、曲线图D、网络图14当前社会中,最为突出的大数据环境是(A)。
A、互联网B、物联网C、综合国力D、自然资源15可以对大数据进行深度分析的工具是(C)。
A、浅层神经网络B、ScalaD、MapReduce16大数据的起源是(C)。
A、金融B、电信C、互联网D、公共管理17智慧城市的构建,不包含(C)。
A、数字城市B、物联网C、联网监控D、云计算18大数据的4V特征中的Volume是指(D)。
A、价值密度低B、处理速度快C、数据类型繁多D、数据体量巨大19大数据的4V特征中的Variety是指(C)。
A、价值密度低B、处理速度快C、数据类型繁多D、数据体量巨大20大数据的4V特征中的Velocity是指(B)。
A、价值密度低B、处理速度快C、数据类型繁多D、数据体量巨大21下列关于大数据的分析理念的说法中,错误的是(D)。
A、在数据基础上倾向于全体数据而不是抽样数据B、在分析方法上更注重相关分析而不是因果分析C、在分析效果上更追究效率而不是绝对精确D、在数据规模上强调相对数据而不是绝对数据22大数据技术的战略意义不在于掌握庞大的数据信息,而在于对这些含有意义的数据进行(B)。
A、数据信息B、专业化处理D、内容处理23大数据的核心就是(B)。
A、告知与许可B、预测C、匿名化D、规模化24人与人之间沟通信息、传递信息的技术,这指的是(D)。
A、感测技术B、微电子技术C、计算机技术D、通信技术25大数据的最显著特征是(A)。
A、数据规模大B、数据类型多样C、数据处理速度快D、数据价值密度高28大数据正快速发展为对数量巨大、来源分散、格式多样的数据进行采集、存储和关联分析,从中发现新知识、创造新价值、提升新能力的(D)。
A、新一代信息技术B、新一代服务业态C、新一代技术平台D、新一代信息技术和服务业态29 下列关于普查的缺点的说法中,正确的是(A)。
A. 工作量较大,容易导致调查内容有限、产生重复和遗漏现象B. 误差不易被控制C. 对样本的依赖性比较强D. 评测结果不够稳定30 下列关于聚类挖掘技术的说法中,错误的是(B)A不预先设定数据归类类目,完全根据数据本身性质将数据聚合成不同类别B需求同类数据的内容相似度尽可能小C要求不同类数据的内容相似度尽可能小D与分类挖掘技术相似的是,都是要对数据进行分类处理31假设一种基因同时导致两件事情,一是使人喜欢抽烟,二是使这个人和肺癌就是(A)关系,而吸烟和肺癌则是(A)关系。
A因果;相关B相关;因果C并列;相关D因果;并列32下列关于数据交易市场的说法中,错误的是(C)A数据交易市场是大数据产业发展到一定程度的产物B商业化的数据交易活动催生了多方参与的第三方数据交易市场C数据交易市场通过生产数据、研发和分析数据,为数据交易提供帮助D数据交易市场是大数据资源化的必然产物33下列关于计算机存储容量单位的说法中,错误的是(C)A 1KB<1MB<1GBB 基本单位是字节(Byte)C 一个汉字需要一个字节的存储空间D 一个字节能够容纳一个英文字符34当前大数据技术的基础是由(C)首先提出的A微软B百度C谷歌D阿里巴巴35下列国家的大数据发展行动中,集中体现“重视基础,首度先行”的国家是(D)A美国B日本C中国D韩国36可以对大数据进行深度分析的平台工具是(C)A传统的机器学习和数据分析工具B第二代机器学习工具C第三代机器学习工具D未来机器学习工具37智能健康手环的应用开发,体现了(D)的数据采集技术的应用A统计报表B网络爬虫C API接口D传感器38过一系列处理,在基本保持原始数据完整性的基础上,减小数据规模的是(C)A数据清洗B数据融合C数据规约D数据挖掘39制成大数据业务的基础是(A)A数据科学B数据应用C数据硬件D数据人才40面向用户提供大数据一站式部署方案,包括数据中心和服务器等硬件、数据分析应用软件及技术运维支持等多方面内容的大数据商业模式是(A)A大数据解决方案模式B大数据信息分类模式C大数据处理服务模式D大数据资源提供模式41美国海军军官莫里通过对前人航海日志的分析,绘制了新的航海路线图,标明了大风与洋流可能发生的地点。
这体现了大数据分析理念中的(B)A在数据基础上倾向于全体数据而不是抽样数据B在分析方法上更注重相关分析而不是因果分析C在分析效果上更追究效率而不是绝对精确D在数据规模上强调相对数据而不是绝对数据42根据不同的业务需求来建立数据模型,抽取最有意义的向量,决定选取哪种方法的数据分析角色人员是(C)A数据管理人员B数据分析员C研究科学家D软件开发工程师43.(D)反映数据的精细化程度,越细化的数据,价值越高。
A规模B活性C关联度D颗粒度44.下列关于数据重组的说法中,错误的是(A)A数据重组是数据的重新产生和重新采集B数据重组能够使数据焕发新的光芒C数据重组实现的关键在于多源数据融合和数据集成D数据重组有利于实现新颖的数据模式创新45 在数据生命周期管理实践中,(B)是执行方法。
A数据存储和备份规范B数据管理和维护C数据价值发觉和利用D数据应用开发和管理46 下列关于网络用户行为的说法中,错误的是(C)A网络公司能够捕捉到用户在其网站上的所有行为B用户离散的交互痕迹能够为企业提升服务质量提供参考C数字轨迹用完即自动删除D用户的隐私安全很难得以规范保护47 Mac OS系统的开发者是(C)A微软公司B惠普公司C苹果公司DIBM公司48 大数据时代,数据使用的关键是(D)A数据收集B数据存储C数据分析D数据再利用49 下列关于数据交易市场的说法中,错误的是(C)A数据交易市场是大数据产业发展到一定程度的产物B商业化的数据交易活动催生了多方参与的第三方数据交易市场C数据交易市场通过生产数据、研发和分析数据,为数据交易提供帮助D数据交易市场是大数据资源化的必然产物50 下列论据中,能够支撑“大数据无所不能”的观点的是(A)A互联网金融打破了传统的观念和行为B大数据存在泡沫C大数据具有非常高的成本D个人隐私泄露与信息安全担忧51数据仓库的最终目的是(D)A收集业务需求B建立数据仓库逻辑模型C开发数据仓库的应用分析D为用户和业务部门提供决策支持52 支撑大数据业务的基础是(B)A数据科学B数据应用C数据硬件D数据人才53、下列关于大数据预测的说法中,错误的是(D)A人类的生活正在被大数据预测深刻改变B预测性分析是大数据最核心的功能C分析从“面向已经发生的过去”转向“面向即将发生的未来”是大数据与传统数据的最大区别D大数据预测则是基本大数据和预测模型去预测过去某件事情的概率54、一切事物及事物运动的状态,不仅销售数据、价格这些客观标准可以形成大数据,甚至连顾客情绪(如色彩、空间的感知等)都可以测得,这体现了大数据思维维度中的(A)A定量思维B相关思维C因果思维D实验思维55、下列国家的大数据发展行动中,坚持原则先行、谨慎发展的国家是(D)A英国B韩国C印度D澳大利亚56、下列论据中,体现“冷眼”看大数据的观点是(B)A互联网金融打破了传统的观念和行为B大数据医疗正在走进平民百姓C数据资产型企业前景光明D个人隐私泄露与信息安全担忧57、下列国家的大数据发展行动中,视大数据为新的自然资源的国家是(D)A中国B韩国C印度D新加坡58、大数据环境下的隐私担忧,主要表现为(A)A个人信息的被识别与暴露B用户画像的生成C恶意广告的推送D病毒侵入59、对线下零售而言,做好大数据分析应用的前提是(C)A增加统计种类B扩大营业面积C增加数据来源D开展优惠促销60、万维网的实施国家是(B)A英国B美国C德国D印度61、一切皆可试,大数据分析的效果好坏,可能通过模拟仿真或者实际运行来验证,这体现大数据思维中的(D)A定量思维B相关思维C因果思维D实验思维62、下列企业中,最有可能成为典型的数据资产运营商的是(D)A物联网企业B互联网企业C云计算企业D电信运营商多选题:1云计算的优势体现在以下哪些方面?(ABCD)a. . 云计算服务更加安全可靠b. . 云计算可以真正实现按需服务c. . 云计算可以有效提高资源利用率d. . 云计算可以大大降低成本和能耗2医疗领域如何利用大数据?(ABCD)a. . 临床决策支持b. . 个性化医疗c. . 社保资金安全d. . 用户行为分析3下列各国大数据发展路径的描述中,对应关系正确的是(ACDE)。
A. 日本:走尖端IT路线B. 英国:视大数据为新的自然资源C. 韩国:重视基础、首都先行D 印度:以IT外包转型为突破口E 澳大利亚:原则先行,谨慎发展4 当前,大数据产业发展的特点是(BCE)A规模较大B规模较小C增速很快D增速缓慢E 多产业交叉融合5 下列关于发数据的说法中,错误的是(AD)A大数据具有体量大、结构单一、时效性强的特征B处理大数据需采用新型计算机架构和智能算法等新技术C大数据的应有注重相关分析而不是因果分析D大数据的应有注重因果分析而不是相关分析E大数据的目的在于发现新的知识与洞察并进行科学决策6 下列关于基于大数据的营销模式和传统营销模式的说法中,错误的是(ABC)A传统营销模式比基于大数据的营销模式投入更小B传统营销模式比基于大数据的营销模式针对性更强C传统营销模式比基于大数据的营销模式转化率低D基于大数据的营销模式比传统营销模式实时性更强E基于大数据的营销模式比传统营销模式标准性更强7 按照服务目的不同,数据流通平台可分为(CDE)A政府数据开放平台B企业数据开放平台C数据交易市场D数据研发市场E数据废弃交易市场8 下列论据中,能够支撑“大数据唔多不能”的观点的是(ADE)A互联网金融打破了传统的观念和行为B大数据存在泡沫C大数据具有非常高的成本D大数据医疗正在走进平民百姓E数据资产型企业前景光明9 大数据的价值体现在(ABCDE)A大数据给思维方式带来了冲击B大数据为政策制定提供科学依据C大数据助力智慧城市提升公共服务水平D大数据实现了精准营销E大数据的发力点在于预测10 当前大数据技术的基础包括(ABD)A分布式文件系统B分布式并行计算C关系型数据库D分布式数据库E非关系型数据库11 可视化高维展示技术在展示数据之间的关系以及数据分析结果方面的作用是(BD)A能够直观反映成对数据之间的空间关系B能够主观反映多维数据之间的空间关系C能够静态演化事物的变化及变化的规律D能够动态演化事物的变化及变化的规律12 下列关于计算机存贮容量单位换算关系的公式中,正确的是(BE)A. 1KB=1012ByteB. 1KB=1024BytesC. 1GB=1024KBD. 1GB=1012MBE. 1GB=1024MB13、在网络爬虫的爬行策略中,应用最为基础的是(AB)A深度优先遍历策略B广度优先遍历策略C高度优先遍历策略D反向链接策略E大战优先策略14、当前,大数据产业发展的特点是(ACE)A规模较大B规模较小C增速很快D增速缓慢E多产业交叉融合15、下列关于数据生命周期管理的核心认识中,正确的是(ABC)A数据从产生到被删除销毁的过程中,具有多个不同的数据存在阶段B在不同的数据存在阶段,数据的价值是不同的C根据数据价值的不同应该对数据采取不同的管路策略D数据生命周期管理旨在产生效益的同时,降低生产成本E数据生命周期管理最终关注的是社会效益16、下列关于基于大数据的营销模式和传统营销模式的说法中,错误的是(AB)A传统营销模式比基于大数据的营销模式投入更小B传统营销模式比基于大数据的营销模式针对性更强C传统营销模式比基于大数据的营销模式转化率低D基于大数据的营销模式比传统营销模式实时性更强E基于大数据的营销模式比传统营销模式精准性更强17、下列关于脏数据的说法中,正确的是(ABCDE)A格式不规范B编码不统一C意义不明确D与实际业务关系不大E数据不完整18、数据再利用的意义在于(ABC)A挖掘数据的潜在价值B实现数据重组的创新价值C利用数据可扩展性拓宽业务领域D优化存储设备,降低设备成本E提高社会效益,优化社会管理19、按照涉及自变量的多少,可以将回归分析分为(CD)A线性回归分析B非线性回归分析C一元回归分析D多元回归分析E综合回归分析20、传统数据密集型行业积极探索和布局大数据应用的表现是(BCE)A投资入股互联网电商行业B打通多源跨域数据C提高分析挖掘能力D自行开发数据产品E实现科学决策与运营21、大数据人才整体上需要具备(ABE)等核心知识。