hadoop面试题!这6个!经常问!

问题一:什么是Hadoop?

Hadoop是一个开源软件框架,用于存储大量数据,并在具有多个廉价硬件节点(即低成本硬件)的集群上处理/查询这些数据。简而言之,Hadoop由以下部分组成:

HDFS(Hadoop分布式文件系统):HDFS允许您以分布式和冗余的方式存储大量数据。例如,1 GB(即1024 MB)文本文件可以拆分为16*128MB文件,并存储在Hadoop集群中的8个不同节点上。每个拆分可以复制3次以获得容错性,这样,如果1个节点关闭,您就可以访问备份。HDFS适用于顺序 一次写入和多次读取类型访问。

MapReduce:一个计算框架。它以分布式和并行的方式处理大量数据。当您为年龄大于18岁的所有用户查询上述1 GB文件时,将显示并行运行的“8 map”函数,在其128MB拆分文件中提取年龄大于18岁的用户,然后运行“reduce”函数,将所有单个输出合并为一个最终结果。

YARN(又一个资源管理器):作业调度和集群资源管理的框架。

Hadoop生态系统,拥有15多种框架和工具,如Sqoop, Flume, Kafka, Pig, Hive, Spark, Impala等,可将数据摄取到HDFS中,在HDFS中对数据进行处理(即转换,填充,聚合等),并从HDFS中查询数据以进行商业智能和分析。ig和Hive等工具是MapReduce之上的抽象层,而Spark和Impala等其他工具是MapReduce的改进架构/设计,可以大大改善延迟,以支持近实时(即NRT)和实时处理。

问题2:为什么商业公司要从传统的数据仓库工具转移到基于Hadoop生态系统的更智能的数据中心?

各组织正在进行努力,以增强他们的:

现有数据基础设施:

主要使用存储在高端和昂贵存储中的“结构化数据”

主要作为ETL批处理作业处理,用于将数据摄取到RDBMS和数据仓库系统中进行数据挖掘、分析和报告,以做出关键业务决策。

主要处理千兆字节到兆兆字节的数据量

基于Hadoop的更智能的数据基础设施

结构化(如RDBMS)、非结构化(如图像、PDF、文档)和半结构化(如日志、XML)数据可以以可扩展和容错的方式存储在更便宜的机器中。

数据可以通过批处理作业和近实时(即NRT、200毫秒至2秒)流式处理(如Flume和Kafka)摄取。

使用Spark和Impala等工具可以低延迟(即低于100毫秒)查询数据。

可以存储兆兆字节到兆兆兆字节的更大数据量。

这使商业公司能够使用更智能和更大的数据做出更好的业务决策,并使用更强大的工具来摄取数据、处理存储的数据(例如聚合、充实、转换等),以及查询具有低延迟功能的已被征用数据,以进行报告和业务智能。

问题3:智能和大型数据中心架构与传统的数据仓库架构有何不同?

传统的企业数据仓库架构

基于Hadoop的数据中心架构

问题4:基于Hadoop的数据中心有哪些好处?

随着数据量和复杂性的增长,改进了整体SLA(即服务水平协议)。例如,“无共享”架构,并行处理,内存密集型处理框架(如Spark和Impala)以及YARN容量调度程序中的资源抢占。

扩展数据仓库可能很昂贵。添加额外的高端硬件容量和  数据仓库工具许可可能会花费更多。基于Hadoop的解决方案不仅可以通过商用硬件节点和  开源工具降低成本,还可以通过将数据转换卸载到Spark和Impala等Hadoop工具来补充数据仓库的解决方案,从而更有效地并行处理大数据。这也将释放数据仓库资源。

探索新的途径和线索。Hadoop可以为数据科学家提供探索性沙箱,以发现社交媒体,日志文件,电子邮件等中可能有价值的数据,这些数据通常在数据仓库中不可用。

灵活性更好。业务需求通常会发生变化,这需要更改架构和报告。基于Hadoop的解决方案不仅可以灵活地处理不断发展的模式,还可以处理来自不同来源的半结构化和非结构化数据,如社交媒体,应用程序日志文件,图像,PDF和文档文件。

【大数据开发学习资料领取方式】:加入大数据技术学习交流扣扣群458345782,私信管理员即可免费领取开发工具以及入门学习资料

问题5:大数据解决方案的关键步骤是什么?

接收数据、存储数据(即数据建模)和处理数据(即数据打包、数据转换和查询数据)。

摄取数据

从各种来源提取数据,如:

关系数据库管理系统,如Oracle、MySQL等。

ERP企业资源规划(即ERP)系统,如SAP。

CRM客户关系管理系统,如Siebel、Salesforce等。

社交媒体提要和日志文件。

平面文件、文档和图像。

并将它们存储在基于“Hadoop分布式文件系统”的数据集群上,该文件缩写为HDFS。数据可以通过批处理作业(例如每15分钟运行一次,每晚一次等),近实时流(即100ms到2分钟)和实时流(即100ms以下)进行摄取。

Hadoop中使用的一个常用术语是“ Schema-On-Read ”。这意味着可以根据处理应用程序的要求,在处理时应用结构,将未处理(也称为原始)数据加载到HDFS中。这与“Schema-On-Write”不同,后者在RDBMS中使用,其中需要在加载数据之前定义模式。

存储数据

数据可以存储在HDFS或NoSQL数据库(如HBase)上。HDFS 针对顺序访问  和“一次写入和多次读取”的使用模式进行了优化。HDFS具有高读取和写入速率,因为它可以将I / O并行化为多个驱动器。HBase位于HDFS之上,以列的方式将数据存储为键/值对。HBase适用于随机读/写访问。在将数据存储在Hadoop之前,您需要考虑以下事项:

数据存储格式:可以应用多种文件格式(例如CSV,JSON,序列,AVRO,Parquet等)和数据压缩算法(例如snappy,LZO,gzip,bzip2等)。每个都有特殊的优势。像LZO和bzip2这样的压缩算法是可拆分的。

数据建模:尽管Hadoop具有无架构特性,但架构设计仍是一个重要的考虑因素。这包括存储在HBase,Hive和Impala中的对象的目录结构和模式。Hadoop通常充当整个组织的数据中心,并且数据旨在共享。因此,精心构建和组织存储数据非常重要。

元数据管理:与存储数据相关的元数据。

多租户:随着更智能的数据中心托管多个用户,组和应用程序。这通常会带来与治理,标准化和管理相关的挑战。

处理数据

Hadoop的处理框架使用HDFS。它使用“ 无共享 ”架构,在分布式系统中,每个节点完全独立于系统中的其他节点。没有像CPU、内存和磁盘存储这样的共享资源会成为瓶颈。Hadoop的处理框架(如Spark,Pig,Hive,Impala等)处理数据的不同子集,无需管理对共享数据的访问。“ 无共享 ”架构具有很高的可扩展性,因为可以添加更多节点而无需进一步争用和 容错 ,因为每个节点是独立的,并且没有单点故障,且系统可以从单个节点的故障中快速恢复。

问题6:您将如何选择存储和处理数据的不同文件格式?

关键设计决策之一是基于以下方面的文件格式:

使用模式如访问50列中的5列,而不是访问大多数列。

并行处理的可分割性。

块压缩节省存储空间与读/写/传输性能

用于添加字段,修改字段和重命名字段的模式演变。

CSV文件

CSV文件通常用于在Hadoop和外部系统之间交换数据。CSV可读且可分析。CSV对于从数据库批量加载到Hadoop或分析数据库非常方便。在Hadoop中使用CSV文件时,不要包含页眉或页脚行。文件的每一行都应该包含记录。CSV文件限制了对架构评估的支持,因为新字段只能附加到记录的末尾,而现有字段永远都不受限制。CSV文件不支持块压缩,因此压缩CSV文件会带来巨大的读取性能成本。

JSON文件

JSON记录不同于JSON文件;每一行都是它自己的JSON记录。由于JSON为每个记录同时存储模式和数据,因此它支持完整的模式演化和可分割性。此外,JSON文件不支持块级压缩。

序列文件

序列文件以二进制格式存储数据,其结构与CSV文件类似。与CSV文件不同,序列文件支持块压缩。序列文件也可拆分。序列文件可以用来解决“小文件问题”,通过组合较小的XML文件,将文件名存储为键,文件内容存储为值。由于读取序列文件的复杂性,它们更适合于飞行中(即中间)的数据存储。

注意:序列文件是以Java为中心的,不能跨平台使用。

Avro文件

这些适用长期存储。Avro文件存储带有数据的元数据,但也允许指定用于读取文件的独立模式。这样可以实现完整的模式演变支持,允许您通过定义新的独立模式来重命名、添加和删除字段以及更改字段的数据类型。Avro文件以JSON格式定义架构,数据将采用二进制JSON格式。Avro文件也是可拆分的,  并支持块压缩。更适合使用模式需要行级访问的地方。这意味着将查询该行中的所有列。当一行有50+列且使用模式只需要访问10列或更少列时不适用。Parquet文件格式更适合此列访问使用模式。

柱状格式,例如RCFile,ORC

RDBM以面向行的方式存储记录,因为这对于需要获取记录的许多列的情况很有效。如果在将记录写入磁盘时所有列值都是已知的,那么面向行的写入也是有效的。但是,如果只获取一行中10%的列,或者在写入时不知道所有列的值,那么这种方法就没有效率。这就是柱状文件更有意义的地方。所以柱状格式很好用。

在不属于查询的列上跳过I / O和解压缩

用于只访问一小部分列的查询。

对于数据仓库类型的应用程序,用户希望在大量记录集合上聚合某些列。

RC&ORC格式是专门用Hive编写的,而不是作为Parquet的通用格式。

Parquet文件

Parquet文件是一个像RC和ORC的柱状文件。Parquet文件支持块压缩并针对查询性能进行了优化,因为可以从50多列记录中选择10个或更少的列。Parquet文件写入性能比非柱式文件格式慢。Parquet还支持有限的模式演变,允许在最后添加新列。可以使用Avro API和Avro架构读取和写入Parquet。

因此,总而言之,您应该优先考虑序列,Avro和Parquet文件格式; 用于原始和中间存储的序列文件,以及用于处理的Avro和Parquet文件。

©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 158,425评论 4 361
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 67,058评论 1 291
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 108,186评论 0 243
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 43,848评论 0 204
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 52,249评论 3 286
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 40,554评论 1 216
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 31,830评论 2 312
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 30,536评论 0 197
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 34,239评论 1 241
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 30,505评论 2 244
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 32,004评论 1 258
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 28,346评论 2 253
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 32,999评论 3 235
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 26,060评论 0 8
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 26,821评论 0 194
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 35,574评论 2 271
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 35,480评论 2 267

推荐阅读更多精彩内容