ビッグデータ処理基盤(Hadoop・MapReduce)とは?
ビッグデータ処理基盤(Hadoop・MapReduce)とは、大量データを多数の安価なサーバへ分散して蓄積・処理する仕組み。分散ファイルシステム(HDFS)がデータを複製しながら分割保持し、MapReduceが「分割して各ノードで処理(Map)→集約(Reduce)」の2段階で並列計算する。
基本情報技術者試験の過去問では1回出題されています。
びっぐでーたしょりきばん
ビッグデータ処理基盤(Hadoop・MapReduce)の意味
大量データを多数の安価なサーバへ分散して蓄積・処理する仕組み。分散ファイルシステム(HDFS)がデータを複製しながら分割保持し、MapReduceが「分割して各ノードで処理(Map)→集約(Reduce)」の2段階で並列計算する。
ビッグデータ処理基盤(Hadoop・MapReduce)の具体例
1TBのアクセスログからURL別の件数を数える場合、各ノードが担当ブロックを読んで(URL,1)を出力し、同じURLを1ノードへ集めて合計する。ノードを増やせばほぼ台数に比例して時間が短くなる。
ビッグデータ処理基盤(Hadoop・MapReduce)は試験でどう引っ掛けられる?
台数を増やせば必ず速くなるわけではない。Map結果をネットワーク越しに集めるシャッフル段が支配的になると台数効果が頭打ちになる。またレコード単体の低遅延応答には向かず、バッチ向きである点も狙われる。
ビッグデータ処理基盤(Hadoop・MapReduce)と関連する用語
ビッグデータ処理基盤(Hadoop・MapReduce)が出た過去問
多数のサーバで構成された大規模な分散ファイルシステム機能を提供し、MapReduceによる大規模データの分散処理を実現するOSSはどれか。
正解:Apache Hadoop
要点:HadoopはHDFSとMapReduceによる大規模分散処理のOSS基盤
大量データを多数のサーバに分散配置し、MapReduceという枠組みで並列に処理する基盤を提供するOSSがApache Hadoopである。分散ファイルシステムのHDFSとMapReduceの2つが中核で、いわゆるビッグデータ処理の代表的な基盤として位置づけられる。同じApache系でも、メッセージ配信やインメモリ処理など役割の異なる製品と混同しないようにしたい。
出典:平成30年度 春期 基本情報技術者試験 午前 問20(IPA)
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。