データクレンジング(データ前処理)とは?
データクレンジング(データ前処理)とは、分析やシステム統合の前に、表記のゆれ、欠損値、重複、明らかな誤り、外れ値を検出して整える作業。分析プロジェクトの工数の大半がここに費やされるとされ、前処理の品質がそのまま分析結果の信頼性を決めるため、応用情報でも活用の前提として問われる。
でーたくれんじんぐ
データクレンジング(データ前処理)の意味
分析やシステム統合の前に、表記のゆれ、欠損値、重複、明らかな誤り、外れ値を検出して整える作業。分析プロジェクトの工数の大半がここに費やされるとされ、前処理の品質がそのまま分析結果の信頼性を決めるため、応用情報でも活用の前提として問われる。
データクレンジング(データ前処理)の具体例
顧客マスタで「(株)」「株式会社」「㈱」を統一し、住所とフリガナを使って同一法人を1件にまとめる名寄せを行う。欠損値は件数が少なければ除外、多ければ平均値や直近値で補完し、補完した事実をフラグとして残して後の解釈を誤らせないようにする。
データクレンジング(データ前処理)は試験でどう引っ掛けられる?
外れ値を一律に除去すると、不正検知や設備異常検知のように「外れ値そのものが分析対象」の用途では目的を壊す。欠損の削除は件数が減るだけでなく、欠損の発生に偏りがあると結果にバイアスが入る点も押さえる。
データクレンジング(データ前処理)と関連する用語
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。