この単元のつまずきポイント

「正規化=平均0」と覚えてしまい、最大1・最小0にスケーリングするmin-max正規化と、平均0・分散1にする標準化を混同します。テストの偏差値が標準化の応用だと気づけず、計算式の選び方を間違えがちです。

このテーマで実際に生成した教材

下の枠内が、まなびAIがこのテーマで実際に生成した教材です。読み解きにくい学習指導要領は、デジタル庁が推進する国産AI「源内」の一部である法令検索AI「Lawsy」の技術で検索・参照し、約30秒で出力されました。

私たちの身の回りには、日々膨大なデータが生まれています。これらのデータを分析し、そこから意味のある情報や知識を引き出す「データサイエンス」は、現代社会において非常に重要な役割を担っています。しかし、データはそのままでは使いにくいことが多く、分析を始める前に「データの整形」や「前処理」が必要です。

データの整形には様々な方法がありますが、特に混同されやすい概念として「正規化」と「標準化」があります。これらはどちらもデータを扱いやすくするための重要なプロセスですが、その目的や使われる場面が異なります。この教材では、それぞれの概念と、どのような時に使うべきかを分かりやすく解説します。

データの「正規化」(Normalization)とは?

データの「正規化」は、主にデータベースを設計する際に用いられる考え方です。その目的は、データの重複(冗長性)をなくし、データの整合性を保ち、効率的にデータを扱えるようにすることです。

想像してみてください。もし、あなたの学校の生徒名簿が、クラスごとにバラバラに作られていて、同じ生徒の情報(名前、住所、電話番号など)が複数の名簿に何度も書かれているとしたらどうでしょう?

  • ある名簿で生徒の住所を修正したのに、別の名簿では古い住所のままになっている(データの矛盾)。
  • 新しい生徒が転校してきたとき、すべての名簿に同じ情報を入力しなければならない(入力の手間とミスのもと)。
  • 名簿の数が多くなると、どこにどの情報があるか分かりにくくなる。

このような問題を防ぎ、データをより効率的に管理するために、「正規化」を行います。具体的には、データベースのテーブル(表)をいくつかのルールに沿って分割したり、整理したりすることで、データの重複を排除し、データの更新・削除・追加を簡単かつ正確に行えるようにします。

データベースの正規化には、第一正規形、第二正規形、第三正規形といった段階がありますが、これらは「データをより良い形に整理していくためのルール」と考えてください。

適用場面: データベースを設計・構築するとき。

データの「標準化」(Standardization)とは?

データの「標準化」は、主にデータ分析や機械学習を行う前の前処理として用いられます。その目的は、異なる単位や尺度のデータを、比較しやすいように同じ基準に揃えることです。これにより、データ分析の精度を向上させたり、機械学習モデルが正しく学習できるようにしたりします。

例えば、ある人の身長(単位:cm)と体重(単位:kg)のデータがあったとします。身長は150〜180cm、体重は40〜80kgといったように、値の範囲や単位が異なります。このままでは、データ分析のアルゴリズムが身長と体重のどちらをより重要視すべきか判断しにくくなることがあります。

標準化を行うことで、これらのデータを同じような範囲の値に変換し、すべてのデータ項目が公平に扱われるようにします。標準化にはいくつかの方法がありますが、高校の「情報」で扱うデータ分析の文脈では、主に以下の2つの方法がよく使われます。

  1. Min-Maxスケーリング(最小値-最大値正規化)

データを0から1の範囲に変換する方法です。

$$x_{new} = \frac{x - x_{min}}{x_{max} - x_{min}}$$

ここで、$x$ は元のデータ、$x_{min}$ はデータの最小値、$x_{max}$ はデータの最大値です。

  1. Z-score標準化

データを、平均が0、標準偏差が1になるように変換する方法です。これにより、データの分布の中心を0に揃え、ばらつきの度合いを統一できます。

$$x_{new} = \frac{x - \mu}{\sigma}$$

ここで、$x$ は元のデータ、$\mu$(ミュー)はデータの平均値、$\sigma$(シグマ)はデータの標準偏差です。

適用場面: データ分析、特に機械学習モデルの訓練を行う前処理。

「正規化」と「標準化」の違いと使い分け

ここまで見てきたように、「正規化」と「標準化」は、それぞれ異なる目的と適用場面を持っています。

  • 目的の違い

* 正規化: データベースの構造を整理し、データの重複を排除し、整合性を保つため。

* 標準化: データ分析の準備として、データの尺度を揃え、分析精度を高めるため。

  • 対象の違い

* 正規化: データベースのテーブル(表)の構造そのもの。

* 標準化: 各データ項目(数値データ)の値。

  • 混同しやすい点

統計学や機械学習の文脈で、Min-Maxスケーリングを「正規化」と呼ぶことがあります。これは、データベースの「正規化」とは全く別の概念であり、データの値を特定の範囲に収める処理を指します。言葉が似ているため混乱しやすいですが、文脈によって意味が異なることを理解しておくことが重要です。

まとめ

データの「正規化」と「標準化」は、どちらもデータを適切に扱うための重要なプロセスです。しかし、その目的と適用場面は大きく異なります。

  • データベースを設計・管理する際は「正規化」 を行い、データの重複をなくし、整合性を保ちましょう。
  • データを分析・機械学習に活用する際は「標準化」 を行い、異なる尺度や単位のデータを公平に扱えるように準備しましょう。

これらの違いを理解し、適切な場面で適切な処理を行うことで、より効果的にデータを活用できるようになります。

形式: 練習 参照: 第10節 情   報 > 第2 情報Ⅱ > 2 内 容 > (3) 情報とデータサイエンス

編集・参照情報

  • 編集・運営: かわさき楽AIサポート(株式会社スマイルファクトリー)
  • 作成方法: 学習指導要領データを検索し、AI生成教材を編集して掲載
  • 参照範囲: 第10節 情   報 > 第2 情報Ⅱ > 2 内 容 > (3) 情報とデータサイエンス
  • 公開日: 2026年7月3日

この教材の使い方

保護者の方は、まず本文の「正規化」と「標準化」の目的の違いをお子さまと一緒に音読するところから始めてみてください。生徒名簿の例え話を身近な場面(部活の連絡網、家庭の買い物リストなど)に置き換えて話し合うと、抽象的な概念が定着しやすくなります。

塾講師の方は、導入で「なぜ前処理が必要か」を問いかけ、比較・可視化・機械学習という三つの目的別に、正規化と標準化のどちらが向くかを生徒自身に予想させてから本文で答え合わせをする流れが効果的です。誤答例を共有すると理解が深まります。

さらに理解を深めたい生徒本人には、扱いたいデータの目的(比較・可視化・機械学習など)をAIに伝え、どちらの前処理が適切かを理由つきで提案してもらう演習をおすすめします。返ってきた回答を本文と照らし合わせることで、判断基準が自分の言葉で説明できるようになります。

同じテーマで、お子さま専用の教材を作れます

このページの教材は一例です。質問を変えれば、つまずいているポイントに合わせた教材が生成できます。

この続きをまなびAIで作る

よくある質問

「正規化」と「標準化」は、テスト勉強でどちらを重点的に覚えさせるべきでしょうか?

情報Iでは両方の用語が登場しますが、目的と適用場面が異なる点を区別できることが重要です。出題傾向は学校ごとに差がありますので、優先順位は学校の先生にご確認ください。

子どもが「正規化」と「標準化」を混同してしまいます。家庭で説明を手伝うコツはありますか?

「正規化はデータベース設計で重複をなくすため」「標準化はデータ分析の前処理」と、使う場面をセットで覚えさせるのが有効です。具体例は教材本文の生徒名簿の話が参考になります。

データベースの知識は普段パソコンを使わない家庭でもサポートできますか?

本教材は概念の理解を目的としているため、専用ソフトがなくても身近な名簿の例で説明できます。実習で必要な環境については、ご家庭の判断で学校の指示に合わせてご準備ください。