データ分析法・第7回「多変量解析概説・数量化Ⅰ類」
授業情報
| 項目 | 内容 |
|---|---|
| 科目 | データ分析法 |
| 回数 | 第7回 |
| テーマ | 多変量解析概説・数量化Ⅰ類 |
| 日付 | (未記入) |
1. 多変量解析とは
重回帰分析のように**3つ以上の変数(変量)を扱う分析手法を総称して多変量解析(multivariate analysis)**という。分析の目的と使用する変数の尺度に応じて適切な手法を選ぶ必要がある。
| 用語 | 説明 |
|---|---|
| 外的基準 | 予測・説明の対象となる基準(=目的変数があるかどうか) |
| 目的変数(response / criterion / dependent variable) | 予測・説明される側の変数 |
| 説明変数(予測変数・independent variable) | 予測・説明に使用する側の変数 |
2. 多変量解析の主な分類
2-1. 外的基準あり(目的変数がある)
説明変数・目的変数の尺度(質的/量的)によって以下4種類に分類される。
| 説明変数 | 目的変数 | 手法 |
|---|---|---|
| 質的 | 質的 | 数量化Ⅱ類 |
| 量的 | 質的 | 判別分析 |
| 質的 | 量的 | 数量化Ⅰ類 |
| 量的 | 量的 | 重回帰分析 |
2-2. 外的基準なし(目的変数がない)
複数の変数を圧縮・整理したり、関係性を検討したりする。
| 尺度 | 手法 | 目的 |
|---|---|---|
| 量的 | 因子分析 | 観測データから潜在変数を見つけ出す(潜在変数→観測変数) |
| 量的 | 主成分分析 | 観測データから合成変数を構築(観測変数→合成変数) |
| 量的 | クラスター分析 | 外的基準なしでデータを分類 |
| 質的 | 数量化Ⅲ類(コレスポンデンス分析) | ― |
💡 因子分析と主成分分析は混同されやすいが、想定する因果関係が逆(因子分析:潜在変数(原因)→観測変数(結果)、主成分分析:観測変数(原因)→合成変数(結果))
2-3. 両者を合わせた分析(第3の多変量解析)
外的基準の有無を同時に扱える拡張手法:共分散構造分析・構造方程式モデリング(SEM)
3. 数量化Ⅰ類とは
回帰分析が量的な説明変数から量的な目的変数を予測するのに対し、質的な説明変数から量的な目的変数を予測するのが数量化Ⅰ類(quantification method of the first type)。
- を**カテゴリー・スコア(category score)**という(重回帰の偿回帰係数に相当)
- は該当すれば1、しなければ0を代入する(実際の回帰式は該当カテゴリーのスコアと切片の合計)
例題①:面積・バストイレ・鉄筋の有無から家賃を予測(ichirui.csv)
重回帰の例題と同じアパートデータを元に、面積を間取り(質的変数)に変換し、バストイレの別(一緒=1、別々=2)と鉄筋か否か(木造=1、鉄筋=2)の2変数を追加した3変数から家賃を説明。
4. Rによる数量化Ⅰ類(factor() + lm())
4-1. 実行コマンド
x <- read.csv("ichirui.csv") # 列名: rent, area, bath, rebar
areaf <- factor(x$area) # 質的データとして定義
bathf <- factor(x$bath)
rebarf <- factor(x$rebar)
lm(x$rent ~ areaf + bathf + rebarf) # 数量化Ⅰ類の実施
- 重回帰分析と同じ
lm()関数を使用するが、事前にfactor()で各変数を質的データとして定義するのがポイント
4-2. 出力結果:カテゴリー・スコア
| カテゴリー | スコア | カテゴリー | スコア |
|---|---|---|---|
| 切片 | 5.488 | ||
| 面積1 | 0 | バス・トイレ1 | 0 |
| 面積2 | 1.431 | バス・トイレ2 | 1.767 |
| 面積3 | 4.459 | 鉄筋・木造1 | 0 |
| 面積4 | 7.736 | 鉄筋・木造2 | 0.437 |
- 予測式:家賃 = 切片 + 面積のCS + バス・トイレのCS + 鉄筋・木造のCS
- 例:面積3・バス・トイレ1・鉄筋・木造2の組み合わせ → 5.488 + 4.459 + 0 + 0.437 = 10.384万円
4-3. 結果の詳細(summary)
result <- lm(x$rent ~ areaf + bathf + rebarf)
summary(result)
- 各係数の有意確率、重決定係数(R²)、自由度調整済み決定係数を確認できる。例題①:R² = 0.813
⚠️ 注意:数量化Ⅰ類では1つの説明変数内のカテゴリー数が多いと
lm()上の説明変数数が増えるため、自由度調整済み決定係数の意味合いが薩れる点に注意。
5. ダミー変数を使用した数量化Ⅰ類
5-1. ダミー変数(dummy variable)とは
0と1の組み合わせで、1を最大1回だけ使用する形で表すデータ。基準となるカテゴリー(例:面積1)は全て0になるので省略され、元の変数の数より1つ少ない変数で表される。ダミー変数化すれば、数量化Ⅰ類は通常の重回帰分析と同じように実施できる。
5-2. Rでの実施(dammy.csv:列名 rent, area2, area3, area4, bath2, rebar2)
y <- read.csv("dammy.csv")
result2 <- lm(y$rent ~ y$area2 + y$area3 + y$area4 + y$bath2 + y$rebar2)
summary(result2)
- 面積1・バス・トイレ一緒(bath1)・木造(rebar1)が全て0となり、カテゴリー・スコアの基準となる
- 結果は
factor()を使った数量化Ⅰ類と同じ値になる
💡 ダミー変数の作り方(どのカテゴリーを基準にするか)によってカテゴリー・スコアの値は変わるが、その分切片も変わるため、予測式としては数学的に同じ。
6. 練習問題:スポーツ新聞の売上予測(ichirui2.csv / dammy2.csv)
天気(晴・雨・曇り)・前日のチームの勝敗(勝利・敗戦・試合なし)・中央競馬の開催有無を説明変数とし、スポーツ新聞の売り上げを予測。
| カテゴリー | スコア |
|---|---|
| 切片 | 61.378 |
| 勝敗1(勝利) / 天気1(晴れ) | 0 |
| 勝敗2(敗戦) | −9.160 |
| 天気2(雨) | −4.518 |
| 勝敗3(なし) | −7.418 |
| 天気3(曇り) | −3.721 |
| 競馬1(なし) | 0 |
| 競馬2(あり) | 14.317 |
重決定係数(R²) = 0.772
7. 復習用例題:健康診断データから血糖値を予測(ichiruir.csv / dammyr.csv)
喫煙習慣・飲酒習慣・体型(3変数)を説明変数、空腹時血糖値を目的変数とした数量化Ⅰ類。
| 項目 | 値 |
|---|---|
| 切片 | 85.378 |
| 喫煙1(喫煙習慣あり)のカテゴリースコア | 6.445 |
| 飲酢1(時々)のカテゴリースコア | 5.065 |
| 飲酢2(ほぼ毎日)のカテゴリースコア | 1.649 |
| 体型1(肥満度1)のカテゴリースコア | 6.421 |
| 体型2(肥満度2以上)のカテゴリースコア | 19.466 |
| 重決定係数(R²) | 0.365 |
まとめ
- 多変量解析:3変数以上を扱う分析の総称。外的基準(目的変数)の有無と変数の尺度で手法を選ぶ
- 数量化Ⅰ類:質的説明変数から量的目的変数を予測。Rでは
factor()で質的化してからlm() - カテゴリー・スコア:重回帰の偿回帰係数に相当。予測式 = 切片 + 該当カテゴリーのスコアの合計
- ダミー変数:基準カテゴリーを0で表し、元の変数数よ1で表現。
factor()と同じ結果になる - 数量化Ⅰ類ではカテゴリー数が多いと自由度調整済み決定係数の意味合いが薩れる点に注意