MCA計算機
カテゴリCSVの行数、変数、カテゴリ水準、次元を確認し、多重対応分析のデータ構造を把握します。
カテゴリデータの構造を分析
見出し行と少なくとも二つの観測を貼り付け、フィールド間の区切り文字を指定してください。
このブラウザツールはMCA向けの構造と次元を確認します。本格的な推論には、特異値、座標、寄与率、補正を計算できる統計ソフトウェアを使用してください。
多重対応分析について
多重対応分析(MCA)は、複数のカテゴリ変数の間にあるパターンを探す探索的手法です。主成分分析と似た役割を持ちますが、連続測定値ではなくカテゴリへの所属を扱います。調査回答、症状、診断、人口統計上の集団、行動、治療区分などが代表的な入力です。MCAは観測とカテゴリ水準を低次元の幾何空間に配置し、関連を視覚的・定量的に調べられるようにします。
分析ではまず、各カテゴリ水準を独立した指示変数の列で表します。観測が属する水準の列には一を、その変数のほかの水準にはゼロを割り当てます。この完全分離表に、カイ二乗距離とカテゴリ度数を用いた対応分析を適用します。回答プロフィールが似たカテゴリは図上で近くなりやすく、観測を強く区別するカテゴリは軸に大きく寄与する場合があります。
この計算機は重要な最初の構造確認を行います。先頭行に変数名を置いた区切り形式の表を読み、すべての行のフィールド数が同じかを確認し、観測数、変数数、異なるカテゴリ水準の総数を数えます。非自明な次元数の最大値は、水準数から変数数を引いた値に関連します。画面にはすぐに描画できる次元を最大二つ表示しますが、固有値、イナーシャ、座標、統計的有意性の計算は行いません。
入力の準備は解釈に大きく影響します。欠測値は不揃いな空白セルで表すのではなく、方針を決めて処理してください。まれなカテゴリ水準は不釣り合いに大きな影響を与えることがあり、表記や大文字・小文字が違うカテゴリは別々に数えられます。識別子の列は、一意の識別子ごとに意味のないカテゴリができるため、通常は能動変数に含めません。連続値のカテゴリ化は、恣意的な区分で情報が失われるため、妥当な理由がある場合に限るべきです。
本格的なMCAでは、固有値または補正イナーシャ、寄与率、余弦二乗、カテゴリ座標、観測座標、符号化の選択に対する感度を検討します。二次元図で近いことは、因果関係や統計的に有意な関連を自動的に意味しません。補助変数は軸を決めずに解釈を助け、MCA座標のクラスタリングも慎重に使えば特徴的な集団を見つけられます。この構造要約でデータを確認した後、実績のある統計ソフトウェアに進み、前処理の判断をすべて記録してください。
MCAデータの例
小さなカテゴリ表で、観測と水準が利用可能な空間をどう決めるかを示します。
| データセット | 構造 | 解釈 |
|---|---|---|
| 3行、性別と喫煙 | 2変数、4水準、2次元 | 各二値変数には二つの異なるカテゴリ水準があります。 |
| 4行、食事・運動・睡眠 | 3変数、7水準、表示は2次元 | 食事は三水準で、残りの二変数はそれぞれ二水準です。 |
| 10行、四つの二択の調査項目 | 4変数、最大8水準 | 正確な水準総数は、すべての列に両方の回答が現れるかで決まります。 |
MCA用データの準備方法
- 先頭行に変数名を置き、それ以降は一行に一つの観測を入力します。
- カテゴリ表記を統一し、識別子や自由記述の列を除きます。
- 表を貼り付け、実際に使っている一文字の区切り文字を入力します。
- 「カテゴリデータを分析」を選び、本格的な分析の前に表示された構造を確認します。
MCAのよくある質問
MCAはどのようなデータを分析できますか?
複数のカテゴリ変数を対象とし、名義尺度や慎重な解釈が必要な順序尺度を扱います。未加工の連続測定値には通常、別の手法か妥当なカテゴリ化が必要です。
MCAとPCAの違いは何ですか?
PCAは連続変数の分散と線形関係を分析します。MCAは指示変数への符号化とカイ二乗幾何を使ってカテゴリ水準間の関連を分析します。
MCAのイナーシャとは何ですか?
カテゴリ点群の散らばりを定量化し、各次元に分解される量です。指示変数への符号化による構造的なイナーシャがあるため、生の割合には補正が必要な場合があります。
欠測値はどう扱えばよいですか?
欠測専用カテゴリ、補完、除外など、研究に合った方法を選び記録してください。意図しない空白の書式で行の構造を不揃いにしないようにします。
MCA図で近ければ関連が証明されますか?
いいえ。座標、寄与率、表現の質、軸のイナーシャ、標本設計、研究分野の文脈を併せて確認する必要があります。