Калькулятор MCA

Проверьте строки, переменные, уровни категорий и измерения категориальных CSV-данных для множественного анализа соответствий.

Анализ структуры категориальных данных
Вставьте строку заголовка и не менее двух наблюдений, затем укажите разделитель полей.

Этот браузерный инструмент проверяет структуру и размерность для MCA. Для полноценного статистического вывода используйте ПО, вычисляющее сингулярные числа, координаты, вклады и поправки.

О множественном анализе соответствий

Множественный анализ соответствий, или MCA, — разведочный метод поиска закономерностей между несколькими категориальными переменными. Он похож по роли на метод главных компонент, но работает с принадлежностью к категориям, а не с непрерывными измерениями. Типичные входные данные — ответы опросов, симптомы, диагнозы, демографические группы, поведение и категории лечения. MCA размещает наблюдения и уровни категорий в геометрическом пространстве меньшей размерности для визуального и количественного изучения связей. Сначала каждый уровень категории представляют отдельным индикаторным столбцом. Наблюдение получает единицу в столбце своего уровня и ноль в остальных уровнях этой переменной. Затем к полной дизъюнктивной таблице применяют анализ соответствий с расстояниями хи-квадрат и частотами категорий. Категории с похожими профилями ответов обычно располагаются рядом на карте, а категории, сильно различающие наблюдения, могут больше влиять на ось. Калькулятор выполняет важный первый этап проверки структуры. Он читает таблицу с разделителем и именами переменных в первой строке, проверяет одинаковое число полей во всех строках, считает наблюдения и переменные и суммирует различные уровни категорий. Максимальная нетривиальная размерность связана с разностью числа уровней и числа переменных. Интерфейс сообщает не более двух измерений, пригодных для непосредственного отображения, но не вычисляет собственные значения, инерцию, координаты или статистическую значимость. Подготовка данных существенно влияет на интерпретацию. Пропуски следует обрабатывать осознанно, а не обозначать несогласованными пустыми ячейками. Редкие уровни могут оказывать непропорциональное влияние; категории с разным написанием или регистром считаются отдельно. Столбцы идентификаторов обычно не следует использовать как активные переменные: каждый уникальный идентификатор становится отдельной бессмысленной категорией. Непрерывные значения стоит категоризировать только при обоснованной необходимости, поскольку произвольное разбиение теряет информацию. Полный процесс MCA включает проверку собственных значений или скорректированной инерции, вкладов, квадратов косинусов, координат категорий и наблюдений и чувствительности к выбору кодирования. Близость на двумерной карте не означает автоматически причинность или статистически значимую связь. Дополнительные переменные помогают интерпретации, не определяя оси, а осторожная кластеризация координат MCA может выявлять профили. Используйте эту структурную сводку для проверки данных перед переходом к проверенному статистическому ПО и документируйте каждое решение предобработки.

Примеры данных для MCA

Небольшие категориальные таблицы показывают, как наблюдения и уровни определяют доступное пространство.

Набор данныхСтруктураИнтерпретация
3 строки; пол и курение2 переменные; 4 уровня; 2 измеренияКаждая бинарная переменная даёт два различных уровня категории.
4 строки; питание, физическая активность и сон3 переменные; 7 уровней; показано 2 измеренияУ питания три уровня, у двух остальных переменных — по два.
10 строк; четыре бинарных вопроса анкеты4 переменные; до 8 уровнейТочное число уровней зависит от наличия обоих ответов в каждом столбце.

Как подготовить данные для MCA

  1. Поместите имена переменных в первую строку, а каждое наблюдение — в отдельную следующую строку.
  2. Унифицируйте написание категорий и удалите столбцы идентификаторов или свободного текста.
  3. Вставьте таблицу и введите точный односимвольный разделитель.
  4. Выберите «Анализировать категориальные данные» и проверьте структуру перед полным анализом.

Частые вопросы о MCA

Какие данные может анализировать MCA?

MCA предназначен для нескольких категориальных переменных, включая номинальные и осторожно интерпретируемые порядковые категории. Исходные непрерывные измерения обычно требуют другого метода или обоснованной категоризации.

Чем MCA отличается от PCA?

PCA анализирует дисперсию и линейные связи непрерывных переменных. MCA исследует связи уровней категорий с помощью индикаторного кодирования и геометрии хи-квадрат.

Что такое инерция в MCA?

Инерция измеряет разброс категориального облака и раскладывается по измерениям. Исходные проценты могут требовать поправок, поскольку индикаторное кодирование создаёт структурную инерцию.

Как обрабатывать пропущенные значения?

Выберите подходящий исследованию документированный метод: отдельную категорию пропуска, импутацию или исключение. Не допускайте несогласованных строк из-за случайных пустых полей.

Доказывает ли близость на карте MCA наличие связи?

Нет. Нужно оценить координаты, вклады, качество представления, инерцию осей, план выборки и содержательный контекст.