В факторном анализе предполагается, что наблюдаемые переменные являются линейной комбинацией некоторых латентных факторов.Некоторые из этих факторов допускаются общими для нескольких исходных переменных, а другие характерны для каждой переменной в отдельности. Характерные факторы ортогональны друг другу и, следовательно, не вносят вклад в ковариационную матрицу переменных. Таким образом, только общие факторы, число которых предпологается существенно меньшим, чем число исходных переменных, вносят вклад в ковариацию между ними
Принимаемая в факторном анализе линейная система такова, что структура ковариаций может быть идентитфицирована без ошибок, если изветна матрица нагрузок латентных факторов.При использовании постулатов и свойств данной линейной системы можно точно идентифицировать латентную факторную структуру на основе анализа исходной ковариационной матрицы.
На практике на исследуемую матрицу корреляций оказывают влияние различные случайные и неслучайные ошибки. В результате она будет отлична от корреляционной матрицы, обусловленной факторной структурой генеральной совокупности.
Таким образом, на практике невозможно получить точную структуру факторной модели, можно найти оценки параметров факторной структуры с использованием определенных критериев.
Факторный анализ – это процедура, с помощью которой большое число переменных, относящихся к имеющимся наблюдениям, сводят к меньшему количеству независимых влияющих величин, называемых факторами:
Факторы (Factors) – латентные (скрытые) переменные, конструируемые таким образом, чтобы можно было объяснить корреляцию между набором имеющихся переменных.
Цель факторного анализа – сокращение числа переменных на основе их классификации и определения структуры взаимосвязей между ними.
Благодаря сокращению числа переменных вместо исходного набора переменных появляется возможность анализировать данные по выделенным факторам, число которых значительно меньше исходного числа взаимосвязанных переменных. При этом измеряемые эмпирические переменные (предикторы) считаются следствием других, глубинных, скрытых от непосредственного измерения характеристик (латентных переменных)

$F$–общие факторы, каждый из которых влияет на определенную совокупность переменных;
$X$– исходные переменные, фиксируемые на основании измерений;
$U$–уникальные (характерные) факторы, каждый из которых влияет только на одну переменную.
Порядок выполнения факторного анализа
Первый этап достаточно очевиден. Рассмотрим второй этап.
Извлечение фактора начинается с подсчета суммарного разброса значений всех участвующих в анализе переменных. Для этого «суммарного разброса» непросто подобрать логическую интерпретацию, однако он является вполне строго определенной математической величиной.
Извлечение факторов может производится несколькими методами. Методы факторного анализа различаются в зависимости от подходов для нахождения коэффициентов значения факторов.
Наиболее ранним методом факторного анализа является метод главных факторов, здесь методика PCA используется применительно к редуцированной корреляционной матрице, на главной диагонали которой распологаются общности. Обычно для их оценки пользуются квадратом множественного коэффициента корреляции между соотвествующей переменной и всеми остальными переменными. После размещения на главной диагонали корреляционной матрицы оценок общностей для выделения факторов используют теже способы что и при PCA. То есть составляется и решается соотвествующее характеристическое уравнение.
МНК в факторном анализе сводиться к минимизации остаточной корреляции после выделения определенного числа факторов и оценивания степени соотвествия вычисленных и наблюдаемых коэффициентов кррреляции (расчет суммы квалратов отклонений). Расхождение уменьшается при увеличении предпологаемых факторов.
Алгоритм
Процесс продолжается до тех пор пока дальнейшее улучшение станет невозможным. Данный алгоритм называется "Метод главных факторов с итерациями по общностям". Кроме того используется "метод минимальных остатков". Он аналогичен выше рассмотреному алгоритму, но при его реализации для проверки окончания алгоритма используется критерий хи-квадрат.
Метод максимального праддоподобия имеет своей задачей найти факторное решение, которое наилучшим образом объясняет наблюдаемые корреляции.Предпологается, что наблюдаемые данные-это выборка из генеральной совокупности, которая точно соотвествует $k$ факторной модели. Совместное распределение переменных(включая факторы)предпологается многомерным нормальным. Задача сводится к оценивванию значений латентных переменных(нагрузок) генеральной совокупности, при ккоторых функция правдоподобия для распределения элементов корреляционной матрицы максимальна.
Можно использовать иной критерий при котором осуществляется поиск факторных нагрузок, обеспечивающих максимизацииюкоэффициента корреляции между общими факторами и наблюдаемыми переменными.
Третий критерий сводится к определению нагрузок, при которых детерминант матрицы остаточных корреляций максимален. Для нахождения решения используется для всех критериев соотвествующие итерационные схемы. В принципе все варианты метода максимального правдоподобия сводятся к решению характеристического уравнения вида:
$$\det ({\bf R}_2 - \lambda {\bf I}) = 0{\rm \;\;\;\;(1)}$$Где ${\bf R}_2$ определяется соотношением:
$${\bf R}_2 = {\bf U}^{ - {\bf 1}} ({\bf R} - {\bf U}^2 ){\bf U}^{ - {\bf 1}} = {\rm \;\;\;\;\;(2)}$$$${\rm = }{\bf U}^{ - {\bf 1}} {\bf R}{}_1{\bf U}^{ - {\bf 1}} {\rm \;\;\;\;\;(3)}$$Здесь ${\bf U}^2$ - оценка дисперсии характерных параметров, ${\bf R}_2$ - редуцированная корреляционная матрица
В отличии от МНК в вычисляемую на каждом шаге оценку общности с большим весом входят корреляции с переменными, имеющими меньшую характерность. В методе максимального правдоподобия характерность играет роль"квази-ошибки": больший вес имеют переменные с максимальной общностью.Т.е менее точные наблюдения учитываются с меньшим весом.
Формула для вычисления статистики $\chi ^2$ показывает, что ее значение определяется объемом выборки, а число степеней свободы от нее не зависит:
$${\bf U}_{\bf k} = N\{ \ln \left| {\bf C} \right| - \ln \left| {\bf R} \right| + tr({\bf RC}^{ - 1} )\} - n{\rm \;\;\;\;\;(4)}$$где $ln$ - натуральный логарифм; $tr$ -след матрицы; $N$ -объем выборки; $n$ -число переменных; $R$-матрица ковариаций; ${\bf C} = {\bf FF}^T + {\bf U}^2$; ${\bf F}$-матрица факторных нагрузок; ${\bf U}^2$ -характерности.
При фиксированной корреляционной матрице, величина ${\bf U}_{\bf k}$ пропорциональна объему выборки $N$.Соотвествующее число степеней свободы равно:
$$df_k = 1/2[(n - k)^2 - (n + k)],{\rm \;\;\;\;(5)}$$где $k$ -число гипотетических факторов; $n$ -число переменных.
Существенное преимущество метода максимального правдоподобия сосстоит в том, что для большой выборки он позволяет получить критерий значимости. Если критерий $\chi ^2$ показывает значимое отклонение наблюдений от $k$ факторной модели, то в рассмотрение вводится модель $k+1$ факторами. Вразведочном анализе обычно начинают с одного фактора, а заканчивают , когда отклонение наблюдений от модели становиться статистически незначимым.
В альфа-факторном анализе используемые переменные считаются выборкой из некоторой совокупности переменных, о которой можносудить наблюдаемой совокупности объектов Таким образом, в альфа-факторном анализе выводы носят психометрический, а не статистический характер (альфа-факторный метод был разработан для обработки данных в психологии).
УТверждается, что метод основан на выделении таких факторов, которые имеют максимальные корреляции с соотвествующими факторами генеральной совокупности переменных.Характерные факторы при этом , рассматриваются как ошибки, обусловленные психометрической выборкой переменных. Следовательно, оценки общностей имеют смысл "надежностей".
На первом шаге образуется подправленная корреляционная матрица вида:
$${\bf R}_3 = {\bf H}^{ - 1} ({\bf R} - {\bf V}^2 ){\bf H}^{ - 1} {\rm \;\;\;\;(6)}$$где ${\bf V^2 }$ и ${\bf H}^2$ - диагональные матрицы характерностей и общностей соотвественно, а ${\bf H}^{ - 1}$- диагональная матрица, элементами которой являются обратные величины к квадратным корням из общностей.
Тогда характеристическое уравнение, связанное с подправленной матрицей, представляется следующим образом:
$$\det ({\bf R}_3 - \lambda {\bf I}) = 0{\rm \;\;\;\;(7)}$$В методе максимального правдоподобия матрица инормируется с помощью характерностей, а в альфа-факторном анализе-дисперсией общностей. Тоесть в первом случае больший вес имеют переменные с большей общностью, а во втором наоборот, с меньшей.
В альфа-факторном анализе число выделяемых факторов определяется с помощью величины собственных значений, которая должна быть больше единицы. Это эквивалентно использованию коэффициента обобщенности $\alpha$ (квадрат коэффициента корреляции данного фактора с соотвествующими факторами, взятыми из генеральной совокупности).Выделяются факторы, для которых коэффициент $\alpha$ положителен.
В анализе образов определение общей и характерной части переменной отличается от принятого в классическом факторном анализе. Под общей частью переменной подразумевается та ее составляющая, которая выражается через линейную комбинацию других переменных. Эта доля переменной называется "образ-переменной". Вторая часть, независимая от остальных переменных, называется "антиобразом".
В анализе образов предпологается, что потенциальное множество переменных бесконечно. При этом средний квадрат образа равен общности переменной, определяемой в факторном анализе, а средний квадрат "антиобраза"-характерности. Другими словами, квадрат множественного коэффициента корреляции между переменной и остальными переменными совокупности равен общности данной переменной.
Образы и антиобразы, определяемые для некоторого набора наблюдаемых переменных, называются соотвественно частными образами и частными антиобразами. Они полностью задаются наблюдаемыми переменными. Вэтом смысле анализ образов в корне отличается от классического факторного анализа, в котором общая часть переменной является линейной комбинацией гипотетических факторов и не может быть явной функцией наблюдаемых переменных.
Методика анализа образов предпологает введение матрицы ковариации чатных образов:
$${\bf R}_4 = ({\bf R} - {\bf S}^2 ){\bf R}^{ - 1} ({\bf R} - {\bf S}^2 ){\rm \;\;\;\;(8)}$$где ${\bf R}$, а ${\bf S^2}$ -диагональная матрица элементами которой являются доли дисперсий антиобразов. Получение матрицы (8) сводится , во-первых, к замене диагональных элементов матрицы ${\bf R}$ на квадратымножественного корреляции каждой переменной с совокупностью всех остальных переменных,и, во-вторых к преобразования недиагональных для получения матрицы Грама (если определитель Грама рвен нулю, то соотвествующие вектора линейно зависимы). Характерестическое уравнение для этой матрицы имеет вид:
$$\det ({\bf R}_4 - \lambda {\bf I}) = 0{\rm \;\;\;\;(9)}$$Число выделяемых факторов определяется количеством собственных чисел, больших единицы для матрицы ${\bf S}^{ - 1} {\bf RS}^{ - 1}$. Обычно число выделяемых таким образом факторов велико, приблизительно половина числа исходных параметров. При вращении можно обрасывать незначительные и неинтерпретируемые факторы.
На первом этапе анализа определяется минимальное число факторов, адекватно воспроизводящих наблюдаемые корреляции, а также значения общностей каждой пременной. Следующий шаг состоит в нахождении легко интерпритируемых факторов с помощью процедуры вращения. При этом число факторов и значения общностей переменных фиксируются.
Существуют три различных подхода к проблеме вращения:
Графический подход при котором вращение заключается в проведении новых осей, которые соответствуют некоторому критерию простой, легко интерпритируемой структуры. Если в пространстве факторов есть явные кластеры точек легко отделяемые друг от друга, простая структура получается в том случае, когда оси проведены через эти скопления.
Подход, связаннный с аналитическими методами. Здесь выбирается некоторый объективный критерий, которым надо руководствоваться при вращении. В рамках этого подхода различают два вида вращения-ортогональное и косоугольное.
Подход на основе априорного задания целевой матрицы. Цель вращениянайти такое факторное отображение, которое максимально близко к некоторой заданной матрице. Целевая матрица задается исходя из определенных предположений о факторной структуре.
Геометрический метод практически не применим. когда скопления точек неразделимы или когда числофакторов больше двух.Целью вращения является получение простой факторной структуры, но не существует единых формальных критериев для оценки простоты факторной структуры.
Попытаемся определить минимальные требования к простой структуре. Если взять числофакторов $r$ и число переменных $n$, то факторная структура является наипростейшей, когда каждая пременная имеет ненулевую только на один общий фактор. Если число факторов два и больше, то это означает, что в наиболее простой матрице факторной структуры будут выпоняться следующие условия:
каждая строка будет содержать только один ненулевой элемент;
каждый столбец будет иметь несколько нулей;
для каждой пары столбцов нулевые элементы не совпадают
Для реальных данных такая простая структура недостижима. Следовательно, задача состоит в том чтобы определить факторную структуру, которая наиболее близка к простой структуре. Эта задача решается путем вращения первичных осей и перехода к вторичным осям для получения матрицы факторного отображения, наиболее близкой к простейшей идеальной структуре.
Рассмотренный выше способ оценки степени сложности факторной структуры для численного использования неудобен. Одной из возможных мер сложности модели является вариация квадрата факторной нагрузки для каждой строки(для каждой переменной). Следовательно, дисперсия квадратов факторных нагрузщок переменной есть меоа факторной сложности этой переменной. После некоторых преобразований выражение для этой меры можно представить следующим образом:
$$q_i = \frac{{\sum\limits_{j = 1}^r {(b_{ij}^4 ) - (\sum\limits_{j = 1}^r {b_{ij}^2 )^2 } } }}{{r^2 }}{\rm \;\;\;\;\;(10)}$$где $r$ -число столбцов факторной матрицы; $b_{ij}$ - факторная нагрузка $j$-го фактора на $i$-ю переменную.
Число факторов $r$ и общности каждой пекременной считаются известными в результате решения задачи выделения первоначальных факторов. Поэтому слогаемое, входящее в (10) с отрицательным знаком, является константой ибо $\sum\limits_{j = 1}^r {b_{ij}^2 = h_i^2 }$ в случае ортогонального решения. Общей мерой сложности может служить сумма $q_i$ всех переменных:
$$q = \sum\limits_{i = 1}^n {q_i = \sum\limits_{i = 1}^n {\frac{{\sum\limits_{j = 1}^r {(b_{ij}^4 ) - (\sum\limits_{j = 1}^r {b_{ij}^2 )^2 } } }}{{r^2 }}} } {\rm \;\;\;\;(11)}$$Использование критерия квартимакс основано на вращении осей таким образом, чтобы результирующие нарузки максимисировали $q$. При этом максимизация $q$ эквивалентна максимизации следующего выражения:
$$Q = \sum\limits_{i = 1}^n {\sum\limits_{j = }^r {b_{ij} } {\rm \;\;\;\;(12)}}$$Так как слагаемое со знаком минус в (11) является константой, то критерий называется квартимакс. Метод квартимак имеет тенденцию к выделению генерального фактораю.
Метод варимакс использует несколько другой критерий, в котором добиваются упрощения описания столбцов факторной матрицыю Вместо дисперсии квадратов нагрузок переменной рассматривается дисперсия квадратов нагрузок фактора. Индекс сложности $v_j$ фактора $j$ равен:
$$v_j = \frac{{n\sum\limits_{i = 1}^n {(b_{ij}^4 ) - (\sum\limits_{i = 1}^n {b_{ij}^2 )^2 } } }}{{n^2 }}{\rm \;\;\;\;(13)}$$При этом $\sum\limits_{i = 1}^n {b_{ij}^2 }$ не является константой. Общая мера простоты задается критерием варимакс:
$$V = \sum\limits_{i = 1}^n {v_i } = \frac{{\sum\limits_{j = 1}^r n \sum\limits_{i = 1}^n {(b_{ij}^4 ) - \sum\limits_{j = 1}^r {(\sum\limits_{i = 1}^n {b_{ij}^2 )^2 } } } }}{{n^2 }}{\rm \;\;\;\;(14)}$$Часто факторные нагрузки нормируют, чтобы избавиться от нежелательного влияния на результаты вращения переменных с большой общностью. Варимакс дает лучшее разделение факторов чем квартимакс. Учитывая что критерий квартимакс основан на упрощении строк, а критерий варимак - на упращении счтолбцов предлогается обобщенный критерий, который имеет вид:
$$\alpha Q + \beta V = Maximum{\rm \;\;\;\;(15)}$$Где $\alpha$ и $\beta$ - веса.
Этот критерий можно записать в следующем виде:
$$\sum\limits_{j = 1}^r {\sum\limits_{i = 1}^n {b_{ij}^4 - \gamma \sum\limits_{j = 1}^r {(\sum\limits_{i = 1}^n {b_{ij}^2 )^2 /n} } } } = Maximum{\rm \;\;\;\;(16)}$$Где $\gamma {\rm = }\beta /(\alpha + \beta )$
Если $\gamma=0$, то имеем критерий квартимакс, а если $\gamma=1$ то -варимакс. При $\gamma=r/2$ и $\gamma=0.5$ получаются особые критерии, эквимакс и биквартимакс соотвественно.
Косоугольное вращение является более общим, чем ортогональное, так как здесь нет ограничений, связанных с некоррелированностью факторов. Существует два подходамк косоугольному вращению: использование вторичных осей; использование первичной матрицы факторного отображения.
Здесь вводится критерий, называемый квартимин:
$$N = \sum\limits_{i = 1}^n {\sum\limits_{j < k = 1}^r {a_i a_{ik} {\rm \;\;\;\;(17)}} }$$Где $a_i$ $a_{ik}$ - проекции $i$ -го праметра на $j$-ю и $k$-ю вторичные оси. Величина $N$ будет нулевой, если все параметры имеют нагрузку только на один фактор. Цель вращени-нахождение таких факторных нагрузок, которые минимизируют $N$.Вводится критерий коваримин-минимизация ковариации проекций на вторичные оси:
$$C = \sum\limits_{j < k = 1}^r {(n\sum\limits_{i = 1}^n {a_i ^2 a^2 _{ik} - \sum\limits_{i = 1}^n {a^2 _{ij} \sum\limits_{i = 1}^n {a^2 _{ik} ){\rm \;\;\;\;(18)}} } } }$$Модификация этого критерия основана на нормировании- замене ${a^2 _{ij} }$ на $a^2 _{ij}. /h_i^2$. Применительно к одним и тем же данным критерий коваримин дает меньше косоугольных факторов, чем квартимин. Объединение этих двух критериев приводит к обобщенному притерию облимин:
$$B = \sum\limits_{j < k = 1}^r {(n\sum\limits_{i = 1}^n {a_i ^2 a^2 _{ik} - \gamma \sum\limits_{i = 1}^n {a^2 _{ij} \sum\limits_{i = 1}^n {a^2 _{ik} ){\rm \;\;\;\;(19)}} } } }$$Где $\gamma = \beta /(\alpha + \beta )$; $\alpha$, $\beta$ - веса соотвественно $N$,$C$.
Этот общий критерий при $\gamma =0$ переходит к квартимин, при $\gamma =0.5$ - биквартимин, а при $\gamma =1$ - в коваримин. Чаще всего в этом критерии облимин используются нормированные проекции.
Другой критерий, тесно связанный спринципами облимина называется критерием бинормамин. В нем заложена идея объективного выбора значения $\gamma$ в соотношении (19). По сравнению с критерием биквартимин, где $\gamma =0.5$, бинормамин дает лучшие результаты для особо простых и особо сложных данных.
Метод основан на упрощении матрицы нагрузоу первичных факторов(без использования вторичных осей). Минимизируемая имеет следующий вид:
$$D = \sum\limits_{j < k = 1}^r {[\sum\limits_{i = 1}^n {b_i ^2 b^2 _{ik} - d(\sum\limits_{i = 1}^n {b^2 _{ij} \sum\limits_{i = 1}^n {b^2 _{ik} )/n]{\rm \;\;\;\;(20)}} } } }$$где $b_{ij}$ -элементы матрицы нагрузок первичных факторов. Величина $d$ оппределяется аналогично $\gamma$ при этом параметр $\alpha$ регулирует степень косоугольности получаемого решения. В случае однофакторной модели следует положить $\alpha=0$. Существует много других методов косоугольного вращения, например методы ортоблик и метод максплейн.
Это подход, основанный на априорной информации о факторной структуре:
Следует отметить, что при определении числа факторов может использоваться несколько критериев:
В данной работе эти критерии не рассматриваются , желающие могут познакомиться с ними в соотвествующей литературе.
Существует целый раздел факторного анализа , связанный с оценкой степени эмпирического подтверждения и адекватности факторной модели. Это направление основано на проверке определенных счтатистических гипотез, оно получило название конфирматорный факторный анализ. Данный раздел факторной теории нами также здесь не рассматривается.
Результаты факторного анализа позволяют перейти к оценки факторных шкал, что позволяет:
Рассмотрим некоторые важные аспекты факторного шкалирования. Даже если факторная модель безошибочна для генеральной совокупности, она не будет авсолютно точно воспроизводить корреляции в выборочныз данных. Поэтому, необходимо ввести критерий близости оценок и истинных значений факторов. Существует три таких критерия.
Для однофакторной модели первый критерий сводится к нахождению оценки ($F^*$) значения фактора($F$), доставляющей максимум коэффициента корреляции между $F^*$ и $F$, что сводится к минимизации суммы квадратов отклонений $\sum {(F - F^* )^2 }$ (применение регрессионного анализа). Так как факторный анализ дает значения факторных нагрузок, которые представляют собой корреляции между факторами и наблюдаемыми переменными(предикторами). Приэтом корреляции между предикторами являются наблюдаемыми корреляциями. Таким образом, оценка фактора может определяться из решения системы нормальных уравнений:
$$F^* = {\bf X}({\bf B}^T {\bf R}^{ - 1} ){\rm \;\;\;\;(21)}$$Где ${\bf B}$ - матрица факторных нагрузок; ${\bf X}$ -вектор наблюдаемых переменных; ${\bf R}$ корреляционная матрица наблюдаемых переменных. Произведение в скобках в выражении (21) задает весовые коэффициенты перехода к оценке фактора $F^*$ от значений наблюдаемых переменных. Надежнось оценки определяется из сравнения с абсолюно точной факторной моделью для генеральной совокупности.
В однофакторной модели каждая переменная считается взвешанной суммой общих и характерных факторов:
$${\rm X}_{\rm j} = b_j F + d_j u_j {\rm \;\;\;\;(22)}$$Предполохим, что вместо $F$ взята оценка $F^*$. Поскольку критерий наименьших квадратов определяется оценкой, минимизирующей сумму квадратов:
$$\sum\limits_i {\sum\limits_j {(X_{ij} - b_j F^* )^2 } } {\rm \;\;\;\;(23)}$$то получаем следующую оценку:
$$F^* = {\bf X}({\bf BB}^T )^{ - 1} {\bf B}{\rm \;\;\;\;(24)}$$Отличие (24) от (21) состоит в том что здесь используются воспроизведенные в модели корреляции ${\bf BB}^T$ вместо $R$.
Таким образом регрессионный анализ и критерий наименьших квадратов приводит к одни и тем же оценкам, когда выборочные корреляции совпадают с корреляциями для генеральной совокупности.
Для данного подхода включается в рассмотрение выборочная изменчивость. Если характерную долю дисперсии отнести на счет ошибок наблюдения, то лучше уменьшить вес тех переменных, которые имеют большие дисперсии ошибок. Водится следующий критерий:
$$\sum\limits_i {\sum\limits_j {(X_{ij} - b_j F^* )^2 /d_j^2 } } {\rm \;\;\;\;(25)}$$В результате параметры с меньшими общностями получают и меньший вес.Поэтому, оценка факторной шакалы, получаемая с помощью критерия Бартлета имеет вид:
$$F^* = {\bf XU}^{ - 2} {\bf B}({\bf B}^T {\bf U}^{ - 2} {\bf B})^{ - 1} {\rm \;\;\;\;(26)}$$Где ${\bf U}^{ - 2}$ -диагональная матрица характерностей. Наличие ${\bf U}^{ - 2}$ может рассматриваться как результат взвешевания.
Три рассматриваемых критерия можно обобщить для много факторного случая как для ортогонального, так идля косоугольного решения. Все результаты, для оценок фактора, справедливы и для нескольких факторов. Но при этом возникают следующие вопросы:
В общем случае всем этим требованиям не удовлетворяет ни одна из оценок. Однако в частном случае перечисленные требования выполняются когда:
При этом задача сводится к однофакторной модели без ошибок и все три оценки, рассмотренные выше, эквивалентны. Но такая идеализированная ситуация практически неосуществима. Но для некоторых факторных шкал есть дополнительные условия ортогональности и монохроматичности. Так например, если первоначальные факторы(до вращения) были выделены с использованием критерия максимального правдоподобия, то регрессионнаяоценка и оценка Бартлетта для факторных шкал будут ортогональны и монохроматичны. Прада после вращения для регрессионной оценки уже ни одно из этих условий не выполняется, а для оценки Бартлетта остается справедливым только условие монохромностичности (ортогональность отсутствует).
Связи с этим появился четвертый критерий (Андерсена-Рубина), который является модификацией критерия Бартлетта. Минимизируется взвешанная сумма квадратов, используемая в критерии Бартлетта, при условии , чтополучаемые шкалы ортогональны друг другу. Следовательно, независимо от вращения критерий дает некоррелированные шкалы.Но монохромотичность при этом критерии не обеспечивается.
При выборе метода необходимо проанализировать свойства получаемых шкал. Если рассматривать корреляции между скрытыми факторами и их шкалами, то регрессионный метод предпочтительнее метода Бартлетта, а метод Бартлетта предпочтительнее метода наименьших квадратов.
С точки зрения требования монохроматичности оценка шкал по критерию Бартлетта является нилучшей, а если брать свойство ортогональности, то предпочтитиельнее критерий Андерсена-Рубина. Так как заранее не известно, ортогональны ли скрытые факторы, выбирать следует либо регрессоный анализ, либо метод Бартлетта. Но все это имеет лишь академический интерес и для оценивания шкал хорош любой способ. Выбор метода факторного шкалирования зависит от специфики решаемой задачи. Если факторное шкалирование используется совместно скакими то новыми внешними переменными, то некоторые методы хуже преспособлены для такой задачи (в частности регрессионный анализ). Если задача сосстоит только в использовании факторных шкалкак новых предикторов для внешних выходных переменных, то регрессионный анализ является наилучшим. Но всегда важна эвристическая качечственная оценка получаемых результатов.
Рассмотрев основные аспекты достоточно глубокой теории факторного анализа, приведем пример его использования для решения задачи сокращения размерности средствами $python$ и $R$.
В качестве исходных данных используем информацию об основных социально-экономических показателях российских регионов за 2018 год. Исходная матрица предикторов имеет размерность 81х16 в качестве выходной переменной используется номинальная переменная тип экономики региона. В реализации на Python переменной "тип экономики": А-аграрный; D-добывающий, P- промышленный; а при реализации на R добовляется значение: Т-торговый.
Код на Python Здесь из исходной таблицы выбираются три столбца P10,P11,P14 , а выходная переменная P18 принимает три значения A,D,P
import warnings
from mpl_toolkits.mplot3d import Axes3D
import numpy as np
import scipy.stats as st
import matplotlib.pyplot as plt
from pandas import Series, DataFrame
import pandas as pd
#from sklearn import decomposition
from sklearn.decomposition import FactorAnalysis
warnings.simplefilter('ignore')
result =pd.read_table('dan04.txt',sep='\s+')
print(result)
y=result['P18']
X =DataFrame(result, columns=['P10','P11','P14'])
y=np.array(y)
X=np.array (X)
SUMX=X[:,0] +X[:,1] + X[:,2]
X[:,0] =X[:,0] /SUMX
X[:,1] =X[:,1] /SUMX
X[:,2] =X[:,2] /SUMX
#описательные статистики
print('Описательные статистики предикторов')
for num in range(3) :
print('Номер переменной: %.0f' %num)
print('число элентов массива =',len(X[:,num]))
print('среднее значение =',np.mean(X[:,num]))
print('стандартное отклонение =',np.std(X[:,num]))
print('мин мах =',np.min(X[:,num]), np.max(X[:,num]))
#построение исходного графика 3 D
fig = plt.figure(1)
ax = fig.add_subplot(111, projection='3d')
xs = X[:,0]
ys = X[:,1]
zs =X[:,2]
ax.scatter(xs, ys, zs,c=y, cmap=plt.cm.nipy_spectral, edgecolor='k')
ax.set_title("Исходное пространство предикторов")
ax.set_xlabel('P10')
ax.set_ylabel('P11')
ax.set_zlabel('P14')
#plt.show()
# Преобразование данных , уменьшающее размерность до 2
transformer = FactorAnalysis(n_components=2, rotation='varimax', random_state=0)
X_transformed = transformer.fit_transform(X)
DimX=X_transformed.shape
print(DimX)
y = np.choose(y, [1, 2, 0]).astype(np.float)
fig = plt.figure(2)
plt.clf()
plt.cla()
plt.scatter(X_transformed[:, 0], X_transformed[:, 1], c=y, cmap=plt.cm.nipy_spectral, edgecolor='k')
plt.title("Снижение размерности методом FactorAnalysis")
plt.xlabel("F1")
plt.ylabel("F2")
plt.show()
P10 P11 P14 P16 P18 0 148863.0 710829 257038 336148.5 0 1 262.0 218544 85146 253157.2 0 2 5005.0 448428 29651 225731.2 1 3 7726.0 448223 219151 552288.4 0 4 972.0 152792 16085 164827.4 0 .. ... ... ... ... ... 76 1016799.0 60300 11147 148497.4 2 77 10330.0 6632 5772 24075.7 2 78 67502.0 1055 1334 9573.8 2 79 1808823.0 6413663 7308 4798454.0 2 80 24035.0 2615910 0 1412406.0 1 [81 rows x 5 columns] Описательные статистики предикторов Номер переменной: 0 число элентов массива = 81 среднее значение = 0.20270488230397676 стандартное отклонение = 0.27628966898950846 мин мах = 0.0 0.9658182026298092 Номер переменной: 1 число элентов массива = 81 среднее значение = 0.6113035949901738 стандартное отклонение = 0.2789990983004935 мин мах = 0.014658856156436596 0.9908956436592429 Номер переменной: 2 число элентов массива = 81 среднее значение = 0.18599152270584945 стандартное отклонение = 0.19591941586989708 мин мах = 0.0 0.9661682854960166 (81, 2)
Код на R Здесь из исходной таблицы выбираются четыре столбца (предиктора) P10,P11,P14,P16 , а выходная переменная P18 принимает четыре значения A,D,P,T
options(warn=-1)
library(openxlsx)
library(gmodels)
library(lattice)
library(vegan)
library(grDevices)
library(reshape2)
library(ggplot2)
library(ggthemes)
#library(fastICA)
library(psych)
load("xRegion.RData")
#ФОРМИРОВАНИЕ data.frame ОСНОВНЫЕ СОЦИАЛЬНО-ЭКОНОМИЧЕСКИЕ ПОКАЗАТЕЛИ РЕГИОНОВ РФ
xreg <-data.frame(P1=x$Pok_001,P2=x$Pok_002,P3=x$Pok_003,P4=x$Pok_004,
P5=x$Pok_005,P6=x$Pok_006,P7=x$Pok_007,P8=x$Pok_008,P9=x$Pok_009,P10=x$Pok_010,
P11=x$Pok_011,P12=x$Pok_012,P13=x$Pok_013,P14=x$Pok_014,P15=x$Pok_015,P16=x$Pok_016,
P17=x$Pok_017,P18=x$Pok_018)
#xreg
#Формирование фактора тип экономики региона
xreg_f <- as.factor(x$Pok_018)
#выбор исследуемого подмножества показателей регионов
w=c(10,11,14,16)
reg.ekon <-xreg[,w]
Y <-reg.ekon
X=Y
X <- as.matrix(X)
XX=cor(X)
paf2=fa(X,nfactors=2,rotate="varimax",SMC=T,symmetric=T, fm="pa")
paf2$e.values # собственные значения исходной матрицы
paf2$communality # Оценки общности для каждого элемента.
paf2$rotation # какая ротация была запрошена?
paf2$complexity # Индекс сложности Хоффмана для каждого элемента.
paf2$fit # показывает Насколько хорошо факторная модель
#воспроизводит корреляционную матрицу
paf2$R2 #Множественный квадрат R между факторами и оценками факторных баллов
paf2$weights #веса, чтобы найти оценки факторов
paf2$valid #Оценка достоверности факторов
print(paf2,sort=TRUE)
f3l <- paf2$loadings
f3l
x11()
fa.diagram(f3l,main="input from a matrix")
P1=vector(mode = "numeric", 81)
P2=vector(mode = "numeric", 81)
for(i in 1:81)
{P1[i]=X[i,]%*%paf2$weights[,1];
P2[i]=X[i,]%*%paf2$weights[,2]}
#нормирующая функция------------
norm <-function(x){
return ((x-min(x))/(max(x)-min(x)))
}
P1=norm (P1)
P2=norm (P2)
PA <-data.frame(PA1=P1,PA2=P2,Class=xreg_f)
#График регионов по классам в пространстве 2 компонент FA
x11()
g3 <-ggplot(data= PA, aes(x=PA1,y=PA2,colour = Class),colors = "Accent")
g3 <-g3 +geom_point(size=4)
g3 <-g3 +labs(title ="Регионы в пространсте двух компонент FA",
x="Фактор 1", y="Фактор 2",colour = "Классы")
#g3 <-g3 + theme_fivethirtyeight() + scale_color_fivethirtyeight()
g3 <-g3 + theme_stata() + scale_colour_stata()
g3
| PA1 | PA2 | |
|---|---|---|
| P10 | 0.10551671 | -0.1437470 |
| P11 | 1.46052478 | -1.0597592 |
| P14 | -0.08346587 | 0.1311754 |
| P16 | -0.66092642 | 1.6662982 |
Factor Analysis using method = pa
Call: fa(r = X, nfactors = 2, rotate = "varimax", SMC = T, symmetric = T,
fm = "pa")
Standardized loadings (pattern matrix) based upon correlation matrix
item PA1 PA2 h2 u2 com
P11 2 0.86 0.48 0.97 0.026 1.6
P16 4 0.73 0.66 0.96 0.042 2.0
P10 1 0.44 -0.03 0.20 0.802 1.0
P14 3 0.02 0.33 0.11 0.890 1.0
PA1 PA2
SS loadings 1.47 0.77
Proportion Var 0.37 0.19
Cumulative Var 0.37 0.56
Proportion Explained 0.66 0.34
Cumulative Proportion 0.66 1.00
Mean item complexity = 1.4
Test of the hypothesis that 2 factors are sufficient.
The degrees of freedom for the null model are 6 and the objective function was 2.42 with Chi Square of 188.44
The degrees of freedom for the model are -1 and the objective function was 0
The root mean square of the residuals (RMSR) is 0
The df corrected root mean square of the residuals is NA
The harmonic number of observations is 81 with the empirical chi square 0 with prob < NA
The total number of observations was 81 with Likelihood Chi Square = 0 with prob < NA
Tucker Lewis Index of factoring reliability = 1.034
Fit based upon off diagonal values = 1
Measures of factor score adequacy
PA1 PA2
Correlation of (regression) scores with factors 0.91 0.79
Multiple R square of scores with factors 0.82 0.63
Minimum correlation of possible factor scores 0.65 0.26
Loadings:
PA1 PA2
P10 0.444
P11 0.862 0.480
P14 0.330
P16 0.727 0.655
PA1 PA2
SS loadings 1.470 0.769
Proportion Var 0.368 0.192
Cumulative Var 0.368 0.560