Меню

При каком значении среднеквадратической ошибки коэффициент корреляции r 0 83 достоверен

Затем каждую из величин Σfxyax перемножаем на условные отклонения ряда у для данной строки (ay) и результаты записываем в графу 17. Суммируя полученные произведения, получаем величину Σ(Σfxyax)ay=417.

Теперь в нашем распоряжении имеются все необходимые величины для вычисления r по формуле:

Величина полученного коэффициента корреляции говорит об умеренной тесноте связи исследованных признаков, а знак свидетельствует о прямом характере этой связи.

Иногда при наличии линейной связи можно, используя коэффициент корреляции, оценить влияние признака-фактора на результативный признак. Для этого применяется квадрат коэффициента корреляции, называемый коэффициентом детерминации (r2). Если выразить коэффициент детерминации в процентах, то он покажет долю влияния данного факториального признака на результативный. Например, коэффициент корреляции между ростом и весом детей равен +0,75, тогда коэффициент детерминации будет: rxy2=0,752=0,56. Если принять все факторы, влияющие на вес тела, за 100%, то на долю роста приходится 56%.

Поскольку коэффициент корреляции в клинических исследованиях рассчитывается обычно для ограниченного числа наблюдений, нередко возникает вопрос о надежности полученного коэффициента. С этой целью определяют сред-

нюю ошибку коэффициента корреляции. При достаточно большом числе на-

блюдений (больше 100) средняя ошибка коэффициента корреляции r) вычисляется по формуле:

1r

2

mr

=

xy

(1.37)

n

где n — число парных наблюдений.

В том случае, если число наблюдений меньше 100, но больше 30, точнее определять среднюю ошибку коэффициента корреляции, пользуясь формулой:

1r 2

mr =

xy

(1.38)

n 1

66

С достаточной для медицинских исследований надежностью о наличии той или иной степени связи можно утверждать только тогда, когда величина коэффициента корреляции превышает или равняется величине трех своих ошибок (rxy>=3mr). Обычно это отношение коэффициента корреляции (rху) к его средней ошибке r) обозначают буквой t и называют критерием достоверности:

tr

=

rxy

(1.39)

mr

Если tr >= 3, то коэффициент корреляции достоверен. В рассмотренном выше примере число наблюдений 142, а коэффициент корреляции 0,68. Тогда

mr

=

1rxy2

1(0,68)2

n

=

142

= 0,045

r

tr =

=

0,68

=15 ,

mr

0,045

т. е. коэффициент корреляции вполне достоверен.

В случае малой выборки (число наблюдений меньше 30) для оценки достоверности коэффициента корреляции, т. е. для определения соответствия коэффициента корреляции, вычисленного по выборочным данным, действительным размерам связи в генеральной совокупности, средняя ошибка коэффициента корреляции r) определяется по формуле:

1r 2

mr =

xy

(1.40)

n 2

Значения критерия tr оцениваются по таблице t Стьюдента при числе степеней свободы v = п — 2. Если величина tr больше табличного значения t05, то коэффициент корреляции признается надежным с доверительной вероятностью больше 95%. Например, имеется коэффициент корреляции, равный +0,72 при числе наблюдений 28. Тогда

mr = 1(0,72)2 = ±0,019 28 2

tr = 0,0190,72 = 35,9

Полученное значение tr = 35,9 значительно больше табличного t01 = 2,779, следовательно, полученному коэффициенту корреляции можно доверять с высокой степенью вероятности (>99%).

В медицинской практике нередко возникает необходимость сравнить между собой два выборочных коэффициента корреляции и определить, существенна ли разница между ними. Ввиду того, что распределение коэффициента корреляции отличается от нормального, для оценки значимости различия между двумя коэффициентами корреляции рекомендуется использовать величину Z,

67

предложенную Р. Фишером. Величины Z, соответствующие различным значениям коэффициента корреляции, представлены в табл. 1.38.

Например, при исследовании тесноты связи между ростом и весом девочек и мальчиков было установлено, что у мальчиков коэффициент корреляции равен 0,5, а у девочек — 0,7. При этом обследовано 20 мальчиков и 30 девочек. Можно ли считать, что у девочек сильнее выражена связь между ростом и весом, чем у мальчиков? Для решения этого вопроса переведем значение наших коэффициентов корреляции (r) в величины Z. Находим по таблице, что r = 0,5 соответствует Z = 0,5493, а для r = 0,7 соответствует Z = 0,8673. Ошибка разности вычисляется по формуле:

mz

=

n1

1

+

1

=

1

+

1

= 0,10 = 0,316

3

n2 3

20 3

30 3

Вычисляем критерий значимости различий:

tz

=

z1 z2

=

0,8673 0,5493

=

0,3188

=1,005

mz

0,316

0,316

Разность признается значимой, если tz ≥ 3. В нашем примере tz < 3; следовательно, на основании полученных коэффициентов корреляции нельзя делать вывод о более выраженной связи между ростом и весом у девочек.

Таблица 1.38 — Таблица величин Z

r

0,00

0,01

0,02

0,03

0,04

0,05

0,06

0,07

0,08

0,09

0,90

1,4722

1,5275

1,5890

1,6584

1,7380

1,8318

1,9459

2,0923

2,2976

2,6467

0,80

1,0986

1,1270

1,1568

1,1881

1,2212

1,2562

1,2933

1,3101

1,3758

1,4219

0,70

0,8673

0,8872

0,9076

0,9287

0,9505

0,9730

0,9962

1,0203

1,0454

1,0714

0,60

0,6931

0,7089

0,7250

0,7414

0,7582

0,7753

0,7623

0,8107

0,8291

0,8480

0,50

0,5493

0,5627

0,5763

0,5901

0,6042

0,6184

0,6328

0,6475

0,6625

0,6777

0,40

0,4236

0,4356

0,4477

0,4599

0,4722

0,4847

0,4973

0,5101

0,5230

0,5361

0,30

0,3045

0,3205

0,3316

0,3428

0,3541

0,3654

0,3769

0,3884

0,4001

0,4118

0,20

0,2027

0,2132

0,2237

0,2342

0,2448

0,2554

0,2661

0,2769

0,2877

0,2986

0,10

0,1003

0,1104

0,1205

0,1307

0,1409

0,1511

0,1614

0,1717

0,1820

0,1923

0,00

0,0000

0,0100

0,0200

0,0300

0,0400

0,0501

0,0600

0,0701

0,0802

0,0902

1.8.5 Определение тесноты связи между качественными признаками

При изучении зависимости качественных признаков используется коэффициент сопряженности. Для определения тесноты связи в случае альтернативной изменчивости двух сопоставляемых признаков имеющиеся данные сводятся в четырехпольную таблицу, и коэффициент сопряженности вычисляется по формуле:

C1 =

ad bc

(1.41)

(a +c)(b + d)(a +b)(c + d)

68

Если ранее по данным этой таблицы был вычислен критерий χ2, то коэффициент сопряженности вычисляется по формуле:

C1 =

χ2

=

χ2

(1.42)

a +b +c + d

n

Например, требуется установить, имеется ли связь между степенью тяжести ревматизма и эффективностью тонзиллэктомии (табл. 1.39).

Таблица 1.39 — Эффективность тонзиллэктомии в зависимости от симптоматики ревматизма

Симптоматика ревматизма

Результат лечения

Итого

успешное

неэффективное

Больные, имевшие изменения со

9

26

cтороны сердца и суставов.

Больные, имевшие изменения

8

16

только со cтороны сердца . .

Всего

25

17

42

Коэффициент сопряженности изменяется в пределах от +1 до -1 и оценивается аналогично коэффициенту корреляции.

При сопоставлении качественных признаков, имеющих три и больше групп, для определения тесноты связи, пользуются коэффициентом средней квадратичной сопряженности Пирсона:

и коэффициентом взаимной сопряженности Чупрова:

K =

φ2

(1.44)

(k1 1) (k2 1)

где k1 число групп по столбцам;

k2 — число групп по строкам таблицы;

ϕ2 + 1 — равно о сумме отношений квадратов частот каждой клетки таблицы к произведению итогов строк и соответствующих итогов столбцов

2

ϕ2

+ 1 =

mxy

(1.45)

m

m

x

y

Пример. Вычислим коэффициент средней квадратической сопряженности Пирсона между гистологической структурой и типом роста опухоли по данным таблицы 1.40.

Находим значение ϕ2 + 1:

69

φ

2

+1

=

mxy2

=

112

+

62

+

22

+

2

2

+

32

+

10

2

+

12

+

12

+

32

+

mx

my

20

21

33 21

14

21

6

21

20

15

33

15

14 15

6

15

20

12

+

52

+

32

+

12

+

12

+

72

+

32

+

12

+

52

+

2

2

+

4

2

+

22

=1,47

33 12

14 12

6 12

20 12

33 11

14 11

33 6

14 6

20

8

33

6

6 8

Отсюда находим ϕ2 =1,47 – 1 = 0,47.

Коэффициент средней квадратичной сопряженности Пирсона:

C1 = 1,470,47 = 0,565

Коэффициент взаимной сопряженности Чупрова равняется

K =

0,47

=

0,47

=

0,47

= 0,12 = 0,348

(4

1) (6 1)

3 5

15

Полученный коэффициент К также свидетельствует о наличии связи между рассматриваемыми признаками.

Таблица 1.40 — Зависимость между гистологической структурой опухоли и типом ее роста

Гистологическая

Тип роста опухоли (х)

Итого

структура (у)

экзофит-

язвенно-

диффузно-

переход-

(my)

ный

инфиль-

инфильтра-

ный

тративный

тивный

Аденокарцинома

11(mxy)

6

2

2

21

Cr. simplex………

3

10

1

1

15

Солидный рак……

3

5

3

1

12

Слизистый………

1

7

3

11

Фиброзный рак…

1

5

6

Смешанные формы

2

4

2

8

Всего (mx)………

20

33

14

6

73

При применении коэффициента сопряженности С1 следует учитывать, что он всегда меньше 1 и теоретическая его величина зависит от числа строк и столбцов таблицы. Поэтому вычисление коэффициента С1 правомочно только тогда, когда каждый из сопоставляемых признаков имеет не менее 5 градаций (таблица 5×5 групп). Коэффициент Чупрова, который всегда меньше коэффициента С1 не имеет этого ограничения.

Достоверность выборочного коэффициента взаимной сопряженности оценивается с помощью критерия χ2. Полученная величина χ2=nϕ2 сопоставляется с табличными значениями χ2 при числе степеней свободы v=(k 1)(k2-1) и р = 0,05.

70

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]

  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #

Объем выборки (n) p=0,05 p=0,01 p=0,001
5 0,88 0,96 0,99
6 0,81 0,92 0,97
7 0,75 0,88 0,95
8 0,71 0,83 0,93
9 0,67 0,80 0,90
10 0,63 0,77 0,87
11 0,60 0,74 0,85
12 0,58 0,71 0,82
13 0,55 0,68 0,80
14 0,53 0,66 0,78
15 0,51 0,64 0,76
16 0,50 0,62 0,74
17 0,48 0,61 0,73
18 0,47 0,59 0,71
19 0,46 0,58 0,69
20 0,44 0,56 0,68
21 0,43 0,55 0,67
22 0,42 0,54 0,65
23 0,41 0,53 0,64
24 0,40 0,52 0,63
25 0,40 0,51 0,62
26 0,39 0,50 0,61
27 0,38 0,49 0,60
28 0,37 0,48 0,59
29 0,37 0,47 0,58
30 0,36 0,46 0,57
31 0,36 0,46 0,56
32 0,35 0,45 0,55
33 0,34 0,44 0,55
34 0,34 0,44 0,54
35 0,33 0,43 0,53
36 0,33 0,42 0,53
37 0,33 0,42 0,52
38-39 0,32 0,41 0,51
40-41 0,31 0,40 0,50
42 0,30 0,39 0,49
43 0,30 0,39 0,48
44 0,30 0,38 0,48
45-46 0,29 0,38 0,47
47 0,29 0,37 0,47
48 0,29 0,37 0,46
49 0,28 0,37 0,46
50-51 0,28 0,36 0,45
52-54 0,27 0,35 0,44
55 0,27 0,35 0,43
56 0,26 0,34 0,43
57-58 0,26 0,34 0,42
59 0,26 0,33 0,42
60-62 0,25 0,33 0,41
63 0,25 0,32 0,41
64 0,25 0,32 0,40
65-66 0,24 0,32 0,40
67-70 0,24 0,31 0,39
80 0,22 0,29 0,36
90 0,21 0,27 0,34
100 0,20 0,26 0,32
110 0,19 0,25 0,31
120 0,18 0,23 0,30
130 0,17 0,23 0,29
140 0,17 0,22 0,28
150 0,16 0,21 0,27
200 0,14 0,18 0,23
250 0,12 0,16 0,21
300 0,11 0,15 0,19
350 0,11 0,14 0,18
400 0,10 0,13 0,16
450 0,09 0,12 0,16
500 0,09 0,12 0,15
600 0,08 0,11 0,13

Источник: Наследов А.Д. Математические методы психологического исследования. Анализ и интерпретация данных. Учебное пособие. 3-е изд., стереотип. — СПб.: Речь, 2007. — 392 с.

Обнаружение взаимосвязей между явлениями – одна из главных задач статистического анализа. На то есть две причины. Первая. Если известно, что один процесс зависит от другого, то на первый можно оказывать влияние через второй. Вторая. Даже если причинно-следственная связь отсутствует, то по изменению одного показателя можно предсказать изменение другого.

Взаимосвязь двух переменных проявляется в совместной вариации: при изменении одного показателя имеет место тенденция изменения другого. Такая взаимосвязь называется корреляцией, а раздел статистики, который занимается взаимосвязями – корреляционный анализ.

Корреляция – это, простыми словами, взаимосвязанное изменение показателей. Она характеризуется направлением, формой и теснотой. Ниже представлены примеры корреляционной связи.

Разные типы корреляции

Далее будет рассматриваться только линейная корреляция. На диаграмме рассеяния (график корреляции) изображена взаимосвязь двух переменных X и Y. Пунктиром показаны средние.

Линейная корреляция

При положительном отклонении X от своей средней, Y также в большинстве случаев отклоняется в положительную сторону от своей средней. Для X меньше среднего, Y, как правило, тоже ниже среднего. Это прямая или положительная корреляция. Бывает обратная или отрицательная корреляция, когда положительное отклонение от средней X ассоциируется с отрицательным отклонением от средней Y или наоборот.

Линейность корреляции проявляется в том, что точки расположены вдоль прямой линии. Положительный или отрицательный наклон такой линии определяется направлением взаимосвязи.

Крайне важная характеристика корреляции – теснота. Чем теснее взаимосвязь, тем ближе к прямой точки на диаграмме. Как же ее измерить?

Складывать отклонения каждого показателя от своей средней нет смысла, получим нуль. Похожая проблема встречалась при измерении вариации, а точнее дисперсии. Там эту проблему обходят через возведение каждого отклонения в квадрат.

Формула дисперсии

Квадрат отклонения от средней измеряет вариацию показателя как бы относительно самого себя. Если второй множитель в числителе заменить на отклонение от средней второго показателя, то получится совместная вариация двух переменных, которая называется ковариацией.

Формула ковариации

Чем больше пар имеют одинаковый знак отклонения от средней, тем больше сумма в числителе (произведение двух отрицательных чисел также дает положительное число). Большая положительная ковариация говорит о прямой взаимосвязи между переменными. Обратная взаимосвязь дает отрицательную ковариацию. Если количество совпадающих по знаку отклонений примерно равно количеству не совпадающих, то ковариация стремится к нулю, что говорит об отсутствии линейной взаимосвязи.

Таким образом, чем больше по модулю ковариация, тем теснее линейная взаимосвязь. Однако значение ковариации зависит от масштаба данных, поэтому невозможно сравнивать корреляцию для разных переменных. Можно определить только направление по знаку. Для получения стандартизованной величины тесноты взаимосвязи нужно избавиться от единиц измерения путем деления ковариации на произведение стандартных отклонений обеих переменных. В итоге получится формула коэффициента корреляции Пирсона.

Формула линейного коэффициента корреляции Пирсона

Показатель имеет полное название линейный коэффициент корреляции Пирсона или просто коэффициент корреляции.

Коэффициент корреляции показывает тесноту линейной взаимосвязи и изменяется в диапазоне от -1 до 1. -1 (минус один) означает полную (функциональную) линейную обратную взаимосвязь. 1 (один) – полную (функциональную) линейную положительную взаимосвязь. 0 – отсутствие линейной корреляции (но не обязательно взаимосвязи). На практике всегда получаются промежуточные значения. Для наглядности ниже представлены несколько примеров с разными значениями коэффициента корреляции.

Различная степень корреляции

Таким образом, ковариация и корреляция отражают тесноту линейной взаимосвязи. Последняя используется намного чаще, т.к. является относительным показателем и не имеет единиц измерения.

Диаграммы рассеяния дают наглядное представление, что измеряет коэффициент корреляции. Однако нужна более формальная интерпретация. Эту роль выполняет квадрат коэффициента корреляции r2, который называется коэффициентом детерминации, и обычно применяется при оценке качества регрессионных моделей. Снова представьте линию, вокруг которой расположены точки.

Разброс точек вдоль прямой линии

Линейная функция является моделью взаимосвязи между X иY и показывает ожидаемое значение Y при заданном X. Коэффициент детерминации – это соотношение дисперсии ожидаемых Y (точек на прямой линии) к общей дисперсии Y, или доля объясненной вариации Y. При r = 0,1 r2 = 0,01 или 1%, при r = 0,5 r2 = 0,25 или 25%.

Выборочный коэффициент корреляции

Коэффициент корреляции обычно рассчитывают по выборке. Значит, у аналитика в распоряжении не истинное значение, а оценка, которая всегда ошибочна. Если выборка была репрезентативной, то истинное значение коэффициента корреляции находится где-то относительно недалеко от оценки. Насколько далеко, можно определить через доверительные интервалы.

Согласно Центральное Предельной Теореме распределение оценки любого показателя стремится к нормальному с ростом выборки. Но есть проблемка. Распределение коэффициента корреляции вблизи придельных значений не является симметричным. Ниже пример распределения при истинном коэффициенте корреляции ρ = 0,86.

Распределение выборочных коэффициентов корреляции

Предельное значение не дает выйти за 1 и, как бы «поджимает» распределение справа. Симметричная ситуация наблюдается, если коэффициент корреляции близок к -1.

В общем рассчитывать на свойства нормального распределения нельзя. Поэтому Фишер предложил провести преобразование выборочного коэффициента корреляции по формуле:

Преобразование Фишера

Распределение z для тех же r имеет следующий вид.

Распределение коэффициентов корреляции после преобразования Фишера

Намного ближе к нормальному. Стандартная ошибка z равна:

Стандартная ошибка z

Далее исходя из свойств нормального распределения несложно найти верхнюю и нижнюю границы доверительного интервала для z. Определим квантиль стандартного нормального распределения для заданной доверительной вероятности, т.е. количество стандартных отклонений от центра распределения.

Квантиль стандартного нормального распределения для расчета доверительного интервала

cγ – квантиль стандартного нормального распределения;
N-1 – функция обратного стандартного распределения;
γ – доверительная вероятность (часто 95%).
Затем рассчитаем границы доверительного интервала.

Нижняя граница z:

Верхняя граница z:

Теперь обратным преобразованием Фишера из z вернемся к r.
Нижняя граница r:

Верхняя граница r:

Это была теоретическая часть. Переходим к практике расчетов.

Как посчитать коэффициент корреляции в Excel

Корреляционный анализ в Excel лучше начинать с визуализации.

Диаграмма рассеяния для визуального анализа корреляции

На диаграмме видна взаимосвязь двух переменных. Рассчитаем коэффициент парной корреляции с помощью функции Excel КОРРЕЛ. В аргументах нужно указать два диапазона.

Расчет коэффициента корреляции в Excel

Коэффициент корреляции 0,88 показывает довольно тесную взаимосвязь между двумя показателями. Но это лишь оценка, поэтому переходим к интервальному оцениванию.

Расчет доверительного интервала для коэффициента корреляции в Excel

В Эксель нет готовых функций для расчета доверительного интервала коэффициента корреляции, как для средней арифметической. Поэтому план такой:

— Делаем преобразование Фишера для r.
— На основе нормальной модели рассчитываем доверительный интервал для z.
— Делаем обратное преобразование Фишера из z в r.

Удивительно, но для преобразования Фишера в Excel есть специальная функция ФИШЕР.

Преобразование Фишера в Excel

Стандартная ошибка z легко подсчитывается с помощью формулы.

Стандартная ошибка z

Используя функцию НОРМ.СТ.ОБР, определим квантиль нормального распределения. Доверительную вероятность возьмем 95%.

Квантиль нормального распределения

Значение 1,96 хорошо известно любому опытному аналитику. В пределах ±1,96σ от средней находится 95% нормально распределенных величин.

Используя z, стандартную ошибку и квантиль, легко определим доверительные границы z.

Доверительные границы для z

Последний шаг – обратное преобразование Фишера из z назад в r с помощью функции Excel ФИШЕРОБР. Получим доверительный интервал коэффициента корреляции.

Доверительные границы коэффициента корреляции

Нижняя граница 95%-го доверительного интервала коэффициента корреляции – 0,724, верхняя граница – 0,953.

Надо пояснить, что значит значимая корреляция. Коэффициент корреляции статистически значим, если его доверительный интервал не включает 0, то есть истинное значение по генеральной совокупности наверняка имеет тот же знак, что и выборочная оценка.

Несколько важных замечаний

1. Коэффициент корреляции Пирсона чувствителен к выбросам. Одно аномальное значение может существенно исказить коэффициент. Поэтому перед проведением анализа следует проверить и при необходимости удалить выбросы. Другой вариант – перейти к ранговому коэффициенту корреляции Спирмена. Рассчитывается также, только не по исходным значениям, а по их рангам (пример показан в ролике под статьей).

2. Синоним корреляции – это взаимосвязь или совместная вариация. Поэтому наличие корреляции (r ≠ 0) еще не означает причинно-следственную связь между переменными. Вполне возможно, что совместная вариация обусловлена влиянием третьей переменной. Совместное изменение переменных без причинно-следственной связи называется ложная корреляция.

3. Отсутствие линейной корреляции (r = 0) не означает отсутствие взаимосвязи. Она может быть нелинейной. Частично эту проблему решает ранговая корреляция Спирмена, которая показывает совместный рост или снижение рангов, независимо от формы взаимосвязи.

В видео показан расчет коэффициента корреляции Пирсона с доверительными интервалами, ранговый коэффициент корреляции Спирмена.

↓ Скачать файл с примером ↓

Поделиться в социальных сетях:

0 0 голоса
Рейтинг статьи
Подписаться
Уведомить о
guest

0 комментариев
Старые
Новые Популярные
Межтекстовые Отзывы
Посмотреть все комментарии

А вот еще интересные материалы:

  • Яшка сломя голову остановился исправьте ошибки
  • Ясность цели позволяет целеустремленно добиваться намеченного исправьте ошибки
  • Ясность цели позволяет целеустремленно добиваться намеченного где ошибка
  • При каких условиях можно уменьшить предельную ошибку выборки
  • Посудомоечная машина куперсберг ошибка е2 что делать