Геодезия и геоинформатика
УДК 519.2:528.1
О КОРРЕЛЯЦИИ ФУНКЦИЙ СЛУЧАЙНЫХ ОШИБОК ИЗМЕРЕНИЙ
Наталья Борисовна Лесных
Сибирская государственная геодезическая академия, 630108, Россия, г. Новосибирск,
ул. Плахотного, 10, кандидат технических наук, ведущий научный сотрудник, тел. (383)343-18-53
Владимир Евгеньевич Мизин
Сибирская государственная геодезическая академия, 630108, Россия, г. Новосибирск,
ул. Плахотного, 10, кандидат технических наук, старший преподаватель кафедры геодезии, тел. (383)344-36-60, e-mail: ssga221@mail.ru
Исследована корреляция повторных определений координат пунктов полигонометрического хода как функций случайных ошибок измерений.
Ключевые слова: корреляция, координаты, анализ, разности, ошибки, функции.
CORRELATION OF ACCIDENTAL MEASUREMENT ERRORS FUNCTIONS
Natalya B. Lesnykh
Siberian State Academy of Geodesy, 630108, Russia, Novosibirsk, 10 Plakhotnogo St., Ph. D., leading researcher, tel. (383)343-18-53
Vladimir E. Mizin
Siberian State Academy of Geodesy, 630108, Russia, Novosibirsk, 10 Plakhotnogo St., Ph. D., senior lecturer, Department of Geodesy, tel. (383)344-36-60, e-mail: ssga221@mail.ru
The authors investigate correlation of repeated determinations of polygon traverse points coordinates as functions of random measurement errors.
Key words: correlation, coordinates, analysis, differences, errors, functions.
Корреляционная (вероятностная) связь между случайными величинами возникает тогда, когда имеются общие факторы, влияющие на значения этих величин. Показателем тесноты линейной связи между случайными величинами системы X!, Х2, …, Хп служит коэффициент корреляции
Г, j =
д j
a ja j
(1)
где k j =M {[X j -M (Xj )]•[Xj -M (Xj)]} — корреляционный момент пары X, Xj; a j, a j — средние квадратические отклонения Xj и X j. Для независимых (некоррелированных) случайных величин kt , = rz , = 0 .
21
Геодезия и геоинформатика
Случайные, нормально распределенные ошибки измерений А, и А’ некор-релированы (независимы), имеют математическое ожидание M (А)=0 и дисперсию ст2 =М {А-M (А)}2 =М (А2), M (А-А’) = M (А) • M (А’) = 0.
Проверим наличие корреляционной связи для некоторых функций случайных ошибок измерений, содержащих одинаковые коэффициенты при соответствующих ошибках. Рассмотрим систему двух случайных величин, заданную
вектором F —
f ‘j
Ковариационная матрица системы определяется формулой:
KF =M {[ F-M (F)] • [ F-M (F )]т} =M
\f» М (f)_
If’ _ М (f ‘)_ (
‘(. fт f ,m)-( M (f )m m (. f r)
О > J О J> J
Для функций f = < а2 А 2 >={а/ Ai} и f = а2 А2 >
ая А я ая Ая
■{aA,}, где
Qi —
постоянные коэффициенты, M {аг Аг } = {аг М (Аг )} = 0; М(f) = М(f’) = 0
является дисперсионной матрицей.
и KF = М
К f) (fm f’ m Гст2 0 ^ CT f 0
fl. f ‘J ■yj J ) 0 ст f’ l f J
Здесь ст2 = М(f • f m), ст2> = М(f’ • f’m), kff’ = M(f • f ‘m)=0 — корреляционный момент пары случайных величин f и f.
Для функций:
f={аА(а) +^А6)} и f={^А^’ + Ь,А’ъ }, (i = 1 2> •••, я); (2)
M(f)={ а1М(А(а))+Ь,М(А{Ь ))}=0, М( f)=0;
( а,А«> + Ь^
kf = М
а„Ая) + Ья АЬЯ) J
(а1Аа(1) +Ь1АЬ(1) … аяА’а(я) + ЬяАЬ(я))
}=0
функции f и f’ некоррелированы.
22
Геодезия и геоинформатика
Для функций накопленных случайных ошибок измерений
A! A’,
V II A1 + A2 V” S II Л. A1+A2 >
A1 + A2 + … + An A1+A2 +…+An
‘ Ai «
M < A1 +A2 • (a1 a1+a2 . .. A1 + A2 + … + An )
KA1 + A2 + An у
(3)
функции f и f’ также некоррелированы, M(f) = 0, M(f) = 0.
Разности повторных определений координат полигонометрического хода содержат информацию о стабильности пунктов геодезической основы при мониторинге инженерного сооружения. Если координаты, вычисленные по результатам независимых повторных измерений, некоррелированы, предельно допустимое значение их разностей можно определить по формуле [1]:
Кред. = * • mx -&■ (4)
На моделях ходов полигонометрии 4-го класса исследована корреляционная связь между координатами пунктов, полученными по результатам повторных, независимых измерений углов и сторон.
Представим разности координат d(x), d(y) как функции их истинных случайных ошибок Ax, Ay, A’x, Ay:
d(x)=x-Х=X + Ax-X-AX = Ax-AX; d(y)=y-y’=Ay-Ay.
Истинные ошибки координат можно получить через истинные ошибки приращений:
A dx =A S)cos a i
(5)
Случайные ошибки дирекционных углов и координат являются функциями накопленных аргументов — случайных ошибок измеренных углов и приращений координат соответственно:
j=1
A x° =IA dx)
j=1
j=1
(6)
23
Геодезия и геоинформатика
Функции (5), (6) аналогичны (2), (3) и теоретически не коррелированны с результатами их повторных определений. Проверим это утверждение экспериментально. Оценка коэффициента корреляции вычисляется по формуле:
[5.x -5.x’]
rx, x’ — — ,
ax ’ax’ (n — 1)
(7)
где 5xt = xi — x, Mx = x = [x]/ n — оценка математического ожидания,
ax=yJ[5×2]/n -1 — оценка среднего квадратического отклонения.
Значимость 7xx>, Ту у устанавливалась с использованием функции z Фишера для доверительной вероятности 0(t) = 0,997, t = 3 [2].
Характеристики ходов полигонометрии и оценки коэффициентов корреляции истинных ошибок координат первого и второго циклов наблюдений представлены в табл. 1.
Таблица 1
Корреляция повторных определений координат
Варианты 1 2 3 4 5
Характери- стики a =170°- 195° s = 300 м, n = 20, op = 2” os = 2 см a = 170-195° s = 500 м, n = 20, op = 2” os = 3 см a = 85-96° s = 300 м, n = 20, op = 2” os = 2 см a = 85-96° s = 300 м, n = 20, op = 2” os = 2 см a = 10-180° s = 300 м, n = 20, op = 2” os = 2см
rx, x’ -0,237 -0,583 -0,379 -0,984 0,963
r 2 — Г1 1,199 0,944 1,127 0,064 0,141
Корреляция — — — + +
ry, у’ -0,993 -0,980 -0,229 -0,288 0,230
r 2 — ri 0,029 0,077 1,203 1,178 1,202
Корреляция + + — — —
iНе можете найти то, что вам нужно? Попробуйте сервис подбора литературы.
В четырех случаях из десяти между координатами первого и второго циклов установлено наличие корреляционной связи. Почему некоторые функции (5) оказались коррелированы? Вероятностно-статистический анализ закона распределения [3-5] ошибок приращений координат Л^, Adx>, Л^у, Л^’, выполненный по каждому из пяти вариантов хода, выявил несоответствие распределения коррелированных рядов ошибок нормальному закону.
24
Геодезия и геоинформатика
В частности, критерием равенства средних, статистика которого
|Д-м (Д)|
3 а / 4п ’
(8)
установлено существенное отклонение оценки математического ожидания случайных ошибок приращений координат от нуля, что противоречит теоретическим предпосылкам некоррелированности координат (табл. 2).
Закон распределения
Таблица 2
№ 1 2 4 5
Критерии Д dy Д dy’ Д dy Ady’ Д dx Д dx’ Д dx Д dx’
Д (см) -0,80 0,68 -2,82 2,07 -0,98 0,72 -0,53 -1,27
а (см) 0,70 0,43 1,48 1,50 0,47 0,30 1,40 1,46
t э 5,1 7,1 8,5 6,2 9,3 10,8 1,67 3,89
Рб > tэ) 6 ■ 10-5 9 ■ 10-7 7 ■ 10-8 6 ■ 10-6 2 ■ 10-6 2 ■ 10-9 0,08 9 ■ 10-4
Три свойства ± — — — — — + ±
Знак «-» в табл. 2 означает, что свойства случайных ошибок не выполняются.
В формулах (5), в зависимости от значения дирекционного угла, преобладают слагаемые Дs cos а, Дs sin а или (-s • sin а / р) • Да, (s • cos а / р) • Да. Закон распределения первого слагаемого соответствует закону случайных, нормально распределенных ошибок Дs с математическим ожиданием M (Дs)=0 и оценкой математического ожидания, несущественно отличающейся от нуля. Ошибки дирекционных углов второго слагаемого являются функциями накопленных аргументов — случайных ошибок угловых измерений (6). Подобные функции могут на значительном протяжении сохранять один и тот же знак и вследствие этого, по своим статистическим свойствам не совпадать со свойствами случайных, нормально распределенных ошибок измерений.
Представим эту ситуацию в табл. 3 примерами из варианта 1.
Закон распределения преобладающего слагаемого в формулах ошибок приращений координат определил закон распределения суммы слагаемых. В формулах Дdx преобладает первое слагаемое. Ошибки Adx распределены нормально, как и случайные ошибки Дs, оценка математического ожидания Дdx пренебрегаемо мало отличается от нуля, между результатами повторных определений координат корреляционной связи не установлено.
25
Геодезия и геоинформатика
Таблица 3
Слагаемые формул ошибок приращений координат
а А* Аdx (см) Аdy (см)
Ascosа -(dy / Р»)Аа Д5 sin а (dx / р»)Да
170 0 0,93 -0,256 -0,023 0,045 -0,133
195 1,05 4,878 0,040 1,308 -0,146
170 4,02 0,699 -0,102 -0,123 -0,576
175 6,06 0,936 -0,077 -0,082 -0,878
190 8,85 1,093 0,224 0,193 -1,268
В формулах Ady преобладает, в основном, второе слагаемое. Закон распределения ошибок A dy, как и Да, не является нормальным, среднее арифметическое Ady существенно отличается от нуля, что и привело к значительному увеличению оценки коэффициента корреляции Гу у’.
Появление в полигонометрическом ходе невязок, близких к предельным значениям, свидетельствует о накоплении ошибок одного знака и возможном искажении случайных свойств в рядах истинных ошибок дирекционных углов и координат.
Очевидно, исследование устойчивости пунктов геодезической основы требует комплексного подхода и не может быть ограничено единственно расчетом допустимого значения разности повторных определений координат [2, 6-10].
БИБЛИОГРАФИЧЕСКИЙ СПИСОК
1. Мизин В. Е. Допустимые значения разностей повторных определений координат полигонометрического хода // ГЕО-Сибирь-2011. VII Междунар. науч. конгр. : сб. материалов в 6 т. (Новосибирск, 19-29 апреля 2011 г.). — Новосибирск: СГГА, 2011. Т. 3, ч. 2. — С. 42-45.
2. Мизин В. Е. Корреляционный анализ разностей повторных наблюдений геодезической основы при мониторинге линейных объектов // Изв. вузов. Геодезия и аэрофотосъемка. — 2011. — № 3. — С. 26-28.
3. Лесных Н. Б. Законы распределения случайных величин в геодезии: монография. -Новосибирск: СГГА, 2005. — 128 с.
4. Лесных Н. Б. Объекты статистического анализа в геодезии: монография. — Новосибирск: СГГА, — 2010. — 128 с.
5. Лесных Н. Б., Мизин В. Е. Сравнительная характеристика результатов двух статистических методов анализа разностей повторных измерений // Вестник СГГА. — Новосибирск: СГГА, 2012. — Вып. 1 (17). — С. 41-46.
6. Мизин В. Е. Оценка точности геодезических измерений при мониторинге линейных объектов // ГЕО-Сибирь-2006. Междунар. науч. конгр. : сб. материалов в 6 т. (Новосибирск, 24-28 апреля 2006 г.). — Новосибирск: СГГА, 2006. Т. 2, ч. 1. — С. 91-94.
26
Геодезия и геоинформатика
7. Мизин В. Е. Проектирование полигонометрического хода методом моделирования // ГЕО-Сибирь-2010. VI Междунар. науч. конгр. : сб. материалов в 6 т. (Новосибирск, 19-29 апреля 2010 г.). — Новосибирск: СГГА, 2010. Т. 1, ч. 1. — С. 123-126.
8. Мизин В. Е. Предрасчет точности координат полигонометрического хода для целей мониторинга земель линейных объектов // ГЕО-Сибирь-2010. VI Междунар. науч. конгр. : сб. материалов в 6 т. (Новосибирск, 19-29 апреля 2010 г.). — Новосибирск: СГГА, 2010. Т. 2, ч. 1. — С. 127-130.
9. Мизин В. Е. О систематических ошибках повторных // ГЕО-Сибирь-2011. VII Междунар. науч. конгр. : сб. материалов в 6 т. (Новосибирск, 19-29 апреля 2011 г.). — Новосибирск: СГГА, 2011. Т. 3, ч. 2. — С. 38-41.
10. Лесных Н. Б. Две ошибки проверки гипотезы об отсутствии систематических влияний // ГЕО-Сибирь-2010. VI Междунар. науч. конгр. : сб. материалов в 6 т. (Новосибирск, 19-29 апреля 2010 г.). — Новосибирск: СГГА, 2010. Т. 1, ч. 1. — С. 85-90.
Получено 15.06.2013
© Н. Б. Лесных, В. Е. Мизин, 2013
27
4.1. Понятие об измерениях
Измерение
– это процесс сравнения измеряемой
величины с величиной принятой за единицу
сравнения, в результате которого
получается именованное число, называемоерезультатом измерения.
Различают:
прямые,илинепосредственныеикосвенныеизмерения.
Непосредственными
называют такие измерения, когда
определяемые величины получают прямо
из измерений, в результате непосредственного
сравнения их с единицей измерений.
Примеры непосредственных измерений –
определение расстояний мерной лентой,
измерение угла теодолитом.
Косвеннымиявляются такие измерения, при которых
определяемые величины получают как
функции непосредственно измеренных
величин. Косвенный метод предполагает
вычисление значения искомой величины.
Например, превышение при тригонометрическом
нивелировании является функцией
расстояния и угла наклона, измеренных
непосредственно на местности.
Результаты
измерений разделяют на равноточныеинеравноточные.
Равноточныминазывают результаты измерения однородных
величин, полученные при многократных
измерениях в сходных условиях (одним
наблюдателем одним и тем же прибором,
одним методом и при одних и тех же
условиях окружающей среды).
При
нарушении даже одного из перечисленных
условий результаты измерений относят
к неравноточным.
При
математической обработке результатов
топографо-геодезических измерений
определенное значение имеют понятия о
необходимом иизбыточномчисле
измерений. В общем случае для решения
любой топографической задачи необходимо
измерить некоторое минимальное число
величин, обеспечивающее решение задачи.
Эти измерения называютчислом
необходимых измерений t.Разностьkпри вычитании числа необходимых измеренийtиз числа всех измеренных величинn, называют числом избыточных
величин k = n – t.Избыточные измерения
величины позволяют обнаружить ошибки
в результатах измерений и вычислений
и повысить точность определяемых
величин.
4.2. Классификация ошибок измерений
Результаты
измерений отличаются от истинного
значения измеряемой величины. Разность
между результатом измерения lи
истинным значением измеряемой величиныхназывается абсолютной ошибкой
(погрешностью) результата измерения Δ.
Δ = l –
x.
По
характеру действия и свойствам ошибки
подразделяются на: грубые, систематические
и случайные.
Грубые
ошибки, или промахи происходят в
результате невнимательности исполнителя
работ. К грубым относятся ошибки, которые
превышают допустимую величину. Для
исключения грубых ошибок выполняются
повторные измерения.
Систематические
ошибкивозникают по определенным
причинам и характеризуются постоянством
своей величины и знака (+ или –). Делятся
на постоянные (неизменные по знаку и
величине) ипеременные(изменяющие
величину по определенному закону).
Причинами их появления могут быть
инструментальные ошибки (неточности в
юстировке измерительных приборов,
нарушение геометрических условий
приборов и др.) и условия среды (изменение
температуры прибора).
Величина
и знак систематических ошибок
устанавливается путем компарированияприбора,т. е. сравнения показаний
рабочего прибора с показаниями прибора,
принятого в качестве эталона.Систематические ошибки должны быть
обнаружены, изучены и исключены из
результатов измерений путем введенияпоправокили использования
соответствующей методики измерений.
Под
случайными понимаются ошибки, знак
и размер которых не имеют закономерности
своего появления, их возникновение не
подчиняется определенным математическим
законам, т. е. носят случайный характер.
Они подчиняются статистическим
закономерностям массовых случайных
величин. Поэтому от случайных ошибок
нет возможности полностью освободить
результаты измерений.
Соседние файлы в папке Топографическая
- #
- #
- #
Эта статья посвящена корреляции и зависимости статистических данных. Для использования в других целях см. корреляция (значения).
![]()
Несколько наборов (Икс, у) точек, с Коэффициент корреляции Пирсона из Икс и у за каждый комплект. Корреляция отражает шумность и направление линейной связи (верхний ряд), но не наклон этой связи (в середине) и многие аспекты нелинейных отношений (внизу). Примечание: цифра в центре имеет наклон 0, но в этом случае коэффициент корреляции не определен, потому что дисперсия Y равно нулю.
В статистика, корреляция или зависимость есть какое-либо статистическое отношение, будь то причинный или нет, между двумя случайные переменные или двумерные данные. В самом широком смысле корреляция — это любая статистическая ассоциация, хотя обычно она относится к степени, в которой пара переменных линейно Связанный. Знакомые примеры зависимых явлений включают корреляцию между рост родителей и их потомков, а также соотношение между ценой товара и количеством, которое потребители готовы купить, как это показано в так называемой кривая спроса.
Корреляции полезны, потому что они могут указывать на предсказательную взаимосвязь, которую можно использовать на практике. Например, электроэнергетическая компания может производить меньше электроэнергии в мягкий день из-за корреляции между спросом на электроэнергию и погодой. В этом примере есть причинно-следственная связь, потому что экстремальные погодные условия заставляют людей использовать больше электроэнергии для обогрева или охлаждения. Однако в целом наличия корреляции недостаточно, чтобы сделать вывод о наличии причинно-следственной связи (т. Е. корреляция не подразумевает причинно-следственной связи ).
Формально случайные величины зависимый если они не удовлетворяют математическому свойству вероятностная независимость. Выражаясь неофициально, корреляция является синонимом зависимость. Однако при использовании в техническом смысле корреляция относится к любому из нескольких конкретных типов математических операций между тестируемые переменные и их соответствующие ожидаемые значения. По сути, корреляция — это мера того, как две или более переменных связаны друг с другом. Есть несколько коэффициенты корреляции, часто обозначаемый или
, измеряя степень корреляции. Наиболее распространенным из них является Коэффициент корреляции Пирсона, который чувствителен только к линейной зависимости между двумя переменными (которая может присутствовать, даже если одна переменная является нелинейной функцией другой). Другие коэффициенты корреляции — например, Ранговая корреляция Спирмена — были разработаны, чтобы быть более крепкий чем у Пирсона, то есть более чувствителен к нелинейным отношениям.[1][2][3] Взаимная информация также может применяться для измерения зависимости между двумя переменными.
Коэффициент произведения-момента Пирсона
![]()
Примеры диаграмм рассеяния различных наборов данных с различными коэффициентами корреляции.
Определение
Самая известная мера зависимости между двумя величинами — это Коэффициент корреляции продукт-момент Пирсона (PPMCC), или «коэффициент корреляции Пирсона», обычно называемый просто «коэффициентом корреляции». Математически это определяется как качество подгонки наименьших квадратов к исходным данным. Он получается путем принятия отношения ковариации двух рассматриваемых переменных в нашем числовом наборе данных, нормированного на квадратный корень из их дисперсий. Математически просто делят ковариация двух переменных произведением их Стандартное отклонение. Карл Пирсон разработал коэффициент на основе похожей, но немного другой идеи Фрэнсис Гальтон.[4]
Коэффициент корреляции продукт-момент Пирсона пытается установить линию наилучшего соответствия набору данных из двух переменных, по существу, путем выкладывания ожидаемых значений, а полученный коэффициент корреляции Пирсона показывает, насколько далеко фактический набор данных находится от ожидаемых значений. В зависимости от знака коэффициента корреляции нашего Пирсона мы можем получить либо отрицательную, либо положительную корреляцию, если существует какая-либо связь между переменными нашего набора данных.
Коэффициент корреляции населения между двумя случайные переменные
и
с участием ожидаемые значения
и
и Стандартное отклонение
и
определяется как
где это ожидаемое значение оператор
означает ковариация, и
— широко используемое альтернативное обозначение коэффициента корреляции. Корреляция Пирсона определяется, только если оба стандартных отклонения конечны и положительны. Альтернативная формула чисто с точки зрения моментов:
Свойство симметрии
Коэффициент корреляции симметричный: . Это подтверждается коммутативным свойством умножения.
Корреляция и независимость
Это следствие Неравенство Коши – Шварца что абсолютная величина коэффициента корреляции Пирсона не больше 1. Следовательно, значение коэффициента корреляции находится в пределах от -1 до +1. Коэффициент корреляции равен +1 в случае идеальной прямой (возрастающей) линейной зависимости (корреляции), -1 в случае идеальной обратной (убывающей) линейной зависимости (антикорреляция),[5] и некоторая ценность в открытый интервал во всех остальных случаях с указанием степени линейная зависимость между переменными. По мере приближения к нулю взаимосвязь уменьшается (ближе к некоррелированной). Чем ближе коэффициент к -1 или 1, тем сильнее корреляция между переменными.
Если переменные независимый, Коэффициент корреляции Пирсона равен 0, но обратное неверно, поскольку коэффициент корреляции обнаруживает только линейные зависимости между двумя переменными.
Например, предположим, что случайная величина симметрично распределена около нуля, а
. потом
полностью определяется
, так что
и
совершенно зависимы, но их корреляция нулевая; они есть некоррелированный. Однако в частном случае, когда
и
находятся совместно нормально некоррелированность эквивалентна независимости.
Несмотря на то, что некоррелированные данные не обязательно подразумевают независимость, можно проверить независимость случайных величин, если их взаимная информация равно 0.
Коэффициент корреляции выборки
Учитывая серию измерения пары
проиндексировано
, то коэффициент корреляции выборки может использоваться для оценки корреляции Пирсона для населения
между
и
. Коэффициент корреляции выборки определяется как
где и
образец означает из
и
, и
и
являются скорректированные стандартные отклонения выборки из
и
.
Эквивалентные выражения для находятся
где и
являются неисправленный стандартные отклонения выборки из
и
.
Если и
являются результатами измерений, которые содержат ошибку измерения, реалистичные пределы коэффициента корреляции составляют не от -1 до +1, а меньший диапазон.[6] В случае линейной модели с одной независимой переменной коэффициент детерминации (R в квадрате) это квадрат
, Коэффициент произведения-момента Пирсона.
пример
Рассмотрим совместное распределение вероятностей и
приведено в таблице ниже.
Для этого совместного распределения предельными распределениями являются:
Это дает следующие ожидания и отклонения:
Следовательно:
Коэффициенты ранговой корреляции
Корреляция рангов коэффициенты, такие как Коэффициент ранговой корреляции Спирмена и Коэффициент ранговой корреляции Кендалла (τ) Измерьте степень, в которой по мере увеличения одной переменной наблюдается тенденция к увеличению другой переменной, не требуя, чтобы это увеличение было представлено линейной зависимостью. Если при увеличении одной переменной другая уменьшается, коэффициенты ранговой корреляции будут отрицательными. Обычно эти коэффициенты ранговой корреляции рассматриваются как альтернативы коэффициенту Пирсона, которые используются либо для уменьшения объема вычислений, либо для того, чтобы сделать коэффициент менее чувствительным к ненормальности в распределениях. Однако у этой точки зрения мало математических оснований, поскольку коэффициенты ранговой корреляции измеряют другой тип взаимосвязи, чем Коэффициент корреляции продукт-момент Пирсона, и их лучше рассматривать как показатель другого типа ассоциации, а не как альтернативный показатель коэффициента корреляции населения.[7][8]
Чтобы проиллюстрировать природу ранговой корреляции и ее отличие от линейной корреляции, рассмотрим следующие четыре пары чисел. :
- (0, 1), (10, 100), (101, 500), (102, 2000).
При переходе от каждой пары к следующей увеличивается, и так же
. Эти отношения идеальны в том смысле, что рост
является всегда сопровождается увеличением
. Это означает, что у нас есть идеальная ранговая корреляция, и коэффициенты корреляции Спирмена и Кендалла равны 1, тогда как в этом примере коэффициент корреляции произведение-момент Пирсона равен 0,7544, что указывает на то, что точки далеко не лежат на прямой линии. Таким же образом, если
всегда уменьшается когда
увеличивается, коэффициенты ранговой корреляции будут равны -1, в то время как коэффициент корреляции произведения-момента Пирсона может быть или не может быть близок к -1, в зависимости от того, насколько близки точки к прямой. Хотя в крайних случаях идеальной ранговой корреляции оба коэффициента равны (оба имеют значение +1 или оба -1), обычно это не так, и поэтому значения двух коэффициентов не могут быть осмысленно сравнены.[7] Например, для трех пар (1, 1) (2, 3) (3, 2) коэффициент Спирмена равен 1/2, а коэффициент Кендалла равен 1/3.
Другие меры зависимости между случайными величинами
Информации, предоставляемой коэффициентом корреляции, недостаточно для определения структуры зависимости между случайными величинами.[9] Коэффициент корреляции полностью определяет структуру зависимости только в очень частных случаях, например, когда распределение является многомерное нормальное распределение. (См. Диаграмму выше.) В случае эллиптические распределения он характеризует (гипер-) эллипсы одинаковой плотности; однако он не полностью характеризует структуру зависимости (например, многомерное t-распределение степени свободы определяют уровень хвостовой зависимости).
Корреляция расстояний[10][11] был введен для устранения недостатка корреляции Пирсона, заключающейся в том, что она может быть равна нулю для зависимых случайных величин; корреляция нулевого расстояния подразумевает независимость.
Коэффициент рандомизированной зависимости[12] является вычислительно эффективным, связка мера зависимости между многомерными случайными величинами. RDC инвариантен по отношению к нелинейным вычислениям случайных величин, способен обнаруживать широкий спектр функциональных паттернов ассоциации и принимает нулевое значение при независимости.
Для двух двоичных переменных отношение шансов измеряет их зависимость и принимает диапазон неотрицательных чисел, возможно бесконечность: . Связанная статистика, такая как Юла Y и Юла Q нормализовать это до корреляционного диапазона
. Отношение шансов обобщено логистическая модель для моделирования случаев, когда зависимые переменные являются дискретными и могут быть одна или несколько независимых переменных.
В коэффициент корреляции, энтропия -на основании взаимная информация, полная корреляция, двойная полная корреляция и полихорическая корреляция все они также способны обнаруживать более общие зависимости, как и рассмотрение связка между ними, в то время как коэффициент детерминации обобщает коэффициент корреляции на множественная регрессия.
Чувствительность к распределению данных
Степень зависимости между переменными и
не зависит от масштаба, в котором выражены переменные. То есть, если мы анализируем взаимосвязь между
и
, на большинство показателей корреляции преобразование
к а + bX и
к c + dY, где а, б, c, и d константы (б и d положительный). Это верно как для некоторых статистических данных по корреляции, так и для их популяционных аналогов. Некоторые статистические данные корреляции, такие как коэффициент ранговой корреляции, также инвариантны к монотонные преобразования маргинальных распределений
и / или
.
![]()
Пирсон /Копейщик коэффициенты корреляции между и
отображаются, когда диапазоны двух переменных не ограничены, и когда диапазон
ограничивается интервалом (0,1).
Большинство показателей корреляции чувствительны к тому, как и
выбраны. Зависимости становятся сильнее, если рассматривать их в более широком диапазоне значений. Таким образом, если мы рассмотрим коэффициент корреляции между ростом отцов и их сыновей по всем взрослым мужчинам и сравним его с тем же коэффициентом корреляции, вычисленным, когда отцы выбраны ростом от 165 до 170 см, корреляция будет слабее в последнем случае. Было разработано несколько методов, которые пытаются исправить ограничение диапазона в одной или обеих переменных, и обычно используются в метаанализе; наиболее распространенными являются уравнения Торндайка II и III.[13]
Различные используемые меры корреляции могут быть не определены для определенных совместных распределений Икс и Y. Например, коэффициент корреляции Пирсона определяется в терминах моменты, и, следовательно, будет неопределенным, если моменты не определены. Меры зависимости на основе квантили всегда определены. Статистика на основе выборки, предназначенная для оценки показателей зависимости населения, может иметь или не обладать желательными статистическими свойствами, такими как беспристрастный, или асимптотически согласованный, основанный на пространственной структуре совокупности, из которой были взяты данные.
Чувствительность к распределению данных может быть использована с пользой. Например, масштабированная корреляция предназначен для использования чувствительности к диапазону для выявления корреляций между быстрыми компонентами временного ряда.[14] Контролируемое сокращение диапазона значений позволяет отфильтровать корреляции в долгой шкале времени, и выявляются только корреляции в короткой шкале времени.
Корреляционные матрицы
Корреляционная матрица случайные переменные
это
матрица, чья
запись
. Если используемые меры корреляции являются коэффициентами продукта-момента, матрица корреляции такая же, как и ковариационная матрица из стандартизированные случайные величины
для
. Это относится как к матрице корреляций населения (в этом случае
стандартное отклонение генеральной совокупности) и матрице выборочных корреляций (в этом случае
обозначает стандартное отклонение выборки). Следовательно, каждый обязательно положительно-полуопределенная матрица. Более того, корреляционная матрица строго положительно определенный если никакая переменная не может иметь все ее значения, точно сгенерированные как линейная функция значений других.
Матрица корреляции симметрична, потому что корреляция между и
совпадает с корреляцией между
и
.
Матрица корреляции появляется, например, в одной формуле для коэффициент множественной детерминации, степень соответствия множественная регрессия.
В статистическое моделирование, матрицы корреляции, представляющие отношения между переменными, подразделяются на различные структуры корреляции, которые различаются такими факторами, как количество параметров, необходимых для их оценки. Например, в обмениваемый В матрице корреляции все пары переменных моделируются как имеющие одинаковую корреляцию, поэтому все недиагональные элементы матрицы равны друг другу. С другой стороны, авторегрессия Матрица часто используется, когда переменные представляют собой временной ряд, поскольку корреляции, вероятно, будут больше, когда измерения будут ближе по времени. Другие примеры включают независимый, неструктурированный, M-зависимый и Toeplitz.
Некоррелированность и независимость случайных процессов
Аналогично для двух случайных процессов и
: Если они независимы, то они некоррелированы.[15]:п. 151
Распространенные заблуждения
Корреляция и причинность
Общепринятое изречение, что «корреляция не подразумевает причинно-следственной связи «означает, что корреляция не может использоваться сама по себе для вывода причинно-следственной связи между переменными.[16] Это изречение не следует понимать как то, что корреляции не могут указывать на возможное существование причинно-следственных связей. Однако причины, лежащие в основе корреляции, если таковые имеются, могут быть косвенными и неизвестными, а высокая корреляция также перекрывается с идентичность связи (тавтологии ), где не существует причинного процесса. Следовательно, корреляция между двумя переменными не является достаточным условием для установления причинно-следственной связи (в любом направлении).
Корреляция между возрастом и ростом у детей довольно прозрачна с точки зрения причинно-следственной связи, но корреляция между настроением и здоровьем людей менее очевидна. Приводит ли улучшение настроения к улучшению здоровья, или хорошее здоровье приводит к хорошему настроению, или и то, и другое? Или в основе обоих лежит какой-то другой фактор? Другими словами, корреляция может рассматриваться как свидетельство возможной причинной связи, но не может указывать на то, какой может быть причинная связь, если таковая имеется.
Простые линейные корреляции
![]()
Четыре набора данных с одинаковой корреляцией 0,816
Коэффициент корреляции Пирсона указывает на силу линейный отношения между двумя переменными, но его значение, как правило, не полностью характеризует их взаимосвязь.[17] В частности, если условное среднее из данный
, обозначенный
, не является линейным по
коэффициент корреляции не будет полностью определять вид
.
На соседнем изображении показано точечные диаграммы из Квартет анскомба, набор из четырех разных пар переменных, созданных Фрэнсис Анскомб.[18] Четыре переменные имеют одинаковое среднее значение (7,5), дисперсию (4,12), корреляцию (0,816) и линию регрессии (у = 3 + 0.5Икс). Однако, как видно на графиках, распределение переменных сильно отличается. Первый (вверху слева), кажется, распределен нормально и соответствует тому, что можно было бы ожидать, рассматривая две коррелированные переменные и следуя предположению о нормальности. Второй (вверху справа) не распространяется нормально; хотя можно наблюдать очевидную связь между двумя переменными, она не является линейной. В этом случае коэффициент корреляции Пирсона не указывает на то, что существует точная функциональная связь: только степень, в которой эта связь может быть аппроксимирована линейной зависимостью. В третьем случае (внизу слева) линейная зависимость идеальна, за исключением одного выброс что оказывает достаточное влияние, чтобы понизить коэффициент корреляции с 1 до 0,816. Наконец, четвертый пример (внизу справа) показывает другой пример, когда одного выброса достаточно для получения высокого коэффициента корреляции, даже если связь между двумя переменными не является линейной.
Эти примеры показывают, что коэффициент корреляции, как сводная статистика, не может заменить визуальный анализ данных. Иногда говорят, что примеры демонстрируют, что корреляция Пирсона предполагает, что данные следуют нормальное распределение, но это неверно.[4]
Двумерное нормальное распределение
Если пара случайных величин следует двумерное нормальное распределение, условное среднее
является линейной функцией
, а условное среднее
является линейной функцией
. Коэффициент корреляции
между
и
, вместе с маргинальный средства и варианты
и
, определяет эту линейную зависимость:
где и
ожидаемые значения
и
соответственно и
и
стандартные отклонения
и
соответственно.
Смотрите также
- Автокорреляция
- Каноническая корреляция
- Коэффициент детерминации
- Коинтеграция
- Коэффициент корреляции согласованности
- Кофенетическая корреляция
- Корреляционная функция
- Корреляционный разрыв
- Ковариация
- Ковариация и корреляция
- Взаимная корреляция
- Экологическая корреляция
- Необъяснимая доля дисперсии
- Генетическая корреляция
- Лямбда Гудмана и Крускала
- Иллюзорная корреляция
- Межклассовая корреляция
- Внутриклассовая корреляция
- Лифт (интеллектуальный анализ данных)
- Средняя зависимость
- Задача изменяемой площади
- Множественная корреляция
- Коэффициент точечно-бисериальной корреляции
- Соотношение числа квадрантов
- Ложная корреляция
- Статистический арбитраж
- Субзависимость
использованная литература
- ^ Крокстон, Фредерик Эмори; Кауден, Дадли Джонстон; Кляйн, Сидней (1968) Прикладная общая статистика, Питман. ISBN 9780273403159 (стр. 625)
- ^ Дитрих, Корнелиус Франк (1991) Неопределенность, калибровка и вероятность: статистика научных и промышленных измерений 2-е издание, А. Хиглер. ISBN 9780750300605 (Стр. 331)
- ^ Эйткен, Александр Крейг (1957) Статистическая математика 8-е издание. Оливер и Бойд. ISBN 9780050013007 (Стр.95)
- ^ а б Rodgers, J. L .; Ничевандер, В. А. (1988). «Тринадцать способов взглянуть на коэффициент корреляции». Американский статистик. 42 (1): 59–66. Дои:10.1080/00031305.1988.10475524. JSTOR 2685263.
- ^ Дауди, С. и Уэрден, С. (1983). «Статистика для исследований», Wiley. ISBN 0-471-08602-9 230 стр.
- ^ Фрэнсис, Д.П .; Пальто AJ; Гибсон Д. (1999). «Насколько высоким может быть коэффициент корреляции?». Инт Дж Кардиол. 69 (2): 185–199. Дои:10.1016 / S0167-5273 (99) 00028-5.
- ^ а б Юл Г.У., Кендалл М.Г. (1950), «Введение в теорию статистики», 14-е издание (5-е впечатление, 1968 г.). Charles Griffin & Co., стр. 258–270.
- ^ Кендалл, М. Г. (1955) «Методы ранговой корреляции», Charles Griffin & Co.
- ^ Махдави Дамгани Б. (2013). «Не вводящая в заблуждение ценность предполагаемой корреляции: Введение в модель коинтелирования». Журнал Wilmott. 2013 (67): 50–61. Дои:10.1002 / wilm.10252.
- ^ Секели, Дж. Дж. Риццо; Бакиров, Н. К. (2007). «Измерение и проверка независимости путем корреляции расстояний». Анналы статистики. 35 (6): 2769–2794. arXiv:0803.4101. Дои:10.1214/009053607000000505.
- ^ Székely, G.J .; Риццо, М. Л. (2009). «Ковариация броуновского расстояния». Анналы прикладной статистики. 3 (4): 1233–1303. arXiv:1010.0297. Дои:10.1214 / 09-AOAS312. ЧВК 2889501. PMID 20574547.
- ^ Лопес-Пас Д., Хенниг П. и Шёлкопф Б. (2013). «Коэффициент рандомизированной зависимости», «Конференция по нейронным системам обработки информации » Переиздание
- ^ Торндайк, Роберт Лэдд (1947). Проблемы и методы исследования (Отчет № 3). Вашингтон, округ Колумбия: Правительство США. Распечатать. выкл.
- ^ Николич, Д; Муресан, RC; Фен, Вт; Певица, W (2012). «Масштабный корреляционный анализ: лучший способ вычисления кросс-коррелограммы». Европейский журнал нейробиологии. 35 (5): 1–21. Дои:10.1111 / j.1460-9568.2011.07987.x. PMID 22324876.
- ^ Парк, Кун Иль (2018). Основы вероятностных и случайных процессов с приложениями к коммуникациям. Springer. ISBN 978-3-319-68074-3.
- ^ Олдрич, Джон (1995). «Корреляции подлинного и ложного в Пирсоне и Йоле». Статистическая наука. 10 (4): 364–376. Дои:10.1214 / сс / 1177009870. JSTOR 2246135.
- ^ Махдави Дамгани, Бабак (2012). «Вводящее в заблуждение значение измеренной корреляции». Журнал Wilmott. 2012 (1): 64–73. Дои:10.1002 / wilm.10167.
- ^ Анскомб, Фрэнсис Дж. (1973). «Графики в статистическом анализе». Американский статистик. 27 (1): 17–21. Дои:10.2307/2682899. JSTOR 2682899.
дальнейшее чтение
- Cohen, J .; Cohen P .; West, S.G. & Айкен, Л. (2002). Прикладной множественный регрессионный / корреляционный анализ для поведенческих наук (3-е изд.). Психология Press. ISBN 978-0-8058-2223-6.
- «Корреляция (в статистике)», Энциклопедия математики, EMS Press, 2001 [1994]
- Острейхер, Дж. И Д. Р. (26 февраля 2015 г.). Plague of Equals: научный триллер о международных болезнях, политике и открытиях лекарств.. Калифорния: Omega Cat Press. п. 408. ISBN 978-0963175540.
внешние ссылки
- Страница MathWorld с коэффициентами (взаимной) корреляции выборки
- Вычислить значимость между двумя корреляциями, для сравнения двух значений корреляции.
- Набор инструментов MATLAB для вычисления взвешенных коэффициентов корреляции
- [1] Доказательство того, что выборка двумерной корреляции имеет пределы плюс-минус-1
- Интерактивное моделирование Flash на корреляции двух нормально распределенных переменных пользователя Juha Puranen.
- Корреляционный анализ. Биомедицинская статистика
- Р-Психолог Корреляция визуализация корреляции между двумя числовыми переменными
В зависимости от обстоятельств, при которых проводились измерения, а также в зависимости от целей измерения, выбирается та или иная классификация погрешностей. Иногда используют одновременно несколько взаимно пересекающихся классификаций, желая по нескольким признакам точно охарактеризовать влияющие на результат измерения физические величины. В таком случае рассматривают, например, инструментальную составляющую неисключённой систематической погрешности. При выборе классификаций важно учитывать наиболее весомые или динамично меняющиеся или поддающиеся регулировке влияющие величины. Ниже приведены общепринятые классификации согласно типовым признакам и влияющим величинам.
По виду представления, различают абсолютную, относительную и приведённую погрешности.
Абсолютная погрешность это разница между результатом измерения X и истинным значением Q измеряемой величины. Абсолютная погрешность находится как D = X — Q и выражается в единицах измеряемой величины.
Относительная погрешность это отношение абсолютной погрешности измерения к истинному значению измеряемой величины: d = D / Q = (X – Q) / Q .
Приведённая погрешность это относительная погрешность, в которой абсолютная погрешность средства измерения отнесена к условно принятому нормирующему значению QN , постоянному во всём диапазоне измерений или его части. Относительная и приведённая погрешности – безразмерные величины.
В зависимости от источника возникновения, различают субъективную, инструментальную и методическую погрешности.
Субъективная погрешность обусловлена погрешностью отсчёта оператором показаний средства измерения.
Инструментальная погрешность обусловлена несовершенством применяемого средства измерения. Иногда эту погрешность называют аппаратурной. Метрологические характеристики средств измерений нормируются согласно ГОСТ 8.009 – 84, при этом различают четыре составляющие инструментальной погрешности: основная, дополнительная, динамическая, интегральная. Согласно этой классификации, инструментальная погрешность зависит от условий и режима работы, а также от параметров сигнала и объекта измерения.
Методическая погрешность обусловлена следующими основными причинами:
– отличие принятой модели объекта измерения от модели, адекватно описывающей его метрологические свойства;
– влияние средства измерения на объект измерения;
– неточность применяемых при вычислениях физических констант и математических соотношений.
В зависимости от измеряемой величины, различают погрешность аддитивную и мультипликативную. Аддитивная погрешность не зависит от измеряемой величины. Мультипликативная погрешность меняется пропорционально измеряемой величине.
В зависимости от режима работы средства измерений, различают статическую и динамическую погрешности.
Динамическая погрешность обусловлена реакцией средства измерения на изменение параметров измеряемого сигнала (динамический режим).
Статическая погрешность средства измерения определяется при параметрах измеряемого сигнала, принимаемых за неизменные на протяжении времени измерения (статический режим).
По характеру проявления во времени, различают случайную и систематическую погрешности.
Систематической погрешностью измерения называют погрешность, которая при повторных измерениях одной и той же величины в одних и тех же условиях остаётся постоянной или закономерно меняется.
Случайной погрешностью измерения называют погрешность, которая при повторных измерениях одной и той же величины в одних и тех же условиях изменяется случайным образом.