-
Ошибки при проверке гипотез
Принятие
решения на основе статистического
критерия носит случайный характер,
поэтому не исключены ошибки. Возможны
следующие ситуации.
1.
Гипотеза
![]()
верна, и она не отвергается.
Все в порядке: наше решение отражает
истинное положение.
2.
Гипотеза
![]()
верна, но она
отвергается.
В этом случае говорят, что допущена
ошибка I
рода. Поскольку
нулевая гипотеза верна, статистика Z
действительно имеет то распределение,
на основании которого принималось
решение. Тем не менее выборочное значение
статистики попало в критическую область.
Вероятность этого события по определению
равна уровню значимости
.
Вероятность
ошибки I
рода равна уровню значимости критерия.
Но
уровень значимости задается произвольно.
Поэтому в нашей власти снизить вероятность
ошибки I
рода до сколь угодно низкого уровня.
3.
Гипотеза
![]()
неверна, и она отвергается.
Снова все в порядке: отвергнута неверная
гипотеза.
4.
Гипотеза
![]()
неверна, но она не отвергается.
Тогда говорят, что допущена ошибка
II
рода. В этой
ситуации выборочное значение попало в
область принятия решения, тогда как
гипотеза
![]()
на самом деле неверна. Если распределение
статистики Z
известно и в предположении, что верна
альтернативная гипотеза
,
то можно посчитать вероятность ошибки
II
рода: это условная вероятность того,
что Z
попадает в область
![]()
при условии, что верна гипотеза
.
Вероятность ошибки II
рода обычно обозначают через
![]()
.
В
большинстве случаев нельзя добиться
минимального значения вероятностей
![]()
и
![]()
одновременно.
Поступают обычно следующим образом:
вероятность
![]()
ошибки I
рода фиксируется, а затем добиваются
минимума вероятности
![]()
ошибки II
рода. За счет чего можно уменьшить
![]()
при фиксированном значении
?
Только за счет выбора критической
области: при заданной альтернативе
![]()
критическую область выбирают таким
образом, чтобы значение
![]()
(вероятность принять неверную гипотезу)
было наименьшим из возможных. В этом
случае вероятность отвергнуть неверную
гипотезу
![]()
максимальна. Это число называют мощностью
критерия.
Таким образом, задача состоит в построении
наиболее
мощного критерия
при заданном уровне значимости.
-
Проверка гипотезы о функции распределения.
Пусть
![]()
— выборка
наблюдений некоторой случайной величины
.
Гипотеза:
:
генеральная совокупность имеет функцию
распределения F(x)
против альтернативы,
что функция распределения не такова.
За
меру расхождения примем величину
![]()
Теорема
(Пирсона).
Пусть
т параметров
функции распределения
оцениваются по выборке. Тогда при
распределение меры расхождения
стремится к распределению
с
степенями свободы
.
-
Однофакторный дисперсионный анализ
Пусть
результаты наблюдений составляют k
независимых выборок (групп), полученных
из k
нормально распределенных генеральных
совокупностей, которые имеют, вообще
говоря, различные средние
.
Каждая группа содержит
значений,
.
Общее число наблюдений равно
:
![]()
Проверяется
гипотеза о равенстве средних во всех k
выборках:
![]()
Нулевая
гипотеза является сложной: предполагается
лишь, что математические ожидания
совпадают, о конкретном значении ничего
не известно. Альтернативная гипотеза
состоит в том, что хотя бы две выборки
имеют различные средние.
Обозначим
через
![]()
-й
элемент j-й выборки,![]()
.
Групповое
среднее
:
![]()
Общее среднее
![]()
Основное тождество
дисперсионного анализа
![]()
Общая
сумма квадратов отклонений от среднего
есть сумма квадратов между группами
плюс сумма квадратов внутри групп.
![]()
.
,
![]()
Теорема
Если нулевая
гипотеза верна, то случайные величины
,
имеют распределение
соответственно с![]()
и
степенями свободы.
Если
нулевая гипотеза верна, то случайная
величина
распределена по закону Фишера с
,
степенями свободы.
Распределение
Фишера строится на основе распределения
:
![]()
При
заданном уровне значимости а
критическая область находится на правом
хвосте распределения
![]()
Фишера, то
есть правее квантили порядка
![]()
Фактор,
в соответствии с которым сгруппированы
данные, можно признать статистически
значимым, если выборочное значение
статистики F удовлетворяет неравенству
.
В
этом случае гипотеза о равенстве
математических ожиданий не подтверждается
экспериментальными данными.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
- #
- #
- #
- #
- #
- #
- #
- #
- #
- #
- #
Ошибки I и II рода при проверке гипотез, мощность
Общий обзор
Принятие неправильного решения
Мощность и связанные факторы
Проверка множественных гипотез
Общий обзор
Большинство проверяемых гипотез сравнивают между собой группы объектов, которые испытывают влияние различных факторов.
Например, можно сравнить эффективность двух видов лечения, чтобы сократить 5-летнюю смертность от рака молочной железы. Для данного исхода (например, смерть) сравнение, представляющее интерес (например, различные показатели смертности через 5 лет), называют эффектом или, если уместно, эффектом лечения.
Нулевую гипотезу выражают как отсутствие эффекта (например 5-летняя смертность от рака молочной железы одинаковая в двух группах, получающих разное лечение); двусторонняя альтернативная гипотеза будет означать, что различие эффектов не равно нулю.
Критериальная проверка гипотезы дает возможность определить, достаточно ли аргументов, чтобы отвергнуть нулевую гипотезу. Можно принять только одно из двух решений:
- отвергнуть нулевую гипотезу и принять альтернативную гипотезу
- остаться в рамках нулевой гипотезы
Важно: В литературе достаточно часто встречается понятие «принять нулевую гипотезу». Хотелось бы внести ясность, что со статистической точки зрения принять нулевую гипотезу невозможно, т.к. нулевая гипотеза представляет собой достаточно строгое утверждение (например, средние значения в сравниваемых группах равны
).
Поэтому фразу о принятии нулевой гипотезы следует понимать как то, что мы просто остаемся в рамках гипотезы.
Принятие неправильного решения
Возможно неправильное решение, когда отвергают/не отвергают нулевую гипотезу, потому что есть только выборочная информация.
| |
Верная гипотеза | ||
|---|---|---|---|
| H0 | H1 | ||
| Результат применения критерия |
H0 | H0 верно принята | H0 неверно принята (Ошибка второго рода) |
| H1 | H0 неверно отвергнута (Ошибка первого рода) |
H0 верно отвергнута |
Ошибка 1-го рода: нулевую гипотезу отвергают, когда она истинна, и делают вывод, что имеется эффект, когда в действительности его нет. Максимальный шанс (вероятность) допустить ошибку 1-го рода обозначается α (альфа). Это уровень значимости критерия; нулевую гипотезу отвергают, если наше значение p ниже уровня значимости, т. е., если p < α.
Следует принять решение относительно значения а прежде, чем будут собраны данные; обычно назначают условное значение 0,05, хотя можно выбрать более ограничивающее значение, например 0,01.
Шанс допустить ошибку 1-го рода никогда не превысит выбранного уровня значимости, скажем α = 0,05, так как нулевую гипотезу отвергают только тогда, когда p< 0,05. Если обнаружено, что p > 0,05, то нулевую гипотезу не отвергнут и, следовательно, не допустят ошибки 1-го рода.
Ошибка 2-го рода: не отвергают нулевую гипотезу, когда она ложна, и делают вывод, что нет эффекта, тогда как в действительности он существует. Шанс возникновения ошибки 2-го рода обозначается β (бета); а величина (1-β) называется мощностью критерия.
Следовательно, мощность — это вероятность отклонения нулевой гипотезы, когда она ложна, т.е. это шанс (обычно выраженный в процентах) обнаружить реальный эффект лечения в выборке данного объема как статистически значимый.
В идеале хотелось бы, чтобы мощность критерия составляла 100%; однако это невозможно, так как всегда остается шанс, хотя и незначительный, допустить ошибку 2-го рода.
К счастью, известно, какие факторы влияют на мощность и, таким образом, можно контролировать мощность критерия, рассматривая их.
Мощность и связанные факторы
Планируя исследование, необходимо знать мощность предложенного критерия. Очевидно, можно начинать исследование, если есть «хороший» шанс обнаружить уместный эффект, если таковой существует (под «хорошим» мы подразумеваем, что мощность должна быть по крайней мере 70-80%).
Этически безответственно начинать исследование, у которого, скажем, только 40% вероятности обнаружить реальный эффект лечения; это бесполезная трата времени и денежных средств.
Ряд факторов имеют прямое отношение к мощности критерия.
Объем выборки: мощность критерия увеличивается по мере увеличения объема выборки. Это означает, что у большей выборки больше возможностей, чем у незначительной, обнаружить важный эффект, если он существует.
Когда объем выборки небольшой, у критерия может быть недостаточно мощности, чтобы обнаружить отдельный эффект. Эти методы также можно использовать для оценки мощности критерия для точно установленного объема выборки.
Вариабельность наблюдений: мощность увеличивается по мере того, как вариабельность наблюдений уменьшается.
Интересующий исследователя эффект: мощность критерия больше для более высоких эффектов. Критерий проверки гипотез имеет больше шансов обнаружить значительный реальный эффект, чем незначительный.
Уровень значимости: мощность будет больше, если уровень значимости выше (это эквивалентно увеличению допущения ошибки 1-го рода, α, а допущение ошибки 2-го рода, β, уменьшается).
Таким образом, вероятнее всего, исследователь обнаружит реальный эффект, если на стадии планирования решит, что будет рассматривать значение р как значимое, если оно скорее будет меньше 0,05, чем меньше 0,01.
Обратите внимание, что проверка ДИ для интересующего эффекта указывает на то, была ли мощность адекватной. Большой доверительный интервал следует из небольшой выборки и/или набора данных с существенной вариабельностью и указывает на недостаточную мощность.
Проверка множественных гипотез
Часто нужно выполнить критериальную проверку значимости множественных гипотез на наборе данных с многими переменными или существует более двух видов лечения.
Ошибка 1-го рода драматически увеличивается по мере увеличения числа сравнений, что приводит к ложным выводам относительно гипотез. Следовательно, следует проверить только небольшое число гипотез, выбранных для достижения первоначальной цели исследования и точно установленных априорно.
Можно использовать какую-нибудь форму апостериорного уточнения значения р, принимая во внимание число выполненных проверок гипотез.
Например, при подходе Бонферрони (его часто считают довольно консервативным) умножают каждое значение р на число выполненных проверок; тогда любые решения относительно значимости будут основываться на этом уточненном значении р.
Связанные определения:
p-уровень
Альтернативная гипотеза, альтернатива
Альфа-уровень
Бета-уровень
Гипотеза
Двусторонний критерий
Критерий для проверки гипотезы
Критическая область проверки гипотезы
Мощность
Мощность исследования
Мощность статистического критерия
Нулевая гипотеза
Односторонний критерий
Ошибка I рода
Ошибка II рода
Статистика критерия
Эквивалентные статистические критерии
В начало
Содержание портала
План:
1. Статистические гипотезы. Основные понятия.
2. Гипотезы о законе распределения.
3. Гипотезы о числовом значении генерального
среднего и дисперсии.
1.
Статистические гипотезы. Основные понятия.
Статистическая гипотеза— это утверждение о виде неизвестного
распределения или параметрах известного распределения. Статистические гипотезы
проверяются по результатам выборки статистическими методами в ходе эксперимента
(эмпирическим путем) с помощью статистических критериев.
В тех случаях, когда
известен закон, но неизвестны значения его параметров (дисперсия или
математическое ожидание) в конкретной ситуации, статистическую гипотезу
называют параметрической.
Например, предположение
об ожидаемом среднем доходе по акциям или разбросе дохода являются
параметрическими гипотезами.
Когда закон
распределения генеральной совокупности не известен, но есть основания
предположить, каков его конкретный вид, выдвигаемые гипотезы о виде его
распределения называются непараметрическими.
Например, можно
выдвинуть гипотезу, что число дневных продаж в магазине или доход населения
подчинены нормальному закону распределения.
По содержанию статистические гипотезы можно классифицировать:
1.
Гипотезы о типе вероятностного закона
распределения случайной величины, характеризующего явление или процесс.
2.
Гипотезы об однородности двух или более
обрабатываемых выборок. Изучаемое свойство исследуется с помощью двух или более генеральных
совокупностей. Гипотеза в этом случае может заключаться в следующем: исследуемые
выборочные характеристики различаются между собой статистически значимо или
нет.
3.
Гипотезы о свойствах числовых значений
параметров исследуемой генеральной совокупности. Больше ли значения параметров
некоторого заданного номинала или меньше и т.д.
4.
Гипотезы о вероятностной зависимости двух
или более признаков, характеризующих различные свойства рассматриваемого
явления или процесса. При этом определяется характер этой зависимости.
Гипотезы бывают простые (содержащие одно предположение) и сложные (содержащие несколько предположений).
Выдвинутую гипотезу называют основной или нулевой и обозначают H0
. Противоречащую ей гипотезу называют альтернативной или конкурирующей и обозначают
H1.
Под статистическим
критерием понимают однозначно определенное правило, устанавливающее
условие, при котором проверяемая гипотеза отвергается либо не отвергается.
Пример:
Увеличение числа заболевших некоторым
заболеванием дает возможность выдвинуть гипотезу о наличии эпидемии. Для сравнения
доли заболевших в обычных и экстремальных условиях используются статистические
данные, на основании которых делается вывод о том, является ли данное массовое
заболевание эпидемией. Предполагается, что существует некоторый критерий-
уровень доли заболевших, критический для этого заболевания, который
устанавливается по ранее имевшимся случаям.
Различают три вида критериев:
1.
Параметрические критерии—
критерии значимости, которые служат для проверки гипотез о параметрах
распределения генеральной совокупности при известном виде распределения.
2.
Критерии согласия—
позволяют проверить гипотезы о соответствии распределений генеральной
совокупности известной теоретической модели.
3.
Непараметрические критерии—
используются в гипотезах, когда не требуется знаний о конкретном виде
распределения.
Проверка
параметрических гипотез проводится на основе критериев значимости., а
непараметрических- критериев согласия.
Задача проверки
статистических гипотез сводится к исследованию генеральной совокупности по
выборке. Множество возможных значений элементов выборки может быть разделено на
два непересекающихся подмножества- критическую область и область принятия
гипотезы.
Областью принятия гипотезы или областью допустимых значений Iдоп
называют совокупность значений критерия,
при которых эту гипотезу принимают.
Критической областью
Iкр называют множество значений критерия, при
котором гипотезу отвергают.
Наблюдаемые значения критерия (статистика)
Kнабл
называют такое значение критерия, которое
находится по данным выборки.
Границы критической области, отделяющие ее от
области принятия гипотезы, называют критическими точками и обозначают
Kкр.
Для определения
критической области задается уровень значимости
—
некая малая вероятность попадания критерия в критическую область.
Уровень значимости— вероятность принятия
конкурирующей гипотезы, тогда как справедлива основная.
С помощью уровня
значимости определяются границы критической области.
Основной принцип проверки статистических гипотез
состоит в следующем: если наблюдаемое значение статистики критерия попадает (не
попадает) в критическую область, то гипотеза H0
отвергается (принимается), а гипотеза H1
принимается (отвергается) в качестве одного из
возможных решений с формулировкой «гипотеза
H0 противоречит (не противоречит) выборочным
данным на уровне значимости
».
В зависимости от
содержания альтернативной гипотезы осуществляется выбор критической области:
левосторонней, правосторонней, двусторонней. Если смысл исследования заключается
в доказательстве конкретного изменения наблюдаемого параметра (его уменьшения
или увеличения), то говорят об односторонней критической области. Если смысл
исследования- выявить различия в изучаемых параметрах, но характер их
отклонения от контрольных (или теоретических) не известен, то говорят о
двусторонней критической области.
Однако, принятие той
или иной гипотезы не дает оснований утверждать, что она верна. Результат
проверки статистической гипотезы лишь устанавливают на определенном уровне
значимости ее соответствие (несоответствие) результатам эксперимента.
При проверке
статистических гипотез возможны следующие ошибки:
1.
Отвергнута правильная
H0, а принята неправильная гипотеза
H1 — ошибка
первого рода.
2. Отвергнута правильная альтернативная
гипотеза
H1 и
принята неправильная нулевая гипотеза H0
—
ошибка второго рода.
Заметим, что уровень значимости —
есть вероятность ошибки первого рода. Ошибка первого рода называется
-риском. Обычно они задаются
некоторыми конкретными значениями: 0,05; 0,01; 0,005; 0,001. Ошибки второго
рода называются -риском, а вероятность ее
допустить обозначается
(вероятность того, что принята гипотеза
H0
, когда на самом деле справедлива
альтернативная гипотеза H1
.
Можно доказать, что с
уменьшением ошибок первого рода одновременно увеличиваются ошибки второго рода
и наоборот. Поэтому, на практике пытаются подбирать значения параметров
и
опытным путем в целях минимизации суммарного
эффекта от возможных ошибок. При принятии управленческих решений для
одновременного уменьшения ошибок первого и второго рода самым действенным
средством является увеличение объема выборки, что согласуется с законом больших
чисел.
На бытовом уровне
ошибки второго рода могут иметь более трагические последствия, чем ошибки
первого рода.
2. Гипотеза о законе распределения. Критерий согласия Пирсона (
X2
-критерий).
Критериями согласия называют критерии, в
которых гипотеза определяет закон распределения либо полностью, либо с
точностью до небольшого числа параметров.
Причины расхождения
результатов эксперимента и теоретических характеристик могут быть вызваны малым
объемом выборки, неудачным способом группировки наблюдений, ошибками в
выборе гипотезы о виде распределения
генеральной совокупности и др.
Рассмотрим
универсальный критерий согласия Пирсона. Проверка гипотезы о том, что
эмпирическая частота мало отличается от соответствующей теоретической частоты,
осуществляется с помощью величины X2
—
меры расхождения между ними.
Для произвольной
выборки, когда распределение непрерывно или число различных вариант велико, все
пространство наблюдаемых вариант делят на конечное число непересекающихся
областей, в каждой из которых подсчитывают наблюдаемую частоту и теоретическую
вероятность.
Для применения критерия
согласия Пирсона необходимо:
1. Вычислить значение статистики по формуле:
, где
pi –вероятность
принятия значения
xi, ni.
— эмпирическая частота для
соответствующего
xi. n— объем выборки. s— число вариант выборки.
2.
По
соответствующей таблице распределения Пирсона найти критическое значение , где k = s –
r
– 1 – число степеней свободы, s—
число различных вариант или интервалов группировки, r— число неизвестных параметров
предполагаемого теоретического распределения,
— выбранный уровень значимости. Это
значит, что строится правосторонний интервал.
3.
Если
,
то основная гипотеза отвергается, в противном случае- принимается, т.е. чем
больше отклонение, тем меньше согласованы теоретическое и эмпирическое
распределение. Поэтому принято использовать только правостороннюю критическую
область.
Расчетная таблица имеет вид:
|
Интервалы |
Середины |
Эмпирические |
Вероятности pi |
Теоретические |
|
|
Пример:
По таблице
эмпирического распределения изменения в процентах темпа роста акций проверьте
гипотезу о нормальном распределении выборки.
|
Интервалы |
(-2; |
(-1; |
(0; |
(1; |
Итого |
|
ni |
7 |
14 |
18 |
11 |
50 |
|
pi |
0,157 |
0,341 |
0,341 |
0,157 |
1 |
Решение:
Гипотезу о нормальном
распределении проверим по критерию Пирсона.
|
Интервалы |
Эмпирические |
Вероятности pi |
Теоретические |
|
|
|
(-2; |
7 |
0,157 |
7,85 |
0,7225 |
0,092 |
|
(-1; |
14 |
0,341 |
17,05 |
9,3025 |
0,546 |
|
(0; |
18 |
0,341 |
17,05 |
0,9025 |
0,053 |
|
(1; |
11 |
0,157 |
7,85 |
9,925 |
1,264 |
|
Итого |
|
По таблице найдем
при
=0,05
и k = s – r – 1 = 4 – 2 – 1 = 1. s = 4 – число
интервалов. r
= 2- число параметров теоретического (нормального) распределения.
Имеем . Т.к. 1,955 < 3,841, то
, т.е. гипотеза о нормальном
распределении подтверждается.
3. Гипотезы о числовом значении генерального
среднего и дисперсии.
Установление двусторонней критической
области на уровне значимости
для
проверки гипотезы соответствует отысканию соответствующего доверительного
интервала с надежностью
.
Рассмотрим условия применения некоторых
статистических гипотез.
|
Тип гипотезы H0 |
Границы критической области на уровне значимости |
Статистика наблюдений |
|
О числовом значении |
|
|
|
О числовом значении |
Распределение |
|
|
О числовом значении |
Распределение Пирсона |
|
Пример:
Результаты исследований в течение 35 лет
показали, что среднее изменение доходности векселей равно 5,5 %. Полагая, что
изменение доходности подчиняется нормальному закону распределения с
среднеквадратическим отклонением равным 2 %, на уровне значимости
, решите: можно ли принять 6 % в качестве нормативного процента
(математического ожидания) изменения доходности.
Решение:
По условию задачи
нулевая гипотеза
. Так как
, то в качестве альтернативной гипотезы
возьмем гипотезу:
, которой соответствует левосторонняя
критическая область с интервалом.
Найдем границы
критической области:
По таблице значений
функции Ф(х) найдем
, т.е. левосторонняя критическая область
лежит в интервале.
Найдем статистику
наблюдений:
.
Имеем:, нет основания отвергать нулевую
гипотезу. Значит, в качестве нормативного процента можно принять 6 %.
Пример:
Точность работы
программы проверяют по дисперсии контролируемого количества символов в коде,
которая не должна превышать 0,1. По выборке из 15 сообщений вычислена
исправленная оценка дисперсии 0,22. При
уровне значимости 0,05 проверьте, обеспечивает ли программа необходимую
точность.
Решение:
Имеем: n = 15, s2 = 0,22
, ,
.
Сформулируем гипотезу о
числовом значении дисперсии:
H0 — программа обеспечивает необходимую точность
;
H1 —
программа не обеспечивает необходимую точность
.
Определим статистику: .
Найдем границы
критической области:
.
Поскольку 30,8 >
23,7;
, принимаем гипотезу H1, т.к.
H0 противоречит опытным данным. Вывод: программа
не обеспечивает необходимую точность.