211. Оценивают степень изменчивости вариант, являясь одной из характеристик их группировки, меры
• рассеяния
212. Очень слабая корреляция определяется при коэффициенте корреляции ниже
• 0,2
213. Ошибка отвержения истинной гипотезы — это ошибка …
• первого рода
214. Ошибка принятия ложной гипотезы — это ошибка …
• второго рода
215. Параметрический критерий оценки различия распределений, используемый при многомерном статистическом анализе выборок и представляющий собой отношение дисперсий, в котором большее по величине значение должно стоять в числителе, — это критерий …
• Фишера
216. Параметрический критерий оценки различия распределений, приближающийся к нормальному с увеличением числа измерений, — это критерий …
• Стьюдента
217. Первый шаг теории интервального оценивания — это:
• найти выборочное распределение
218. Первый этап кластерного анализа — это:
• отбор выборки для кластеризации
219. Первый этап проверки статистической гипотезы — это:
• формулировка проверяемой нуль-гипотезы
220. Переменная, которую мы хотим оценить, — это переменная …
• зависимая
221. Переменная, представляющая собой результаты измерений, которые варьируются, — это:
• варианта
222. Переменная, принимающая на бесконечно малом интервале бесконечно большое число значений, — это переменная …
• непрерывная
223. По исходным представлениям о числе общих факторов выделяют анализ:
• двухфакторный
• многофакторный
• однофакторный
224. Поворот ортогональной системы координат относительно неизменного начала отсчета на некоторый угол — это математический смысл …
• ротации
225. Позволяет выражать учитываемые факторы не только абсолютными единицами измерения, но и в относительных или условных единицах анализ
• дисперсионный
Процедура проверки нулевой гипотезы в
общем случае включает следующие этапы:
1. задается допустимая вероятность
ошибки первого рода (Ркр=0,05)или 5 %
2. выбирается статистика критерия (Т)
3. ищется область допустимых значений
Ткрит.-опред по статис. таблицу
4. по исходным данным вычисляется
значение статистики Т эмп.
5. если Т эмп(статистика критерия)
принадлежит области принятия нулевой
гипотезы( Тэмп<Ткрит), то нулевая
гипотеза принимается. Т О делается
заключение, что исходные данные не
противоречат нулевой гипотезе), а в
противном случае нулевая гипотеза
отвергается и принимается альтернативная
гипотеза. Это основной принцип проверки
всех статистических гипотез.
В современных статистических пакетах
используются не стандартные уровни, а
уровни значимости, подсчитываемые в
процессе работы с соответствующим
статистическим методом.
При проверке статистических гипотез с
помощью статистических пакетов, программа
выводит на экран вычисленное значение
уровня значимости Р и подсказку о
возможности принятия или неприятия
нулевой гипотезы.
Рассчитанный и показанный уровень на
экране необходимо сравнить с допустимой
вероятностью ошибки первого рода. Чем
меньше вычисл. значение тем более
исходные данные противоречат нулевой
гипотезе.
(если вычисленное значение Р превосходит
выбранный уровень Ркр,
то принимается нулевая гипотеза, а в
противном случае — альтернативная
гипотеза).
Число степеней свободы(К) – число
свободно варьируемых наблюдений после
опред интересующего параметра.(из книги
-число опытов, по которым рассчитан
данный параметр, минус количество
одинаковых значений, найденных по этим
опытам независимо друг от друга.)
Мощность критерия (Ф) – вероятность
отклонения неверной нулевой гипотезы,
т.е. вероятность попадания критерия в
критическую область (вероятность
правильного решения).
Чем больше Ф, тем вероятность ошибки
2-го рода меньше, т.е Ф хар-ет его способность
избежать ошибки 2 рода.
=ошибка первого рода- можно отвергнуть
нулевую гипотезу, когда она на самом
деле верна.
=ошибка второго рода -можно принять
нулевую гипотезу, когда она на самом
деле не верна.
Если Р больше 0,1-принимается Но
Р ≤0,1 – сомнения в истинности Но,неопред-ть.
Р ≤0,05 – значимость,отклон. Но
Р≤0,01 – высокая значимость, отклонение
Но.
18.Уровень значимости, репрезентативность. Примеры.
Уровень значимости – это вероятность
ошибки первого рода при принятии решения
(вероятность ошибочного отклонения
нулевой гипотезы).
Альтернативные гипотезы принимаются
тогда и только тогда, когда опровергается
нулевая гипотеза. Это бывает в случаях,
когда различия, скажем, в средних
арифметических экспериментальной и
контрольной групп настолько значимы
(статистически достоверны), что риск
ошибки отвергнуть нулевую гипотезу и
принять альтернативную не превышает
одного из трех принятых уровней значимости
статистического вывода:
=первый уровень — 5% (р=5%); где допускается
риск ошибки в выводе в пяти случаях из
ста теоретически возможных таких же
экспериментов при строго случайном
отборе испытуемых для каждого эксперимента;
=второй уровень — 1%, т. е. соответственно
допускается риск ошибиться только в
одном случае из ста;
=третий уровень — 0,1%, т. е. допускается
риск ошибиться только в одном случае
из тысячи.
Последний уровень значимости предъявляет
очень высокие требования к обоснованию
достоверности результатов эксперимента
и потому редко используется. В
педагогических исследованиях, не
нуждающихся в очень высоком уровне
достоверности, представляется разумным
принять 5% уровень значимости.
При проверке статистических гипотез
возможны ошибки (ошибочные суждения)
двух видов:
=ошибка первого рода- можно отвергнуть
нулевую гипотезу, когда она на самом
деле верна.
=ошибка второго рода -можно принять
нулевую гипотезу, когда она на самом
деле не верна.
Ошибка, состоящая в принятии нулевой
гипотезы, когда она ложна, качественно
отличается от ошибки, состоящей в
отвержении гипотезы, когда она истинна.
Эта разница очень существенна вследствие
того, что различна значимость этих
ошибок.
Пример 1. В результате, прежде чем
выпускать в продажу вновь произведенную
партию лекарства, ее подвергают
исследованию на токсичность биологическими
методами. Малые дозы лекарства вводятся
некоторому количеству подопытных
животных, например, мышей, и результат
регистрируют. Если лекарство токсично,
то все или почти все животные гибнут. В
противном случае норма выживших велика.
Исследование лекарства может привести
к одному из возможных способов действия:
выпустить партию в продажу (а1), вернуть
партию поставщику для доработки или,
может быть, для уничтожения (а2).
Сначала рассмотрим случай, когда
применяется действие а1, в то время когда
предпочтительнее а2. Лекарство опасно
для пациента, в то время как оно признано
безопасным. Ошибка этого вида может
вызвать смерть пациентов, употребляющих
этот препарат. Это ошибка первого рода,
так как нам важнее ее избежать.
Однако случайное отвержение совершенно
безопасного лекарства, очевидно, менее
нежелательно, чем, пусть даже изредка
происходящие гибели пациентов. Отвержение
нетоксичной партии лекарства – ошибка
второго рода.
На всяк случай.
Если Р больше 0,1-принимается Но
Р ≤0,1 – сомнения в истинности Но,неопред-ть.
Р ≤0,05 – значимость,отклон. Но
Р≤0,01 – высокая значимость, отклонение
Но.
Одной из основных задач статистического
анализа является получение по имеющейся
выборке достоверных сведений о
интересующих исследователя характеристиках
генеральной совокупности. Поэтому
важным требованием к выборке является
ее репрезентативность, то есть правильная
представимость в ней пропорций генеральной
совокупности.
Репрезентативность выборки- свойство
выборки представлять изучаемые явления
достаточно полно с точки зрения
изменчивости генерал совокупности.
Достижению репрезентативности может
способствовать такая организация
эксперимента, при которой элементы
выборки извлекаются из генеральной
совокупности случайным образом.В силу
закона больших чисел можно утверждать,
что выборка будет репрезентативной,
если ее осуществить случайно: каждый
объект выборки отобран случайно из
генеральной совокупности, если все
объекты имеют одинаковую вероятность
попасть в выборку.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
- #
- #
- #
- #
- #
- #
- #
- #
- #
- #
- #
Внимание! zachteno.net не продает дипломы, аттестаты об образовании и иные документы об образовании. Все услуги на сайте предоставляются исключительно в рамках законодательства РФ.

Ответы к тесту по математическим методам в психологии
Вопрос 1. Извлечение выборки из совокупности и проведение наблюдения происходят на __________________ этапе исследования.
- Ответ: втором
Вопрос 2. В случае, когда обе переменные дихотомические, основанные на нормальных распределениях, используется коэффициент корреляции:
- Ответ: rtet — тетрахорический
Вопрос 3. Доля каждой частоты fi в общем объеме выборки N — это:
- Ответ: частость
Вопрос 4. R =1 — r — это формула коэффициента …
- Ответ: некорреляции
Вопрос 5. Значение статистики для выборки, которая содержит информацию о параметре совокупности, называется:
- Ответ: оценкой
Вопрос 6. Свойство оценок, относящееся к точности оценки параметра и имеющее отношение к изменчивости оценки от выборки к выборке, называется:
- Ответ: эффективностью
Вопрос 7. В факторном анализе рассматривают латентные структуры, имеющие в своем составе только факторы:
- Ответ: общие и специфические
Вопрос 8. Если регрессия есть возрастающая функция своего аргумента (а > 0), то направление считают положительным. Если регрессия есть убывающая функция своего аргумента (а
- Ответ: направление
Вопрос 9. При количестве наблюдений n- Ответ: регрессии
Вопрос 10. Мера связи, когда одна переменная измеряется дихотомически, на основе нормального распределения, а другая в шкале интервалов или отношений — это коэффициент корреляции …- Ответ: Бисериальный
Вопрос 11. Четвертый этап кластерного анализа — это:
- Ответ: проверка достоверности результатов кластерного анализа
Вопрос 12. Параметрический критерий оценки различия распределений, приближающийся к нормальному с увеличением числа измерений, — это критерий …
- Ответ: Стьюдента
Вопрос 13. Вид измерения, которое основано на оценке внутри индивидуальных соотношений и не связано с диагностикой межиндивидуальных различий, называется измерением
- Ответ: ипсативным
Вопрос 14. Если обе переменные измеряются в шкалах порядка, то берется коэффициент ранговой корреляции
- Ответ: rs — Спирмена
Вопрос 15. Принимает всегда конечное множество целочисленных значений на заданном интервале возможных значений случайная величина
- Ответ: дискретная
Вопрос 16. При постоянном увеличении объема выборки оценка, приближающаяся к значению параметра, который она оценивает, называется:
- Ответ: состоятельной
Вопрос 17. Линия, отображающая зависимость каждого статистического признака от средней величины другого статистического признака, называется линией
- Ответ: регрессии
Вопрос 18. Мультифакторный анализ разработан
- Ответ: Терстоуном
Вопрос 19. Ошибка принятия ложной гипотезы — это ошибка …
- Ответ: второго рода
Вопрос 20. Понятия состоятельности и относительной эффективности ввел в науку
- Ответ: Фишер
Вопрос 21. Служит единственно возможной мерой положения для существенно дискретной случайной величины
- Ответ: мода
Вопрос 22. В результате тестирования в группе были получены следующие результаты: 25, 23, 26, 28, 27, 25, 26, 25, 25. Медиана для данной выборки будет:
- Ответ: 5
Вопрос 23. Отличие двух сравниваемых параметров, которое статистически доказано, — это отличие …
- Ответ: достоверное
Вопрос 24. Средняя корреляция определяется при коэффициенте корреляции
- Ответ: 0,5-0,69
Вопрос 25. Ширина доверительного интервала выражается с помощью вполне определенного распределения вероятностей, называемого распределением
- Ответ: Стьюдента
Вопрос 26. Предполагаемое объяснение связи признаков и возможностей ее практического использования называется:
- Ответ: качественным анализом
Вопрос 27. По исходным представлениям о числе общих факторов выделяют анализ:
- Ответ: многофакторный
Вопрос 28. Связи между случайными явлениями вообще называются:
- Ответ: вероятностными связями
Вопрос 29. Некоторая функция от значений в выборке, дающая величину, называемую оценкой, — это понятие …
- Ответ: оценивателя
Вопрос 30. Область теории оценивания параметров, где в качестве оценки параметра рассматривается одно значение или число, — это оценивание …
- Ответ: точечное
Вопрос 31. Ошибка отвержения истинной гипотезы — это ошибка …
- Ответ: первого рода
Вопрос 32. Факторная (латентная) структура может быть представлена в виде
- Ответ: матрицы факторных зарядов
Вопрос 33. Математическая процедура многомерного анализа нахождения «расстояния» (меры различия) между объектами по всей совокупности параметров и изображения их отношений графически — это анализ …
- Ответ: кластерный
Вопрос 34. Основной функцией методов многомерного анализа является:
- Ответ: выявление латентной структуры психологического явления
Вопрос 35. Если одна переменная измеряется в дихотомической шкале наименований, а другая — в шкале интервалов или отношений, то используется коэффициент корреляции
- Ответ: бисериальный
Вопрос 36. Отношение разности значения Х и среднего значения к стандартному отклонению — это понятие …
- Ответ: единичного нормального отклонения
Вопрос 37. Тесная (сильная) корреляция определяется при коэффициенте корреляции порядка
- Ответ: не ниже 0,7
Вопрос 38. График в форме последовательности точек, обозначающих середины своего разрядного интервала и соединенных отрезками прямых, — это:
- Ответ: полигон
Вопрос 39. Отношение преобладания — это:
- Ответ: С — Симпсона и Эдвардса
Вопрос 40. Вариант биноминального распределения для случаев, когда вероятность альтернативных признаков неодинакова, один из них наблюдается чаще других, называется распределением
- Ответ: Пуассона
Вопрос 41. Метод построения выравнивающей линии, отвечающей такому уравнению, где между аргументом х и функцией у предполагается линейная связь, т.е. у = ах + в это метод …
- Ответ: наименьших квадратов
Вопрос 42. Всякое вычисленное (эмпирическое) значение коэффициента корреляции должно быть проверено на:
- Ответ: статистическую значимость
Вопрос 43. Автором дисперсионного анализа является:
- Ответ: Фишер
Вопрос 44. Исходя из принятого риска, определяется группа значений выборочной статистики, позволяющих принять решение об ошибочности гипотезы Н и называемых
- Ответ: критической областью
Вопрос 45. Умеренная корреляция определяется при коэффициенте корреляции
- Ответ: 0,3-0,49
Вопрос 46. Метод классификации объектов на основании признаков, описывающих эти объекты таким образом, чтобы объекты, входящие в один класс, были более однородными по сравнению с объектами, входящими в другие классы, называется анализом
- Ответ: кластерным
Вопрос 47. Самый первый пример испытания статистической гипотезы появился в работе, датированной 1710 г. и написанной
- Ответ: Aрбутнотом
Вопрос 48. Третий этап проверки статистической гипотезы — это:
- Ответ: принятие степени риска для неправильного вывода на основе выборочных показаний об ошибочности гипотезы Н
Вопрос 49. В результате тестирования в группе были получены следующие результаты: 25, 23, 26, 28, 27, 25, 26, 25, 25. Стандартное отклонение для данной выборки будет:
- Ответ: 1,5
Вопрос 50. Значение варианты, наиболее часто встречающееся в выборке, — это:
- Ответ: мода
Вопрос 51. Если связь между признаками однозначна (функциональная, нестатистическая), по типу прямопропорциональной зависимости, в этом случае коэффициент корреляции равен:
- Ответ: 1
Вопрос 52. Переменная, которую мы хотим оценить, — это переменная …
- Ответ: зависимая
Вопрос 53. Форма причинной связи, при которой данное состояние системы однозначно определяет все ее последующие состояния, — это закономерность …
- Ответ: динамическая
Вопрос 54. Определение «репродуцированной» сокращенной корреляционной матрицы по формуле R1 = FF’ — это этап однофакторного анализа …
- Ответ: II
Вопрос 55. Часть (или подмножество) совокупности называется:
- Ответ: выборкой
Вопрос 56. Некоторая количественная мера проявления латентной переменной в наблюдаемых или специально вызываемых действиях (реакциях) данного индивида называется:
- Ответ: весом
Вопрос 57. При сопоставлении двух переменных величин часто предполагают, что одна из них является аргументом, другая
- Ответ: функцией
Вопрос 58. Делят совокупность на четыре части
- Ответ: квартили
Вопрос 59. Переменная, представляющая собой результаты измерений, которые варьируются, — это:
- Ответ: варианта
Вопрос 60. Критерий оценки различия величин двух попарно сопряженных совокупностей, т.е. таких совокупностей, которые объединены некоторой связью, общим свойством, — это критерий …
- Ответ: знаков
Вопрос 61. Определяется не бесконечным числом значений, а конечным числом обычно равных интервалов, «внутри» которых переменная остается непрерывной, случайная величина
- Ответ: квантованная
Вопрос 62. Распределение, при котором переменная величина изменяется непрерывно, причем крайние значения появляются редко, но чем ближе значения признака к центру, тем оно чаще встречается, — это:
- Ответ: нормальное распределение
Вопрос 63. Принимает теоретически бесконечное множество значений на любом, сколь угодно малом интервале возможных значений случайная величина
- Ответ: непрерывная
Вопрос 64. Выступает показателем “крутости” изменений функции (угла наклона выравнивающей прямой к оси абсцисс) коэффициент
- Ответ: регрессии
Вопрос 65. Первый этап кластерного анализа — это:
- Ответ: отбор выборки для кластеризации
Вопрос 66. При сравнении двух совокупностей, когда необходимо выяснить правильность рандомизации, вторым шагом будет:
- Ответ: замер данных выборки
Вопрос 67. Относительное скопление точек по сравнению с другими — это __________________ кластеров.
- Ответ: плотность
Вопрос 68. В большинстве случаев выборки будут давать величину стандартной ошибки коэффициента корреляции:
- Ответ: от -0,33 до +0,33
Вопрос 69. Кластеры обладают свойством
- Ответ: плотности
Вопрос 70. Мера случайности события, т.е. такого события, которое может произойти, а может и не произойти, — это мера …
- Ответ: вероятности
Вопрос 71. Единичное нормальное распределение значений Х, данное в терминах отклонений от среднего, в единицах стандартного отклонения, — это понятие …
- Ответ: стандарта
Вопрос 72. Мера объективной возможности появления определенного события А в заданной совокупности условий — это:
- Ответ: вероятность
Вопрос 73. Факторная структура, выявляемая по множеству переменных, представляется в виде
- Ответ: матрицы факторных зарядов
Вопрос 74. Вскрыть латентную структуру психологического явления и описать ее небольшим числом переменных по сравнению с исходным количеством измеряемых переменных — это основные задачи анализа …
- Ответ: факторного
Вопрос 75. Утверждение относительно неизвестного параметра называется гипотезой
- Ответ: статистической
Вопрос 76. Коэффициент корреляции Пирсона для дихотомических данных обозначается:
- Ответ: j
Вопрос 77. Можно осуществлять обычную группировку и вычислять распределения при количестве наблюдений в пределах
- Ответ: n > 200 пар
Вопрос 78. Позволяет сгруппировать объекты по классам на основании наличия у них общего признака или свойства и обнаружить различие в количестве признака или свойства в объекте, а также фиксировать равные различия в количестве признака или свойства в объекте шкала:
- Ответ: интервальная
Вопрос 79. Система латентных переменных, характеризующих некоторое психическое явление и обусловливающих систему реакций индивида в ответ на систему внешних воздействий, называется:
- Ответ: латентной структурой
Вопрос 80. Из совокупности извлекается одна выборка, рассматривается значение статистики и принимается решение относительно истинности гипотезы на __________________ этапе исследования.
- Ответ: четвером
Вопрос 81. УIJK = m+ai + bj + (ab) ij + еijk — это уравнение дисперсионного анализа …
- Ответ: двухфакторного
Вопрос 82. Количественное определение события — это:
- Ответ: квантификация
Вопрос 83. Позволяет сгруппировать объекты по классам на основании наличия у них общего признака или свойства и обнаружить различие в количестве признака или свойства в объекте, а также фиксировать равные различия в количестве признака или свойства в объекте и полное отсутствие измеряемого свойства и предполагает наличие фиксированной единицы измерения измерение
- Ответ: абсолютное
Вопрос 84. Значения различных описательных мер, вычисленных для выборок, — это понятие …
- Ответ: статистики
Вопрос 85. Суть кластерного анализа сводится к нахождению «расстояний» между объектами по всей совокупности параметров, а отображение их отношений возможно
- Ответ: графически
Вопрос 86. Уровень значимости — это ошибка (a) …
- Ответ: первого рода
Вопрос 87. Нормальное распределение описывается средним значением и …
- Ответ: средним квадратическим отклонением
Вопрос 88. Событие, которое при определенном комплексе условий опыта в каждом конкретном испытании может происходить, а может и не происходить, — это событие …
- Ответ: случайное
Вопрос 89. Выраженное в процентах отношение стандартного отклонения к среднему арифметическому значению — это:
- Ответ: коэффициент вариации
Вопрос 90. Можно осуществить простейшую группировку данных, определить форму корреляции, определить в явном виде регрессии и корреляционные отношения при количестве наблюдений в пределах
- Ответ: 30
Вопрос 91. R2 = R0 — R1 — это формула корреляционной матрицы …
- Ответ: остаточной
Вопрос 92. Количество повторений одинаковых результатов в составе вариационного ряда — это:
- Ответ: частота данного значения переменной
Вопрос 93. Задание, посредством которого осуществляется тестирование, называется:
- Ответ: тестом
Вопрос 94. Задачей статистического вывода является прирост знания о:
- Ответ: больших классах предметов, лиц или событий по их сравнительно малым классам
Вопрос 95. Наиболее простой среди множества вариантов кластеризации, не требующий обязательного использования ЭВМ, — это метод …
- Ответ: «ближайшего соседа»
Вопрос 96. Критерий оценки существенности различий между центральными тенденциями двух выборок, что по существу своему аналогично сравнению двух средних значений (без их вычисления), — это критерий …
- Ответ: Серийный
Вопрос 97. При строго симметричных распределениях коэффициенты асимметрии и эксцесса равны:
- Ответ: 0
Вопрос 98. Третий этап кластерного анализа — это:
- Ответ: вычисление значений той или иной пары сходства между объектами и применение кластерного анализа для создания группы сходных объектов
Вопрос 99. Коэффициент корреляции указывает на связь
- Ответ: прямолинейную
Вопрос 100. Медиана совпадает со средней арифметической только в случае распределения:
- Ответ: симметричного
Вопрос 101. Данные, относящиеся к отдельным градациям, называются комплексными
- Ответ: ячейками
Вопрос 102. Количественная мера, характеризующая разность между максимальным и минимальным значением признака, — это:
- Ответ: вариационный размах показателя
Вопрос 103. Мера разности между средними оценками по Х объектов, имеющих единицы по У, и объектов, имеющих нули по У, — это коэффициент корреляции …
- Ответ: Точечный бисериальный
Вопрос 104. В дисперсионном анализе переменные первого рода считаются:
- Ответ: факторами
Вопрос 105. Всякий реальный или воображаемый факт, который интересует исследователя, — это:
- Ответ: событие
Вопрос 106. Стандартное отклонение выборочного распределения коэффициента корреляции — это:
- Ответ: стандартная ошибка коэффициента корреляции
Вопрос 107. Второй шаг теории интервального оценивания — это:
- Ответ: найти стандартную ошибку
Вопрос 108. Всякая большая (конечная или бесконечная) коллекция или совокупность предметов, которые мы хотим исследовать или относительно которых мы собираемся делать выводы, называется:
- Ответ: генеральной совокупностью
Вопрос 109. Индекс сходства видовых списков — это коэффициент сходства …
- Ответ: Съеренсена
Вопрос 110. Мера линейной или нелинейной связи Х и У — это:
- Ответ: корреляционное отношение
Вопрос 111. Если сумма квадратов расстояний всех исходных (выравниваемых) точек до линии у = ах + в является наименьшей, то применяется метод
- Ответ: наименьших квадратов
Вопрос 112. Последовательное объединение объектов в так называемые кластеры, т. е. в группы, где сходство между объектами выше, чем с другими объектами или кластерами — группами объектов, — это смысл …
- Ответ: кластеризации
Вопрос 113. Вид измерения, которое основано на сравнении значений показателей испытуемого со значениями распределений аналогичных показателей в эталонной группе лиц, называется измерением
- Ответ: нормативным
Вопрос 114. Области теории оценивания параметров называются оцениванием
- Ответ: точечным
Вопрос 115. Начала статистической теории измерений созданы
- Ответ: Карлом Фридрихом Гауссом
Вопрос 116. Распространенная форма коэффициента линейной корреляции сопоставляет сами величины признаков и в конечном счете основана на вычислении
- Ответ: совместной дисперсии
Вопрос 117. Группа методов теории статистического вывода, использующих приблизительную оценку параметров генеральной совокупности по статистикам выборки, — это оценивание …
- Ответ: статистическое
Вопрос 118. Распределения, у которых две и более мод, — это распределения …
- Ответ: полимодальные
Вопрос 119. Связь между двумя переменными можно выразить графически
- Ответ: диаграммой рассеивания
Вопрос 120. При сравнении двух совокупностей, когда необходимо выяснить правильность рандомизации, четвертым шагом будет:
- Ответ: расчет F-критерия
Вопрос 121. Величина, которую можно непосредственно или косвенно измерить, называется:
- Ответ: явной переменной
Вопрос 122. Количественная мера «скошенности» симметричного распределения — это определение …
- Ответ: асимметрии
Вопрос 123. Свойство корреляции, которое определяется линейностью или нелинейностью регрессий М[у/х] = φ (υ) и М[х/у] = φ (σ), — это:
- Ответ: форма
Вопрос 124. Если обе переменные измеряются в шкалах порядка, то в качестве меры связи используется коэффициент ранговой корреляции
- Ответ: Спирмена
Вопрос 125. Показывает количество совместных появлений пар значений по двум переменным (признакам):
- Ответ: таблица сопряженности
Вопрос 126. Естественные группировки, полученные разными методами, — это __________________ кластеров.
- Ответ: устойчивость
Вопрос 127. Метод статистического анализа психологической информации, применяемый при исследовании статистически связанных признаков с целью выявления латентных факторов, — это анализ …
- Ответ: факторный
Вопрос 128. Делят совокупность на десять частей
- Ответ: децили
Вопрос 129. Математическое соотношение, устанавливающее связь между возможными значениями варианты и соответствующими им вероятностями, — это:
- Ответ: закон распределения
Вопрос 130. Свойство корреляции, которое характеризует одностороннюю обусловленность изменения значений одной из случайных величин изменениями значений другой случайной величины, — это:
- Ответ: направленность
Вопрос 131. Выбор коэффициентов корреляций зависит от:
- Ответ: шкал измерения переменных
Вопрос 132. Если связь между признаками является функциональной, но по типу обратной пропорциональности, то в этом случае коэффициент корреляции равен:
- Ответ: -1
Вопрос 133. Число фактически возможных направлений изменчивости называется:
- Ответ: числом степеней свободы
Вопрос 134. Значения различных описательных мер, вычисленных для выборок, называются:
- Ответ: статистиками
Вопрос 135. D = Xmax — Хmin — это формула …
- Ответ: размаха
Вопрос 136. Неограниченно большая или вся мыслимая совокупность измерений, индивидуумов или явлений, о свойствах которых мы собираемся судить в результате эксперимента, — это:
- Ответ: генеральная совокупность
Вопрос 137. Гипотеза говорящая, об отсутствии связи (т.е. наблюдаемые изменения случайны) — это гипотеза.
- Ответ: нуль
Вопрос 138. Связь между статистическими вариациями (выборками) по различным признакам, между влияниями каких-либо двух факторов, формирующих данное статистическое распределение, — это:
- Ответ: корреляция
Вопрос 139. Основной мерой положения является среднее
- Ответ: арифметическое значение
Вопрос 140. В результате тестирования в группе были получены следующие результаты: 25, 23, 26, 28, 27, 25, 26. Среднее арифметическое для данной выборки будет:
- Ответ: 26
Вопрос 141. Коэффициент ассоциации принимает значения в диапазоне:
- Ответ: -1
Вопрос 142. Событие, которое всегда имеет место при определенном комплексе условий, — это событие …
- Ответ: достоверное
Вопрос 143. Некоторая функция от значений в выборке, дающая величину, называемую оценкой, — это:
- Ответ: оцениватель
Вопрос 144. Предел, к которому стремится полигон частот при неограниченном увеличении объема статистической совокупности и уменьшении интервалов, — это:
- Ответ: кривая распределения
Вопрос 145. Метод однофакторного анализа предложен Спирменом в ходе обсуждения «теории __________________ факторов».
- Ответ: двух
Вопрос 146. Позволяет сгруппировать объекты по классам на основании наличия у них общего признака или свойства шкала:
- Ответ: номинальная
Вопрос 147. В дисперсионном анализе переменные второго рода считаются:
- Ответ: признаками
Вопрос 148. Поворот ортогональной системы координат относительно неизменного начала отсчета на некоторый угол — это математический смысл …
- Ответ: ротации
Вопрос 149. Правило, обеспечивающее надежное принятие истиной и отклонение ложной гипотезы с высокой вероятностью, называется:
- Ответ: статистическим критерием
Вопрос 150. Построение таблиц или собственно статистических распределений, в которых каждой варианте хi поставлена в соответствие ее частота fi в выборке или при необходимости частость wi, — это:
- Ответ: табулирование
Вопрос 151. Позволяет целенаправленно ставить и решать конкретные психометрические задачи с помощью простых статистических методов (корреляционного, регрессионного и др.) анализ
- Ответ: кластерный
Вопрос 152. Позволяет сгруппировать объекты по классам на основании наличия у них общего признака или свойства и обнаружить различие в количестве признака или свойства в объекте, а также фиксировать равные различия в количестве признака или свойства в объекте и полное отсутствие измеряемого свойства шкала:
- Ответ: отношений
Вопрос 153. Разность между фактическим значением У объекта и значением У, которое мы предсказываем для него, — это:
- Ответ: ошибка оценки
Вопрос 154. Четвертый этап проверки статистической гипотезы — это:
- Ответ: извлечение из совокупности одной выборки, рассмотрение значения статистики и принятие решения относительно истинности гипотезы
Вопрос 155. Вид измерения, которое основано на прямой оценке качества выполнения теста испытуемым по какому-либо критерию без сравнения с показателями других людей, называется измерением
- Ответ: критериальным
Вопрос 156. По исходным представлениям о числе общих факторов выделяют анализ:
- Ответ: двухфакторный
Вопрос 157. Число, показывающее, сколько раз встречается в выборке каждая варианта xi, — это:
- Ответ: частота
Вопрос 158. Стандартное отклонение выборочного распределения r называется:
- Ответ: стандартной ошибкой коэффициента корреляции
Вопрос 159. Вращение системы координат — это:
- Ответ: ротация
Вопрос 160. Естественное или специально сконструированное воздействие на психику, вызывающее отклик латентного свойства, называется:
- Ответ: тестированием
Вопрос 161. Общее число вариант в статистической совокупности (выборке), общее количество единичных измерений — это:
- Ответ: объем совокупности
Вопрос 162. Событие, которое никогда не происходит при определенном комплексе условий, — это событие …
- Ответ: невозможное
Вопрос 163. Тетрахорический коэффициент корреляции для дихотомических переменных, основанных на нормальных распределениях, — это коэффициент …
- Ответ: Чупрова
Вопрос 164. На конечном интервале имеет конечное число значений переменная:
- Ответ: дискретная
Вопрос 165. Положительное значение квадратного корня из дисперсии ошибки оценки называется:
- Ответ: стандартной ошибкой оценки
Вопрос 166. Риск, представленный как вероятность при проверке статистической гипотезы, называется:
- Ответ: уровнем значимости
Вопрос 167. Определение «остаточной» корреляционной матрицы и проверка возможности рассматривать остаточную матрицу как матрицу погрешностей — это этап однофакторного анализа …
- Ответ: III
Вопрос 168. Предположение о наличии доказательств для аннулирования основной гипотезы, — это:
- Ответ: нуль-гипотеза
Вопрос 169. К основным наиболее распространенным методам факторизации относится метод:
- Ответ: центроидный
Вопрос 170. Значение переменной, которое является срединным, центральным в общем упорядоченном ряду вариант выборки, — это:
- Ответ: медиана
Вопрос 171. Разность между естественной верхней границей интервала, содержащего максимальное значение, и естественной нижней границей интервала, включающего минимальное значение, — это определение …
- Ответ: включающего размаха
Вопрос 172. Одна из основных теорем теории статистического вывода, касающаяся распределения выборочного среднего, называется:
- Ответ: центральной предельной
Вопрос 173. Правило, обеспечивающее надежное принятие истинной и отклонение ложной гипотезы с высокой вероятностью, — это критерий …
- Ответ: Статистический
Вопрос 174. Статистические критерии, которые не рассматривают анализируемое статистическое распределение как функцию и применение которых не предполагает предварительное вычисление параметров распределения называется:
- Ответ: непараметрическими критериями
Вопрос 175. Схема дисперсионного анализа применима и в тех случаях, когда градации фактора представляют собой шкалу
- Ответ: номинативную
Вопрос 176. Теория, дающая нам представления об ошибках второго рода и мощности — это теория проверки гипотез …
- Ответ: Неймана-Пирсона
Вопрос 177. График в форме последовательности точек, обозначающих накопленные частоты и соединенных отрезками прямых, — это:
- Ответ: кумулята
Вопрос 178. В результате тестирования в группе были получены следующие результаты: 24, 23, 26, 28, 27, 25, 26. Мода в данной выборке будет:
- Ответ: 26
Вопрос 179. Значение переменной, отделяющее от распределения «слева» или «справа» определённую долю объема совокупности, — это:
- Ответ: квантиль
Вопрос 180. Второй этап кластерного анализа — это:
- Ответ: определение множества признаков, по которым будут оцениваться объекты выборки
Вопрос 181. Параметрический критерий оценки различия распределений, используемый при многомерном статистическом анализе выборок и представляющий собой отношение дисперсий, в котором большее по величине значение должно стоять в числителе, — это критерий …
- Ответ: Фишера
Вопрос 182. Статистические критерии, которые предполагают наличие нормального распределения психологических переменных, измеряемых в шкале интервалов или отношений, — это критерии …
- Ответ: Параметрические
Вопрос 183. Выравниваемая кривая разбивается на отдельные отрезки, в которых осуществляется линейное выравнивание и которые перекрывают друг друга при способе выравнивания рядов, называемом методом
- Ответ: скользящей средней
Вопрос 184. Предположение на определенном уровне статистической значимости о свойствах генеральной совокупности по оценкам выборки — это гипотеза …
- Ответ: статистическая
Вопрос 185. Свойство оценок, при котором среднее выборочного распределения оценки равно величине оцениваемого параметра, называется:
- Ответ: несмещенностью
Вопрос 186. Совокупность точек на плоскости, у которой оси абсцисс и ординат есть значения двух сопоставляемых статистических признаков, называется:
- Ответ: корреляционным полем
Вопрос 187. Форма причинной связи, при которой состояние системы определяет всё ее последующее состояние не однозначно, а лишь с определённой вероятностью — это закономерность …
- Ответ: статистическая
Вопрос 188. Группа методов теории статистического вывода, проверяющих предположение о численном значении одного или нескольких из параметров генеральной совокупности и согласованности их с данными, полученными на выборке, — это:
- Ответ: статистическая проверка гипотез
Вопрос 189. Первый шаг теории интервального оценивания — это:
- Ответ: найти выборочное распределение
Вопрос 190. Позволяет выражать учитываемые факторы не только абсолютными единицами измерения, но и в относительных или условных единицах анализ
- Ответ: дисперсионный
Вопрос 191. Для кластерной классификации объектов исследования используется и коэффициент корреляции, но в форме коэффициента
- Ответ: некорреляции
Вопрос 192. Проверяемая гипотеза с целью изучения связи между двумя переменными формулируется на __________________ этапе исследования.
- Ответ: первом
Вопрос 193. Значения различных описательных мер, вычисленных для генеральных совокупностей, — это понятие …
- Ответ: параметра
Вопрос 194. Прирост знаний о больших классах психологических явлений, испытуемых или сериях замеров по их сравнительно малым классам — это:
- Ответ: задача теории статистического вывода
Вопрос 195. Pn (m) = Cmn pm qn-m — это формула …
- Ответ: биноминального распределения
Вопрос 196. Дисперсионный анализ может применяться, когда известно или доказано, что выборка
- Ответ: нормально распределена
Вопрос 197. Кластеры обладают свойством
- Ответ: дисперсии
Вопрос 198. Представить общую дисперсию в виде суммы дисперсий, обусловленных влиянием контролируемых переменных, и, оценивая дисперсионное отношение, определить меру влияния факторов на средние значения изучаемой переменной — это сущность анализа …
- Ответ: дисперсионного
Вопрос 199. Вероятность отбрасывания истинной гипотезы или вероятность ошибки при статистическом оценивании называется:
- Ответ: уровнем значимости
Вопрос 200. К основным элементам многофакторного анализа относится:
- Ответ: факторизация
Вопрос 201. Второй квартиль делит совокупность на две равные по объему части и называется:
- Ответ: медианой
Вопрос 202. Существенно варьирует от крайней асимметрии к симметрии формула распределения:
- Ответ: Пуассона
Вопрос 203. Функция, отображающая отдельные значения дискретной случайной величины на вероятности их появления, — это:
- Ответ: ряд распределения
Вопрос 204. Графическое наглядное изображение кластерного анализа — это:
- Ответ: дендрограмма
Вопрос 205. Отделяют от совокупности по 0,01 части
- Ответ: центили
Вопрос 206. Мера, характеризующая скорость изменения средних значений одной случайной величины при изменении другой, — это коэффициент …
- Ответ: регрессии
Вопрос 207. Третий шаг теории интервального оценивания — это:
- Ответ: прибавить и вычесть некоторое число, кратное стандартной ошибке r, от r для определения границ доверительного интервала
Вопрос 208. Статистические критерии, которые не рассматривают анализируемое статистическое распределение как функцию и применение которых не предполагает предварительного вычисления параметров распределения, — это критерии …
- Ответ: Непараметрические
Вопрос 209. Критерий оценки различия величин членов двух выборок — это критерий …
- Ответ: числа инверсий
Вопрос 210. Выражение σ2/п, называется:
- Ответ: дисперсией ошибки среднего
Вопрос 211. Классическая мера разброса — это:
- Ответ: стандартное отклонение
Вопрос 212. Коэффициент корреляции теста с самим собой называется коэффициентом
- Ответ: эквивалентности
Вопрос 213. Интервал числовой оси, когда предполагается, что значение параметра лежит в определенном интервале называется:
- Ответ: интервальной оценкой параметра
Вопрос 214. Переменная, принимающая на бесконечно малом интервале бесконечно большое число значений, — это переменная …
- Ответ: непрерывная
Вопрос 215. В случае, когда исследуется влияние какого-либо фактора на средние значения изучаемой переменной, используется анализ:
- Ответ: дисперсионный
Вопрос 216. Однофакторный анализ предложен:
- Ответ: Спирменом
Вопрос 217. Латентная структура может проявиться через
- Ответ: определенное множество тестирований
Вопрос 218. Величина коэффициента корреляции колеблется в пределах от:
- Ответ: -1 до 1
Вопрос 219. К основным элементам многофакторного анализа относится:
- Ответ: обращение
Вопрос 220. Наглядно представить сходство или различие психических объектов, которые охарактеризованы по многим параметрам, позволяет:
- Ответ: кластеризация
Вопрос 221. Таблица с результатами совместной группировки двух варьирующих рядов, которые исследуются на корреляцию, называется:
- Ответ: групповой
Вопрос 222. Интервал числовой оси, в пределах которого с той или иной вероятностью находится параметр генеральной совокупности, — называется:
- Ответ: доверительным
Вопрос 223. Обобщающий показатель положения и уровня центра распределения — это:
- Ответ: среднее значение
Вопрос 224. Для оценки различия величин членов двух выборок используется критерий
- Ответ: Числа инверсий
Вопрос 225. Отношение разности значения Х и среднего значения к стандартному отклонению называется:
- Ответ: единичным нормальным отклонением
Вопрос 226. Степень обусловленности изменений Х значениями Y или, наоборот, Y значениями X, является таким свойством корреляции, как:
- Ответ: теснота
Вопрос 227. Объединение вариант в интервалы, границы которых устанавливаются произвольно и непременно указываются, — это:
- Ответ: группировка
Вопрос 228. Приблизительно 68% выборок будут давать значения стандартной ошибки коэффициента корреляции
- Ответ: от -0,11 до +0,11
Вопрос 229. Коэффициент корреляции, равный произведению моментов, вычисленный по двум группам n последовательных, несвязанных рангов 1, …, n, обозначается буквой
- Ответ: rs
Вопрос 230. Взаимная связь между двумя или более переменными или взаимная зависимость различных признаков при их изменчивости — это определение …
- Ответ: корреляции
Вопрос 231. Форма расположения точек на корреляционном поле и контур соответствующих линий регрессии выступают наглядными показателями
- Ответ: тесноты
Вопрос 232. Часть общей дисперсии выборки, которая не входит в долю дисперсии по данному фактору или группе факторов, — это дисперсия …
- Ответ: остаточная
Вопрос 233. Разность максимального и минимального значений в группе — это определение …
- Ответ: исключающего размаха
Вопрос 234. Когда нет необходимости подсчитывать частоту появления различных значений переменных Х и У для дихотомических данных, применяется коэффициент
- Ответ: Пирсона
Вопрос 235. К основным методам факторизации относится метод:
- Ответ: главных компонент
Вопрос 236. Корреляционная зависимость переменной с рядом факторов — это корреляция …
- Ответ: множественная
Вопрос 237. По исходным представлениям о числе общих факторов выделяют анализ:
- Ответ: однофакторный
Вопрос 238. Форма причинной связи, при которой данное состояние системы определяет все ее последующее состояние не однозначно, а с определенной вероятностью, — это:
- Ответ: статистические закономерности
Вопрос 239. Анализирует степень стохастической связи между психологическими переменными
- Ответ: мера связи
Вопрос 240. Если вычисленное значение коэффициента корреляции больше табличного для р = 0,01, то корреляция
- Ответ: является статистически значимой
Вопрос 241. К основным методам факторизации относится метод:
- Ответ: максимального правдоподобия
Вопрос 242. Количественная мера “горбатости” симметричного распределения — это определение …
- Ответ: эксцесса
Вопрос 243. Оценивают степень изменчивости вариант, являясь одной из характеристик их группировки, меры
- Ответ: рассеяния
Вопрос 244. Система статистических методов исследования влияния независимых качественных переменных (факторов) на изучаемую зависимую количественную переменную по дисперсии — это анализ …
- Ответ: дисперсионный
Вопрос 245. Приближенное аналитическое (формульное) выражение регрессии по ряду пар значений Х и У, полученных в эксперименте, — это:
- Ответ: аппроксимация простой регрессии
Вопрос 246. Линия, построенная по средним значениям первого признака с соответствующим средним интервалом признаков-факторов, называется линией
- Ответ: регрессии
Вопрос 247. Мера разброса в распределениях, которые имеют параметром средней величины медиану, — это:
- Ответ: среднее квартильное отклонение
Вопрос 248. Нахождение «расстояния» (меры различия) между объектами по всей совокупности параметров и их изображение графически — суть анализа
- Ответ: кластерного
Вопрос 249. При сравнении двух совокупностей, когда необходимо выяснить правильность рандомизации, третьим шагом будет:
- Ответ: расчет значения дисперсии
Вопрос 250. Распределения, у которых мода отсутствует, — это распределения …
- Ответ: унимодальные
Вопрос 251. Наиболее часто в психологии применяются коэффициенты корреляции
- Ответ: Пирсона и Спирмена
Вопрос 252. Бифакторный анализ разработан
- Ответ: Холзингеpом
Вопрос 253. Мера связи, основанная на числе совпадений или инверсий в ранжировках статистических признаков Х и У, носит название коэффициента
- Ответ: Кендалла
Вопрос 254. Статистику, вычисленную по выборке, можно рассматривать как оценку параметра
- Ответ: совокупности
Вопрос 255. При исследовании действия двух факторов на одну и ту же выборку испытуемых применяется анализ
- Ответ: двухфакторный дисперсионный для связанных выборок
Вопрос 256. Кластеры обладают свойством
- Ответ: устойчивости
Вопрос 257. Около 95% выборок будут давать значения стандартной ошибки коэффициента корреляции
- Ответ: от -0,22 до +0,22
Вопрос 258. Критерий оценки различия величин двух попарно сопряженных совокупностей, который учитывает не только направление (знак) разности между сравниваемыми рядами, но и абсолютную величину этих разностей Т, — это критерий …
- Ответ: Вилкоксона
Вопрос 259. График в форме последовательности стобцов, каждый из которых опирается на один разрядный интервал, а высота его отражает число случаев, или частоту, в этом разряде — это:
- Ответ: гистограмма
Вопрос 260. Когда интервальная оценка параметра строится так, что известна вероятность попадания значения параметра в границы интервала, то интервал называется:
- Ответ: доверительным
Вопрос 261. Математические процедуры для изучения статистических связей между признаками психологических объектов — это анализ …
- Ответ: корреляционный
Вопрос 262. Форма записи выборки, где все значения переменной расположены в один ряд в порядке возрастания или убывания, — это:
- Ответ: вариационный ряд
Вопрос 263. Различие двух сравниваемых параметров, которое статистически доказано, называется:
- Ответ: достоверным различием
Вопрос 264. Разность между вероятностями “правильного” и “неправильного” порядка для двух наблюдений, взятых наугад при условии, что совпадающих рангов нет, — это:
- Ответ: g — Гудмена и Краскала
Вопрос 265. Экспериментальные данные, представленные по градациям фактора, называются комплексом
- Ответ: дисперсионным
Вопрос 266. Вся система событий как исходов эксперимента или ряд случайных значений измеренного признака х1, х2…, хi…, xn, варьирующих в силу тех или иных статистических закономерностей, — это:
- Ответ: статистическая совокупность
Вопрос 267. Значения различных описательных мер, вычисленных для генеральных совокупностей, называются(-ется):
- Ответ: параметрами
Вопрос 268. Первый этап проверки статистической гипотезы — это:
- Ответ: формулировка проверяемой нуль-гипотезы
Вопрос 269. Слабая корреляция определяется при коэффициенте корреляции ниже
- Ответ: 0,3
Вопрос 270. К основным элементам многофакторного анализа относится:
- Ответ: ротация
Вопрос 271. Если эмпирическое значение меньше или равно табличному для p = 0,01, то корреляция
- Ответ: не является статистически значимой
Вопрос 272. Вид анализа, позволяющий выявить количественную зависимость одного признака-фактора от одного или нескольких признаков-факторов, называется:
- Ответ: регрессионным
Вопрос 273. Стохастическая связь между классифицированными событиями — это определение …
- Ответ: сопряжённости
Вопрос 274. Мощность критерия — это ошибка (b) …
- Ответ: второго рода
Вопрос 275. Предполагаемое решение проблемы, формулируемое как эмпирическая теорема, которая проверяется по результатам эксперимента, где опыт отвечает на вопрос, будет гипотеза истинной или ложной, — это гипотеза …
- Ответ: научная
Вопрос 276. График в форме последовательности столбцов, каждый из которых опирается на один разрядный интервал, а высота его отражает число случаев или частоту в этом разряде, — это:
- Ответ: гистограмма
Вопрос 277. Определение вероятности как числа, которое получается как предел частот при неограниченном увеличении числа наблюдений и обычно называется «статистическим» определением вероятности, дал:
- Ответ: Рихард фон Мизес
Вопрос 278. Позволяет сгруппировать объекты по классам на основании наличия у них общего признака или свойства и обнаружить различие в количестве признака или свойства в объекте шкала:
- Ответ: порядковая
Вопрос 279. Разумное, обоснованное и развитое предположение по решению проблемы называется гипотезой
- Ответ: научной
Вопрос 280. Математическая таблица, в виде которой записываются качественно-количественные множества данных, — это:
- Ответ: матрица
Вопрос 281. Стохастическая связь исчерпывается корреляцией лишь для нормального распределения:
- Ответ: двумерного
Вопрос 282. Не требует предварительных гипотез, а только допускает существование в исследуемом феномене какой-либо закономерности или порядка анализ
- Ответ: факторный
Вопрос 283. Позволяет оценить не только влияние каждого из факторов в отдельности, но и их взаимодействие анализ
- Ответ: двухфакторный дисперсионный
Вопрос 284. Метод классификации, широко используемый в современной математической таксономии и позволяющий наглядно представить сходства или различия психологических объектов, охарактеризованных по многим параметрам, — это:
- Ответ: кластеризация
Вопрос 285. Метод многомерной статистики для различения (дифференциации) и диагностирования психологических явлений, отличия между которыми не очевидны, — это анализ …
- Ответ: дискриминантный
Вопрос 286. Величина, которую непосредственно измерить нельзя и для которой неизвестны уравнения связи с какими-либо явными переменными, называется:
- Ответ: латентной переменной
Вопрос 287. Распределение суммы n независимых случайных величин, каждая из которых имеет распределение Бернулли с параметром р, — это:
- Ответ: биноминальное распределение
Вопрос 288. Система векторов, длина каждого из которых определяется элементами главной диагонали матрицы, а углы между каждой парой — остальными элементами корреляционной матрицы, — это:
- Ответ: конфигурация векторов
Вопрос 289. Метод однофакторного анализа предложен в ходе обоснования «теории двух факторов»:
- Ответ: общего и единичного
Вопрос 290. Второй этап проверки статистической гипотезы — это:
- Ответ: высказывание предположений, необходимых для определения выборочного распределения статистики, оценивающей параметр, относительно которого высказывается гипотеза
Вопрос 291. Когда известно или доказано, что выборки нормально распределены, применяется анализ
- Ответ: дисперсионный
Вопрос 292. Коэффициент, который измеряет связь между рангами (местами) данной варианты по разным признакам, но не между собственными величинами варианты, — это коэффициент …
- Ответ: Спирмена
Вопрос 293. Степень риска для неправильного вывода на основе выборочных показаний об ошибочности гипотезы принимается на __________________ этапе исследования.
- Ответ: третьем
Вопрос 294. Е в формуле R2 = Е — это матрица …
- Ответ: погрешностей
Вопрос 295. Степень рассеивания точек в пространстве относительно центра кластера, степень перекрытия и расстояния, на котором кластеры расположены друг от друга, — это __________________ кластеров.
- Ответ: дисперсия
Вопрос 296. Может предполагаться и квадратичная зависимость между Х и Y, и вообще любая степенная при:
- Ответ: выравнивании рядов
Вопрос 297. При полном отсутствии связи (по типу линейной) между сопоставляемыми признаками коэффициент корреляции равен:
- Ответ: 0
Вопрос 298. При сравнении двух совокупностей, когда необходимо выяснить правильность рандомизации, первым шагом будет:
- Ответ: формулирование гипотезы и задание уровня значимости
Вопрос 299. Исходный этап первоначальной обработки, состоящий в расположении вариант выборки в какой-либо последовательности, удобной для дальнейшего анализа и рассмотрения, — это:
- Ответ: упорядочение
Вопрос 300. Форма причинной связи, при которой данное состояние системы определяет все ее последующее состояние, а знание начального состояния системы позволяет точно предсказывать ее развитие, — это:
- Ответ: динамические закономерности
Вопрос 301. Дисперсия, вызванная организованными, учитываемыми в исследовании факторами, оценивающая межгрупповую изменчивость, — это дисперсия …
- Ответ: частная
Вопрос 302. Для сравнения двух частот, двух эмпирических или эмпирического и критического используется критерий
- Ответ: Квадрат
Вопрос 303. Если изучаемые признаки имеют разную размерность, то вместо табличных исходных данных для вычисления d следует подготовить таблицу
- Ответ: нормированных значений
Вопрос 304. Очень слабая корреляция определяется при коэффициенте корреляции ниже
- Ответ: 0,2
Вопрос 305. Выборка, адекватно отражающая генеральную совокупность в качественном и количественном отношении называется:
- Ответ: репрезентативной выборкой
Вопрос 306. Некоторое аналитическое выражение, которое представляет варьирующие значения функции, дав им в соответствие значение аргумента, и тем самым позволяет выровнять статистические вариации функции, является уравнением
- Ответ: регрессии
Вопрос 307. Таблица данных в виде процентилей или стандартных оценок, полученных на определенной выборке, — это понятие …
- Ответ: нормы
Вопрос 308. Разность между наибольшей и наименьшей вариантами, которую для обобщения можно выразить и в процентах, например, к среднему значению, — это определение …
- Ответ: вариационного размаха
- Ответ: регрессии
Ошибки I и II рода при проверке гипотез, мощность
Общий обзор
Принятие неправильного решения
Мощность и связанные факторы
Проверка множественных гипотез
Общий обзор
Большинство проверяемых гипотез сравнивают между собой группы объектов, которые испытывают влияние различных факторов.
Например, можно сравнить эффективность двух видов лечения, чтобы сократить 5-летнюю смертность от рака молочной железы. Для данного исхода (например, смерть) сравнение, представляющее интерес (например, различные показатели смертности через 5 лет), называют эффектом или, если уместно, эффектом лечения.
Нулевую гипотезу выражают как отсутствие эффекта (например 5-летняя смертность от рака молочной железы одинаковая в двух группах, получающих разное лечение); двусторонняя альтернативная гипотеза будет означать, что различие эффектов не равно нулю.
Критериальная проверка гипотезы дает возможность определить, достаточно ли аргументов, чтобы отвергнуть нулевую гипотезу. Можно принять только одно из двух решений:
- отвергнуть нулевую гипотезу и принять альтернативную гипотезу
- остаться в рамках нулевой гипотезы
Важно: В литературе достаточно часто встречается понятие «принять нулевую гипотезу». Хотелось бы внести ясность, что со статистической точки зрения принять нулевую гипотезу невозможно, т.к. нулевая гипотеза представляет собой достаточно строгое утверждение (например, средние значения в сравниваемых группах равны
).
Поэтому фразу о принятии нулевой гипотезы следует понимать как то, что мы просто остаемся в рамках гипотезы.
Принятие неправильного решения
Возможно неправильное решение, когда отвергают/не отвергают нулевую гипотезу, потому что есть только выборочная информация.
| |
Верная гипотеза | ||
|---|---|---|---|
| H0 | H1 | ||
| Результат применения критерия |
H0 | H0 верно принята | H0 неверно принята (Ошибка второго рода) |
| H1 | H0 неверно отвергнута (Ошибка первого рода) |
H0 верно отвергнута |
Ошибка 1-го рода: нулевую гипотезу отвергают, когда она истинна, и делают вывод, что имеется эффект, когда в действительности его нет. Максимальный шанс (вероятность) допустить ошибку 1-го рода обозначается α (альфа). Это уровень значимости критерия; нулевую гипотезу отвергают, если наше значение p ниже уровня значимости, т. е., если p < α.
Следует принять решение относительно значения а прежде, чем будут собраны данные; обычно назначают условное значение 0,05, хотя можно выбрать более ограничивающее значение, например 0,01.
Шанс допустить ошибку 1-го рода никогда не превысит выбранного уровня значимости, скажем α = 0,05, так как нулевую гипотезу отвергают только тогда, когда p< 0,05. Если обнаружено, что p > 0,05, то нулевую гипотезу не отвергнут и, следовательно, не допустят ошибки 1-го рода.
Ошибка 2-го рода: не отвергают нулевую гипотезу, когда она ложна, и делают вывод, что нет эффекта, тогда как в действительности он существует. Шанс возникновения ошибки 2-го рода обозначается β (бета); а величина (1-β) называется мощностью критерия.
Следовательно, мощность — это вероятность отклонения нулевой гипотезы, когда она ложна, т.е. это шанс (обычно выраженный в процентах) обнаружить реальный эффект лечения в выборке данного объема как статистически значимый.
В идеале хотелось бы, чтобы мощность критерия составляла 100%; однако это невозможно, так как всегда остается шанс, хотя и незначительный, допустить ошибку 2-го рода.
К счастью, известно, какие факторы влияют на мощность и, таким образом, можно контролировать мощность критерия, рассматривая их.
Мощность и связанные факторы
Планируя исследование, необходимо знать мощность предложенного критерия. Очевидно, можно начинать исследование, если есть «хороший» шанс обнаружить уместный эффект, если таковой существует (под «хорошим» мы подразумеваем, что мощность должна быть по крайней мере 70-80%).
Этически безответственно начинать исследование, у которого, скажем, только 40% вероятности обнаружить реальный эффект лечения; это бесполезная трата времени и денежных средств.
Ряд факторов имеют прямое отношение к мощности критерия.
Объем выборки: мощность критерия увеличивается по мере увеличения объема выборки. Это означает, что у большей выборки больше возможностей, чем у незначительной, обнаружить важный эффект, если он существует.
Когда объем выборки небольшой, у критерия может быть недостаточно мощности, чтобы обнаружить отдельный эффект. Эти методы также можно использовать для оценки мощности критерия для точно установленного объема выборки.
Вариабельность наблюдений: мощность увеличивается по мере того, как вариабельность наблюдений уменьшается.
Интересующий исследователя эффект: мощность критерия больше для более высоких эффектов. Критерий проверки гипотез имеет больше шансов обнаружить значительный реальный эффект, чем незначительный.
Уровень значимости: мощность будет больше, если уровень значимости выше (это эквивалентно увеличению допущения ошибки 1-го рода, α, а допущение ошибки 2-го рода, β, уменьшается).
Таким образом, вероятнее всего, исследователь обнаружит реальный эффект, если на стадии планирования решит, что будет рассматривать значение р как значимое, если оно скорее будет меньше 0,05, чем меньше 0,01.
Обратите внимание, что проверка ДИ для интересующего эффекта указывает на то, была ли мощность адекватной. Большой доверительный интервал следует из небольшой выборки и/или набора данных с существенной вариабельностью и указывает на недостаточную мощность.
Проверка множественных гипотез
Часто нужно выполнить критериальную проверку значимости множественных гипотез на наборе данных с многими переменными или существует более двух видов лечения.
Ошибка 1-го рода драматически увеличивается по мере увеличения числа сравнений, что приводит к ложным выводам относительно гипотез. Следовательно, следует проверить только небольшое число гипотез, выбранных для достижения первоначальной цели исследования и точно установленных априорно.
Можно использовать какую-нибудь форму апостериорного уточнения значения р, принимая во внимание число выполненных проверок гипотез.
Например, при подходе Бонферрони (его часто считают довольно консервативным) умножают каждое значение р на число выполненных проверок; тогда любые решения относительно значимости будут основываться на этом уточненном значении р.
Связанные определения:
p-уровень
Альтернативная гипотеза, альтернатива
Альфа-уровень
Бета-уровень
Гипотеза
Двусторонний критерий
Критерий для проверки гипотезы
Критическая область проверки гипотезы
Мощность
Мощность исследования
Мощность статистического критерия
Нулевая гипотеза
Односторонний критерий
Ошибка I рода
Ошибка II рода
Статистика критерия
Эквивалентные статистические критерии
В начало
Содержание портала
UCHEES.RU — помощь студентам и школьникам
Ошибка отвержения истинной гипотезы — это ошибка …
В 22:11 поступил вопрос в раздел Математические методы в психологии, который вызвал затруднения у обучающегося.
Вопрос вызвавший трудности
Ошибка отвержения истинной гипотезы — это ошибка …
Ответ подготовленный экспертами Учись.Ru
Для того чтобы дать полноценный ответ, был привлечен специалист, который хорошо разбирается требуемой тематике «Математические методы в психологии». Ваш вопрос звучал следующим образом: Ошибка отвержения истинной гипотезы — это ошибка …
После проведенного совещания с другими специалистами нашего сервиса, мы склонны полагать, что правильный ответ на заданный вами вопрос будет звучать следующим образом:
- Ответ: первого рода
НЕСКОЛЬКО СЛОВ ОБ АВТОРЕ ЭТОГО ОТВЕТА:

Работы, которые я готовлю для студентов, преподаватели всегда оценивают на отлично. Я занимаюсь написанием студенческих работ уже более 4-х лет. За это время, мне еще ни разу не возвращали выполненную работу на доработку! Если вы желаете заказать у меня помощь оставьте заявку на этом сайте. Ознакомиться с отзывами моих клиентов можно на этой странице.
Бирюкова Санда Авдеевна — автор студенческих работ, заработанная сумма за прошлый месяц 54 412 рублей. Её работа началась с того, что она просто откликнулась на эту вакансию
ПОМОГАЕМ УЧИТЬСЯ НА ОТЛИЧНО!
Выполняем ученические работы любой сложности на заказ. Гарантируем низкие цены и высокое качество.

Деятельность компании в цифрах:
Зачтено оказывает услуги помощи студентам с 1999 года. За все время деятельности мы выполнили более 400 тысяч работ. Написанные нами работы все были успешно защищены и сданы. К настоящему моменту наши офисы работают в 40 городах.
РАЗДЕЛЫ САЙТА
Ответы на вопросы — в этот раздел попадают вопросы, которые задают нам посетители нашего сайта. Рубрику ведут эксперты различных научных отраслей.
Полезные статьи — раздел наполняется студенческой информацией, которая может помочь в сдаче экзаменов и сессий, а так же при написании различных учебных работ.
Красивые высказывания — цитаты, афоризмы, статусы для социальных сетей. Мы собрали полный сборник высказываний всех народов мира и отсортировали его по соответствующим рубрикам. Вы можете свободно поделиться любой цитатой с нашего сайта в социальных сетях без предварительного уведомления администрации.
ЗАДАТЬ ВОПРОС
НОВЫЕ ОТВЕТЫ
- Абадзехская стоянка, Даховская пещера. ..
- По закону сохранения заряда каждый шарик после соприкасl..
- 2)прогудел первый мохнатый шмель 3) Зазвенела Прогудел 4) ..
- В мілкій траві ворушаться сліди веселих, сполоханих доще
..
ПОХОЖИЕ ВОПРОСЫ
- По исходным представлениям о числе общих факторов выделяют анализ:
- Связи между случайными явлениями вообще называются:
- Некоторая функция от значений в выборке, дающая величину, называемую оценкой, — это понятие …
- Область теории оценивания параметров, где в качестве оценки параметра рассматривается одно значение или число, — это оценивание …
Площадка Учись.Ru разработана специально для студентов и школьников. Здесь можно найти ответы на вопросы по гуманитарным, техническим, естественным, общественным, прикладным и прочим наукам. Если же ответ не удается найти, то можно задать свой вопрос экспертам. С нами сотрудничают преподаватели школ, колледжей, университетов, которые с радостью помогут вам. Помощь студентам и школьникам оказывается круглосуточно. С Учись.Ru обучение станет в несколько раз проще, так как здесь можно не только получить ответ на свой вопрос, но расширить свои знания изучая ответы экспертов по различным направлениям науки.
2020 — 2021 — UCHEES.RU
Assessment |
Biopsychology |
Comparative |
Cognitive |
Developmental |
Language |
Individual differences |
Personality |
Philosophy |
Social |
Methods |
Statistics |
Clinical |
Educational |
Industrial |
Professional items |
World psychology |
Statistics:
Scientific method ·
Research methods ·
Experimental design ·
Undergraduate statistics courses ·
Statistical tests ·
Game theory ·
Decision theory
Type I errors (or α error, or false positive) and type II errors (β error, or a false negative) are two terms used to describe statistical errors.
Statistical error vs. systematic error
Scientists recognize two different sorts of error:[1]
- Statistical error: the difference between a computed, estimated, or measured value and the true, specified, or theoretically correct value (see errors and residuals in statistics) that is caused by random, and inherently unpredictable fluctuations in the measurement apparatus.[2]
- Systematic error: the difference between a computed, estimated, or measured value and the true, specified, or theoretically correct value that is caused by non-random fluctuations from an unknown source (see uncertainty), and which, once identified, can usually be eliminated.[2]
Statistical error: Type I and Type II
Statisticians speak of two significant sorts of statistical error. The context is that there is a «null hypothesis» which corresponds to a presumed default «state of nature», e.g., that an individual is free of disease, that an accused is innocent, or that a potential login candidate is not authorized. Corresponding to the null hypothesis is an «alternative hypothesis» which corresponds to the opposite situation, that is, that the individual has the disease, that the accused is guilty, or that the login candidate is an authorized user. The goal is to determine accurately if the null hypothesis can be discarded in favor of the alternative. A test of some sort is conducted (a blood test, a legal trial, a login attempt), and data is obtained. The result of the test may be negative (that is, it does not indicate disease, guilt, or authorized identity). On the other hand, it may be positive (that is, it may indicate disease, guilt, or identity). If the result of the test does not correspond with the actual state of nature, then an error has occurred, but if the result of the test corresponds with the actual state of nature, then a correct decision has been made. There are two kinds of error, classified as «Type I error» and «Type II error,» depending upon which hypothesis has incorrectly been identified as the true state of nature.
Type I error
Type I error, also known as an «error of the first kind«, an α error, or a «false positive«: the error of rejecting a null hypothesis when it is actually true. Plainly speaking, it occurs when we are observing a difference when in truth there is none.
A false positive normally means that a test claims something to be positive, when that is not the case. For example, a pregnancy test with a positive result (indicating that the person taking the test is pregnant) has produced a false positive in the case where the person is not pregnant.
Type II error
Type II error, also known as an «error of the second kind«, a β error, or a «false negative«: the error of failing to reject a null hypothesis when the alternative hypothesis is the true state of nature. In other words, this is the error of failing to observe a difference when in truth there is one. This type of error can only occur when the statistician fails to reject the null hypothesis.
See Various proposals for further extension, below, for additional terminology.
Understanding Type I and Type II errors
Hypothesis testing is the art of testing whether a variation between two sample distributions can be explained by chance or not. In many practical applications Type I errors are more delicate than Type II errors. In these cases, care is usually focused on minimizing the occurrence of this statistical error. Suppose, the probability for a Type I error is 1% or 5%, then there is a 1% or 5% chance that the observed variation is not true. This is called the level of significance. While 1% or 5% might be an acceptable level of significance for one application, a different application can require a very different level. For example, the standard goal of six sigma is to achieve exactness by 4.5 standard deviations above or below the mean. That is, for a normally distributed process only 3.4 parts per million are allowed to be deficient. The probability of Type I error is generally denoted with the Greek letter alpha.
Etymology
In 1928, Jerzy Neyman (1894-1981) and Egon Pearson (1895-1980), both eminent statisticians, discussed the problems associated with «deciding whether or not a particular sample may be judged as likely to have been randomly drawn from a certain population» (1928/1967, p.1): and, as David remarked, «it is necessary to remember the adjective ‘random’ [in the term ‘random sample’] should apply to the method of drawing the sample and not to the sample itself» (1949, p.28).
They identified «two sources of error«, namely:
- (a) the error of rejecting a hypothesis that should have been accepted, and
- (b) the error of accepting a hypothesis that should have been rejected (1928/1967, p.31).
In 1930, they elaborated on these two sources of error, remarking that:
-
- …in testing hypotheses two considerations must be kept in view, (1) we must be able to reduce the chance of rejecting a true hypothesis to as low a value as desired; (2) the test must be so devised that it will reject the hypothesis tested when it is likely to be false (1930/1967, p.100).
In 1933, they observed that these «problems are rarely presented in such a form that we can discriminate with certainty between the true and false hypothesis» (p.187). They also noted that, in deciding whether to accept or reject a particular hypothesis amongst a «set of alternative hypotheses» (p.201), it was easy to make an error:
- …[and] these errors will be of two kinds:
- (I) we reject H0 [i.e., the hypothesis to be tested] when it is true,
- (II) we accept H0 when some alternative hypothesis Hi is true. (1933/1967, p.187)
In all of the papers co-written by Neyman and Pearson the expression H0 always signifies «the hypothesis to be tested» (see, for example, 1933/1967, p.186).
In the same paper[3] they call these two sources of error, errors of type I and errors of type II respectively.[4]
Statistical treatment
Definitions
Type I and type II errors
Over time, the notion of these two sources of error has been universally accepted. They are now routinely known as type I errors and type II errors. For obvious reasons, they are very often referred to as false positives and false negatives respectively. The terms are now commonly applied in much wider and far more general sense than Neyman and Pearson’s original specific usage, as follows:
- Type I errors (the «false positive«): the error of rejecting the null hypothesis given that it is actually true; e.g., A court finding a person guilty of a crime that they did not actually commit.
- Type II errors (the «false negative«): the error of failing to reject the null hypothesis given that the alternative hypothesis is actually true; e.g., A court finding a person not guilty of a crime that they did actually commit.
These examples illustrate the ambiguity, which is one of the dangers of this wider use: They assume the speaker is testing for guilt; they could also be used in reverse, as testing for innocence; or two tests could be involved, one for guilt, the other for innocence. (This ambiguity is one reason for the Scottish legal system’s third possible verdict: not proven.)
The following tables illustrate the conditions.
| Actual condition | |||
|---|---|---|---|
| Present | Absent | ||
| Test result |
Positive | Condition Present + Positive result = True Positive | Condition absent + Positive result = False Positive Type I error |
| Negative | Condition present + Negative result = False (invalid) Negative Type II error |
Condition absent + Negative result = True (accurate) Negative |
Example, using infectious disease test results:
| Actual condition | |||
|---|---|---|---|
| Infected | Not infected | ||
| Test result | Test shows «infected» | True Positive | False Positive (i.e. infection reported but not present) Type I error |
| Test shows «not infected» | False Negative (i.e. infection not detected) Type II error |
True Negative |
Example, testing for guilty/not-guilty:
| Actual condition | |||
|---|---|---|---|
| Guilty | Not guilty | ||
| Test result | Verdict of «guilty» | True Positive | False Positive (i.e. guilt reported unfairly) Type I error |
| Verdict of «not guilty» | False Negative (i.e. guilt not detected) Type II error |
True Negative |
Example, testing for innocent/not innocent – sense is reversed from previous example:
| Actual condition | |||
|---|---|---|---|
| Innocent | Not innocent | ||
| Test result | Judged «innocent» | True Positive | False Positive (i.e. guilty but not caught) Type I error |
| Judged «not innocent» | False Negative (i.e. innocent but condemned) Type II error |
True Negative |
Note that, when referring to test results, the terms true and false are used in two different ways: the state of the actual condition (true=present versus false=absent); and the accuracy or inaccuracy of the test result (true positive, false positive, true negative, false negative). This is confusing to some readers. To clarify the examples above, we have used present/absent rather than true/false to refer to the actual condition being tested.
False positive rate
The false positive rate is the proportion of negative instances that were erroneously reported as being positive.
It is equal to 1 minus the specificity of the test. This is equivalent to saying the false positive rate is equal to the significance level.
[5]
In statistical hypothesis testing, this fraction is given the symbol α, and is defined as the specificity of the test. Increasing the specificity of the test lowers the probability of type I errors, but raises the probability of type II errors (false negatives that reject the alternative hypothesis when it is true).[6]
False negative rate
The false negative rate is the proportion of positive instances that were erroneously reported as negative.
It is equal to 1 minus the «power» of the test.[7]
In statistical hypothesis testing, this fraction is given the symbol β.
The null hypothesis
- Main article: Null hypothesis
It is standard practice for statisticians to conduct tests in order to determine whether or not a «speculative hypothesis» concerning the observed phenomena of the world (or its inhabitants) can be supported. The results of such testing determine whether a particular set of results agrees reasonably (or does not agree) with the speculated hypothesis.
On the basis that it is always assumed, by statistical convention, that the speculated hypothesis is wrong — and that the observed phenomena simply occur by chance (and that, as a consequence, the speculated agent has no effect) — the test will determine whether the hypothesis is right or wrong. This is why the hypothesis under test is often called the «null hypothesis» (most likely, coined by Fisher (1935, p.19)), because it is this hypothesis that is to be either nullified or not nullified by the test.
The consistent application by statisticians of Neyman and Pearson’s convention of representing «the hypothesis to be tested» (or «the hypothesis to be nullified«) with the expression Ho has led to circumstances where many understand the term «the null hypothesis» as meaning «the nil hypothesis» — a statement that the results in question have arisen through chance. This is not necessarily the case — the key restriction, as per Fisher (1966), is that «the null hypothesis must be exact, that is free from vagueness and ambiguity, because it must supply the basis of the ‘problem of distribution,’ of which the test of significance is the solution.«[8] As a consequence of this, in experimental science the null hypothesis is generally a statement that a particular treatment has no effect; in observational science, it is that there is no difference between the value of a particular measured variable, and that of an experimental prediction.
The extent to which the test in question shows that the «speculated hypothesis» has (or has not) been nullified is called its significance level; and the higher the significance level, the less likely it is that the phenomena in question could have been produced by chance alone. British statistician Sir Ronald Aylmer Fisher (1890–1962) stressed that the «null hypothesis»:
- …is never proved or established, but is possibly disproved, in the course of experimentation. Every experiment may be said to exist only in order to give the facts a chance of disproving the null hypothesis. (1935, p.19)
Bayes’s theorem
The probability that an observed positive result is a false positive (as contrasted with an observed positive result being a true positive) may be calculated using Bayes’s theorem.
The key concept of Bayes’s theorem is that the true rates of false positives and false negatives are not a function of the accuracy of the test alone, but also the actual rate or frequency of occurrence within the test population; and, often, the more powerful issue is the actual rates of the condition within the sample being tested.
Various proposals for further extension
Since the paired notions of Type I errors (or «false positives«) and Type II errors (or «false negatives«) that were introduced by Neyman and Pearson are now widely used, their choice of terminology («errors of the first kind» and «errors of the second kind«), has led others to suppose that certain sorts of mistake that they have identified might be an «error of the third kind«, «fourth kind«, etc.[9]
None of these proposed categories have met with any sort of wide acceptance. The following is a brief account of some of these proposals.
David
Florence Nightingale David (1909-1993),[3] a sometime colleague of both Neyman and Pearson at the University College London, making a humorous aside at the end of her 1947 paper, suggested that, in the case of her own research, perhaps Neyman and Pearson’s «two sources of error» could be extended to a third:
- I have been concerned here with trying to explain what I believe to be the basic ideas [of my «theory of the conditional power functions»], and to forestall possible criticism that I am falling into error (of the third kind) and am choosing the test falsely to suit the significance of the sample. (1947), p.339)
Mosteller
In 1948, Frederick Mosteller (1916-)[10] argued that a «third kind of error» was required to describe circumstances he had observed, namely:
- Type I error: «rejecting the null hypothesis when it is true«.
- Type II error: «accepting the null hypothesis when it is false«.
- Type III error: «correctly rejecting the null hypothesis for the wrong reason«. (1948, p.61)
Kaiser
In his 1966 paper, Henry F. Kaiser (1927-1992) extended Mosteller’s classification such that an error of the third kind entailed an incorrect decision of direction following a rejected two-tailed test of hypothesis. In his discussion (1966, pp.162-163), Kaiser also speaks of α errors, β errors, and γ errors for type I, type II and type III errors respectively.
Kimball
In 1957, Allyn W. Kimball, a statistician with the Oak Ridge National Laboratory, proposed a different kind of error to stand beside «the first and second types of error in the theory of testing hypotheses«. Kimball defined this new «error of the third kind» as being «the error committed by giving the right answer to the wrong problem» (1957, p.134).
Mathematician Richard Hamming (1915-1998) expressed his view that «It is better to solve the right problem the wrong way than to solve the wrong problem the right way«.
The famous Harvard economist Howard Raiffa describes an occasion when he, too, «fell into the trap of working on the wrong problem» (1968, pp.264-265).[11]
Mitroff and Featheringham
In 1974, Ian Mitroff and Tom Featheringham extended Kimball’s category, arguing that «one of the most important determinants of a problem’s solution is how that problem has been represented or formulated in the first place«.
They defined type III errors as either «the error… of having solved the wrong problem… when one should have solved the right problem» or «the error… [of] choosing the wrong problem representation… when one should have… chosen the right problem representation» (1974), p.383).
Raiffa
In 1969, the Harvard economist Howard Raiffa jokingly suggested «a candidate for the error of the fourth kind: solving the right problem too late» (1968, p.264).
Marascuilo and Levin
In 1970, Marascuilo and Levin proposed a «fourth kind of error» — a «Type IV error» — which they defined in a Mosteller-like manner as being the mistake of «the incorrect interpretation of a correctly rejected hypothesis«; which, they suggested, was the equivalent of «a physician’s correct diagnosis of an ailment followed by the prescription of a wrong medicine» (1970, p.398).
Usage examples
Statistical tests always involve a trade-off between:
- (a) the acceptable level of false positives (in which a non-match is declared to be a match) and
- (b) the acceptable level of false negatives (in which an actual match is not detected).
A threshold value can be varied to make the test more restrictive or more sensitive; with the more restrictive tests increasing the risk of rejecting true positives, and the more sensitive tests increasing the risk of accepting false positives.
Computers
The notions of «false positives» and «false negatives» have a wide currency in the realm of computers and computer applications.
Computer security
Security vulnerabilities are an important consideration in the task of keeping all computer data safe, while maintaining access to that data for appropriate users (see computer security, computer insecurity). Moulton (1983), stresses the importance of:
- avoiding the type I errors (or false positive) that classify authorized users as imposters.
- avoiding the type II errors (or false negatives) that classify imposters as authorized users (1983, p.125).
Spam filtering
A false positive occurs when «spam filtering» or «spam blocking» techniques wrongly classify a legitimate email message as spam and, as a result, interferes with its delivery. While most anti-spam tactics can block or filter a high percentage of unwanted emails, doing so without creating significant false-positive results is a much more demanding task.
A false negative occurs when a spam email is not detected as spam, but is classified as «non-spam«. A low number of false negatives is an indicator of the efficiency of «spam filtering» methods.
Malware
The term false positive is also used when antivirus software wrongly classifies an innocuous file as a virus. The incorrect detection may be due to heuristics or to an incorrect virus signature in a database. Similar problems can occur with antitrojan or antispyware software.
Computer database searching
In computer database searching, false positives are documents that are rejected by a search despite their relevance to the search question. False Negatives are documents that are retrieved by a search despite their irrelevance to the search question. False negatives are common in full text searching, in which the search algorithm examines all of the text in all of the stored documents and tries to match one or more of the search terms that have been supplied by the user. Consider how this relates to spam filtering — it is more severe to not retrieve a document you want than to retrieve a document you don’t want.
Most false positives can be attributed to the deficiencies of natural language, which is often ambiguous: e.g., the term «home» may mean «a person’s dwelling» or «the main or top-level page in a Web site».[12]
Optical character recognition (OCR)
Detection algorithms of all kinds often create false positives. Optical character recognition (OCR) software may detect an «a» where there are only some dots that appear to be an «a» to the algorithm being used.
Security screening
False positives are routinely found every day in airport security screening. The installed security alarms are intended to prevent weapons being brought onto aircraft; yet they are often set to such high sensitivity that they alarm many times a day for minor items, such as keys, belt buckles, loose change, mobile phones, and tacks in shoes (see explosive detection, metal detector.)
The ratio of false positives (identifying an innocent traveller as a terrorist) to true positives (detecting a would-be terrorist) is, therefore, very high; and because almost every alarm is a false positive, the positive predictive value of these screening tests is very low.
Biometrics
Biometric verification, such as for fingerprint, facial recognition or
iris recognition, is susceptible to type I and type II errors. The standard
biometric terminology for these errors are:
- False Positive (type I) — False Accept Rate (FAR) or False Match Rate (FMR)
- False Negative (type II) — False Reject Rate (FRR) or False Non-match Rate (FNMR)
The FAR may also be an abbreviation for the false alarm rate, depending on whether
the biometric system is designed to allow access or to recognize suspects. The FAR is
considered to be a measure of the security of the system, while the FRR measures the
inconvenience level for users. For many systems, the FRR is largely caused by low quality
images, due to incorrect positioning or illumination. The terminology FMR/FNMR is sometimes
preferred to FAR/FRR because the former measure the rates for each biometric comparison, while the
latter measure the application performance (ie. three tries may be permitted).
Several limitations should be noted for the use of these measures for biometric systems:
- (a) The system performance depends dramatically on the composition of the test database
- (b) The system performance measured in this way is the zero-effort error rate. Attackers prepared to use active techniques such as spoofing will decrease FAR.
- (c) Such error rates only apply properly to biometric verification (or one-to-one matching)systems. The performance of biometric identification or watch-list systems is measured with other indices (such as the cumulative match curve (CMC))
Medical screening
In the practice of medicine, there is a significant difference between the applications of screening and testing:
- Screening involves relatively cheap tests that are given to large populations, none of whom manifest any clinical indication of disease (e.g., Pap smears).
- Testing involves far more expensive, often invasive, procedures that are given only to those who manifest some clinical indication of disease, and are most often applied to confirm a suspected diagnosis.
For example, most States in the USA require newborns to be screened for phenylketonuria and hypothyroidism, among other congenital disorders. Although they display a high rate of false positives, the screening tests are considered valuable because they greatly increase the likelihood of detecting these disorders at a far earlier stage.[13]
The simple blood tests used to screen possible blood donors for HIV and hepatitis have a significant rate of false positives; however, physicians use much more expensive and far more precise tests to determine whether a person is actually infected with either of these viruses.
Perhaps the most widely discussed false positives in medical screening come from the breast cancer screening procedure mammography. The US rate of false positive mammograms is up to 15%, the highest in world.[14] The lowest rate in the world is in the Netherlands, 1%.[15]
Therefore if one decides to use a medical test for population screening purposes, the test must be so engineered as to be cheap, easy to administer, and not produce any false-negatives, if possible. Such tests usually produce more false-positives, which can subsequently be sorted out by more sophisticated (and expensive) testing.
Medical testing
False negatives and False positives are significant issues in medical testing.
False negatives may provide a falsely reassuring message to patients and physicians that disease is absent, when it is actually present. This sometimes leads to inappropriate or inadequate treatment of both the patient and their disease. A common example is relying on cardiac stress tests to detect coronary atherosclerosis, even though cardiac stress tests are known to only detect limitations of coronary artery blood flow due to advanced stenosis.
False negatives produce serious and counter-intuitive problems, especially when the condition being searched for is common. If a test with a false negative rate of only 10%, is used to test a population with a true occurrence rate of 70%, many of the «negatives» detected by the test will be false. (See Bayes’ theorem)
False positives can also produce serious and counter-intuitive problems when the condition being searched for is rare, as in screening. If a test has a false positive rate of one in ten thousand, but only one in a million samples (or people) is a true positive, most of the «positives» detected by that test will be false.[16]
Paranormal investigation
The notion of a false positive has been adopted by those who investigate paranormal or ghost phenomena to describe a photograph, or recording, or some other evidence that incorrectly appears to have a paranormal origin — in this usage, a false positive is a disproven piece of media «evidence» (image, movie, audio recording, etc.) that has a normal explanation.[17]
See also
- Prosecutor’s fallacy
- Free text search
- Information retrieval performance measures
- Negative information
- Jerzy Neyman
- Neyman-Pearson lemma
- Null hypothesis
- Odds ratio
- Egon Pearson
- Receiver-operator characteristic
- Search engine
- Sensitivity testing
- Spam filtering
- Specificity
- Statisticians’ and engineers’ cross-reference of statistical terms
Notes
- ↑ Excluding other sorts of intentional misrepresentation such as fraud. See Allchin (2001) for an extensive discussion of errors in science.
- ↑ 2.0 2.1 The magnitude of the error is contingent upon the amount by which the observation differs from its expected value.
- ↑ Namely, at Neyman & Pearson, 1933/1967, p.190.
- ↑ The convention is to write these as type I and type II respectively; not as type-I and type-II (or type 1 and type 2).
- ↑ Note that this terminology may be confusing; it fails to differentiate clearly between a positive test result and a positive unit (i.e., one has the condition). Consequently, to avoid ambiguity, it may be better to use the terms sensitivity and specificity to refer to the proportion of accurate results in the separate groups of genuinely negative and genuinely positive units.
- ↑ When developing detection algorithms or tests, a balance must be chosen between risks of false negatives and false positives. Usually there is a threshold of how close a match to a given sample must be achieved before the algorithm reports a match. The higher this threshold, the more false negatives and the fewer false positives.
- ↑ Note that this terminology may be confusing; it fails to differentiate clearly between a positive test result and a positive unit (i.e., one which actually has the condition). Consequently, to avoid ambiguity, it may be better to use the terms sensitivity and specificity to refer to the proportion of accurate results in the separate groups of genuinely positive and genuinely negative units.
- ↑ Fisher, R.A. (1966). The design of experiments. 8th edition. Hafner:Edinburgh.
- ↑ For example, Onwuegbuzie & Daniel (2003) claim to have identified an additional eight kinds of error.
- ↑ The 1981 President of the American Association for the Advancement of Science [1]
- ↑ Note that Raiffa, from his imperfect recollection, incorrectly attributed this «error of the third kind» to John Tukey (1915-2000).
- ↑ The false positive rate can be reduced by using a controlled vocabulary. However, this solution is expensive; because the vocabulary must be developed by an expert, and must be applied to documents by trained indexers.
- ↑ In relation to this newborn screening, recent studies have shown that there are more than 12 times more false positives than correct screens (Gambrill, 2006. [2])
- ↑ One consequence of the high false positive rate in the US is that, in any 10 year period, half of the American women screened receive a false positive mammogram. False positive mammograms are costly, with over $100 million spent annually in the US on follow-up testing and treatment. They also cause women unneeded anxiety. As a result of the high false positive rate in the US, as many as 90-95% of women who get a positive mammogram do not have the condition.
- ↑ The lowest rates are generally in Northern Europe where mammography films are read twice and a high threshold for additional testing is set (the high threshold decreases the power of the test).
- ↑ The probability that an observed positive result is a false positive may be calculated using Bayes’ theorem.
- ↑ Several sites provide examples of false positives, including The Atlantic Paranormal Society (TAPS) and Moorestown Ghost Research.
References
- Allchin, D., «Error Types», Perspectives on Science, Vol.9, No.1, (Spring 2001), pp.38-58.
- Betz, M.A. & Gabriel, K.R., «Type IV Errors and Analysis of Simple Effects», Journal of Educational Statistics, Vol.3, No.2, (Summer 1978), pp.121-144.
- David, F.N., «A Power Function for Tests of Randomness in a Sequence of Alternatives», Biometrika, Vol.34, Nos.3/4, (December 1947), pp.335-339.
- David, F.N., Probability Theory for Statistical Methods, Cambridge University Press, (Cambridge), 1949.
- Fisher, R.A., The Design of Experiments, Oliver & Boyd (Edinburgh), 1935.
- Gambrill, W., «False Positives on Newborns’ Disease Tests Worry Parents», Health Day, (5 June 2006). 34471.html
- Kaiser, H.F., «Directional Statistical Decisions», Psychological Review, Vol.67, No.3, (May 1960), pp.160-167.
- Kimball, A.W., «Errors of the Third Kind in Statistical Consulting», Journal of the American Statistical Association, Vol.52, No.278, (June 1957), pp.133-142.
- Lubin, A., «The Interpretation of Significant Interaction», Educational and Psychological Measurement, Vol.21, No.4, (Winter 1961), pp.807-817.
- Marascuilo, L.A. & Levin, J.R., «Appropriate Post Hoc Comparisons for Interaction and nested Hypotheses in Analysis of Variance Designs: The Elimination of Type-IV Errors», American Educational Research Journal, Vol.7., No.3, (May 1970), pp.397-421.
- Mitroff, I.I. & Featheringham, T.R., «On Systemic Problem Solving and the Error of the Third Kind», Behavioral Science, Vol.19, No.6, (November 1974), pp.383-393.
- Mosteller, F., «A k-Sample Slippage Test for an Extreme Population», The Annals of Mathematical Statistics, Vol.19, No.1, (March 1948), pp.58-65.
- Moulton, R.T., “Network Security”, Datamation, Vol.29, No.7, (July 1983), pp.121-127.
- Neyman, J. & Pearson, E.S., «On the Use and Interpretation of Certain Test Criteria for Purposes of Statistical Inference, Part I», reprinted at pp.1-66 in Neyman, J. & Pearson, E.S., Joint Statistical Papers, Cambridge University Press, (Cambridge), 1967 (originally published in 1928).
- Neyman, J. & Pearson, E.S., «The testing of statistical hypotheses in relation to probabilities a priori», reprinted at pp.186-202 in Neyman, J. & Pearson, E.S., Joint Statistical Papers, Cambridge University Press, (Cambridge), 1967 (originally published in 1933).
- Onwuegbuzie, A.J. & Daniel, L. G. «Typology of Analytical and Interpretational Errors in Quantitative and Qualitative Educational Research», Current Issues in Education, Vol.6, No.2, (19 February 2003).[4]
- Pearson, E.S. & N eyman, J., «On the Problem of Two Samples», reprinted at pp.99-115 in Neyman, J. & Pearson, E.S., Joint Statistical Papers, Cambridge University Press, (Cambridge), 1967 (originally published in 1930).
- Raiffa, H., Decision Analysis: Introductory Lectures on Choices Under Uncertainty, Addison-Wesley, (Reading), 1968.
External links
- Free Beta (Type II Error Rate) Calculator for Multiple Regression from Daniel Soper’s Free Statistics Calculators website. Computes the beta level for a study (i.e., the Type II error rate), given the observed alpha level, the number of predictors, the observed R-square, and the sample size.
- Bias and Confounding — presentation by Nigel Paneth, Graduate School of Public Health, University of Pittsburgh
- False Positives — Briefing paper on False Positives
|
v·d·e Statistics |
|
|---|---|
| Descriptive statistics |
Mean (Arithmetic, Geometric) — Median — Mode — Power — Variance — Standard deviation |
| Inferential statistics |
Hypothesis testing — Significance — Null hypothesis/Alternate hypothesis — Error — Z-test — Student’s t-test — Maximum likelihood — Standard score/Z score — P-value — Analysis of variance |
| Survival analysis |
Survival function — Kaplan-Meier — Logrank test — Failure rate — Proportional hazards models |
| Probability distributions |
Normal (bell curve) — Poisson — Bernoulli |
| Correlation |
Confounding variable — Pearson product-moment correlation coefficient — Rank correlation (Spearman’s rank correlation coefficient, Kendall tau rank correlation coefficient) |
| Regression analysis |
Linear regression — Nonlinear regression — Logistic regression |
Assessment |
Biopsychology |
Comparative |
Cognitive |
Developmental |
Language |
Individual differences |
Personality |
Philosophy |
Social |
Methods |
Statistics |
Clinical |
Educational |
Industrial |
Professional items |
World psychology |
Statistics:
Scientific method ·
Research methods ·
Experimental design ·
Undergraduate statistics courses ·
Statistical tests ·
Game theory ·
Decision theory
Type I errors (or α error, or false positive) and type II errors (β error, or a false negative) are two terms used to describe statistical errors.
Statistical error vs. systematic error
Scientists recognize two different sorts of error:[1]
- Statistical error: the difference between a computed, estimated, or measured value and the true, specified, or theoretically correct value (see errors and residuals in statistics) that is caused by random, and inherently unpredictable fluctuations in the measurement apparatus.[2]
- Systematic error: the difference between a computed, estimated, or measured value and the true, specified, or theoretically correct value that is caused by non-random fluctuations from an unknown source (see uncertainty), and which, once identified, can usually be eliminated.[2]
Statistical error: Type I and Type II
Statisticians speak of two significant sorts of statistical error. The context is that there is a «null hypothesis» which corresponds to a presumed default «state of nature», e.g., that an individual is free of disease, that an accused is innocent, or that a potential login candidate is not authorized. Corresponding to the null hypothesis is an «alternative hypothesis» which corresponds to the opposite situation, that is, that the individual has the disease, that the accused is guilty, or that the login candidate is an authorized user. The goal is to determine accurately if the null hypothesis can be discarded in favor of the alternative. A test of some sort is conducted (a blood test, a legal trial, a login attempt), and data is obtained. The result of the test may be negative (that is, it does not indicate disease, guilt, or authorized identity). On the other hand, it may be positive (that is, it may indicate disease, guilt, or identity). If the result of the test does not correspond with the actual state of nature, then an error has occurred, but if the result of the test corresponds with the actual state of nature, then a correct decision has been made. There are two kinds of error, classified as «Type I error» and «Type II error,» depending upon which hypothesis has incorrectly been identified as the true state of nature.
Type I error
Type I error, also known as an «error of the first kind«, an α error, or a «false positive«: the error of rejecting a null hypothesis when it is actually true. Plainly speaking, it occurs when we are observing a difference when in truth there is none.
A false positive normally means that a test claims something to be positive, when that is not the case. For example, a pregnancy test with a positive result (indicating that the person taking the test is pregnant) has produced a false positive in the case where the person is not pregnant.
Type II error
Type II error, also known as an «error of the second kind«, a β error, or a «false negative«: the error of failing to reject a null hypothesis when the alternative hypothesis is the true state of nature. In other words, this is the error of failing to observe a difference when in truth there is one. This type of error can only occur when the statistician fails to reject the null hypothesis.
See Various proposals for further extension, below, for additional terminology.
Understanding Type I and Type II errors
Hypothesis testing is the art of testing whether a variation between two sample distributions can be explained by chance or not. In many practical applications Type I errors are more delicate than Type II errors. In these cases, care is usually focused on minimizing the occurrence of this statistical error. Suppose, the probability for a Type I error is 1% or 5%, then there is a 1% or 5% chance that the observed variation is not true. This is called the level of significance. While 1% or 5% might be an acceptable level of significance for one application, a different application can require a very different level. For example, the standard goal of six sigma is to achieve exactness by 4.5 standard deviations above or below the mean. That is, for a normally distributed process only 3.4 parts per million are allowed to be deficient. The probability of Type I error is generally denoted with the Greek letter alpha.
Etymology
In 1928, Jerzy Neyman (1894-1981) and Egon Pearson (1895-1980), both eminent statisticians, discussed the problems associated with «deciding whether or not a particular sample may be judged as likely to have been randomly drawn from a certain population» (1928/1967, p.1): and, as David remarked, «it is necessary to remember the adjective ‘random’ [in the term ‘random sample’] should apply to the method of drawing the sample and not to the sample itself» (1949, p.28).
They identified «two sources of error«, namely:
- (a) the error of rejecting a hypothesis that should have been accepted, and
- (b) the error of accepting a hypothesis that should have been rejected (1928/1967, p.31).
In 1930, they elaborated on these two sources of error, remarking that:
-
- …in testing hypotheses two considerations must be kept in view, (1) we must be able to reduce the chance of rejecting a true hypothesis to as low a value as desired; (2) the test must be so devised that it will reject the hypothesis tested when it is likely to be false (1930/1967, p.100).
In 1933, they observed that these «problems are rarely presented in such a form that we can discriminate with certainty between the true and false hypothesis» (p.187). They also noted that, in deciding whether to accept or reject a particular hypothesis amongst a «set of alternative hypotheses» (p.201), it was easy to make an error:
- …[and] these errors will be of two kinds:
- (I) we reject H0 [i.e., the hypothesis to be tested] when it is true,
- (II) we accept H0 when some alternative hypothesis Hi is true. (1933/1967, p.187)
In all of the papers co-written by Neyman and Pearson the expression H0 always signifies «the hypothesis to be tested» (see, for example, 1933/1967, p.186).
In the same paper[3] they call these two sources of error, errors of type I and errors of type II respectively.[4]
Statistical treatment
Definitions
Type I and type II errors
Over time, the notion of these two sources of error has been universally accepted. They are now routinely known as type I errors and type II errors. For obvious reasons, they are very often referred to as false positives and false negatives respectively. The terms are now commonly applied in much wider and far more general sense than Neyman and Pearson’s original specific usage, as follows:
- Type I errors (the «false positive«): the error of rejecting the null hypothesis given that it is actually true; e.g., A court finding a person guilty of a crime that they did not actually commit.
- Type II errors (the «false negative«): the error of failing to reject the null hypothesis given that the alternative hypothesis is actually true; e.g., A court finding a person not guilty of a crime that they did actually commit.
These examples illustrate the ambiguity, which is one of the dangers of this wider use: They assume the speaker is testing for guilt; they could also be used in reverse, as testing for innocence; or two tests could be involved, one for guilt, the other for innocence. (This ambiguity is one reason for the Scottish legal system’s third possible verdict: not proven.)
The following tables illustrate the conditions.
| Actual condition | |||
|---|---|---|---|
| Present | Absent | ||
| Test result |
Positive | Condition Present + Positive result = True Positive | Condition absent + Positive result = False Positive Type I error |
| Negative | Condition present + Negative result = False (invalid) Negative Type II error |
Condition absent + Negative result = True (accurate) Negative |
Example, using infectious disease test results:
| Actual condition | |||
|---|---|---|---|
| Infected | Not infected | ||
| Test result | Test shows «infected» | True Positive | False Positive (i.e. infection reported but not present) Type I error |
| Test shows «not infected» | False Negative (i.e. infection not detected) Type II error |
True Negative |
Example, testing for guilty/not-guilty:
| Actual condition | |||
|---|---|---|---|
| Guilty | Not guilty | ||
| Test result | Verdict of «guilty» | True Positive | False Positive (i.e. guilt reported unfairly) Type I error |
| Verdict of «not guilty» | False Negative (i.e. guilt not detected) Type II error |
True Negative |
Example, testing for innocent/not innocent – sense is reversed from previous example:
| Actual condition | |||
|---|---|---|---|
| Innocent | Not innocent | ||
| Test result | Judged «innocent» | True Positive | False Positive (i.e. guilty but not caught) Type I error |
| Judged «not innocent» | False Negative (i.e. innocent but condemned) Type II error |
True Negative |
Note that, when referring to test results, the terms true and false are used in two different ways: the state of the actual condition (true=present versus false=absent); and the accuracy or inaccuracy of the test result (true positive, false positive, true negative, false negative). This is confusing to some readers. To clarify the examples above, we have used present/absent rather than true/false to refer to the actual condition being tested.
False positive rate
The false positive rate is the proportion of negative instances that were erroneously reported as being positive.
It is equal to 1 minus the specificity of the test. This is equivalent to saying the false positive rate is equal to the significance level.
[5]
In statistical hypothesis testing, this fraction is given the symbol α, and is defined as the specificity of the test. Increasing the specificity of the test lowers the probability of type I errors, but raises the probability of type II errors (false negatives that reject the alternative hypothesis when it is true).[6]
False negative rate
The false negative rate is the proportion of positive instances that were erroneously reported as negative.
It is equal to 1 minus the «power» of the test.[7]
In statistical hypothesis testing, this fraction is given the symbol β.
The null hypothesis
- Main article: Null hypothesis
It is standard practice for statisticians to conduct tests in order to determine whether or not a «speculative hypothesis» concerning the observed phenomena of the world (or its inhabitants) can be supported. The results of such testing determine whether a particular set of results agrees reasonably (or does not agree) with the speculated hypothesis.
On the basis that it is always assumed, by statistical convention, that the speculated hypothesis is wrong — and that the observed phenomena simply occur by chance (and that, as a consequence, the speculated agent has no effect) — the test will determine whether the hypothesis is right or wrong. This is why the hypothesis under test is often called the «null hypothesis» (most likely, coined by Fisher (1935, p.19)), because it is this hypothesis that is to be either nullified or not nullified by the test.
The consistent application by statisticians of Neyman and Pearson’s convention of representing «the hypothesis to be tested» (or «the hypothesis to be nullified«) with the expression Ho has led to circumstances where many understand the term «the null hypothesis» as meaning «the nil hypothesis» — a statement that the results in question have arisen through chance. This is not necessarily the case — the key restriction, as per Fisher (1966), is that «the null hypothesis must be exact, that is free from vagueness and ambiguity, because it must supply the basis of the ‘problem of distribution,’ of which the test of significance is the solution.«[8] As a consequence of this, in experimental science the null hypothesis is generally a statement that a particular treatment has no effect; in observational science, it is that there is no difference between the value of a particular measured variable, and that of an experimental prediction.
The extent to which the test in question shows that the «speculated hypothesis» has (or has not) been nullified is called its significance level; and the higher the significance level, the less likely it is that the phenomena in question could have been produced by chance alone. British statistician Sir Ronald Aylmer Fisher (1890–1962) stressed that the «null hypothesis»:
- …is never proved or established, but is possibly disproved, in the course of experimentation. Every experiment may be said to exist only in order to give the facts a chance of disproving the null hypothesis. (1935, p.19)
Bayes’s theorem
The probability that an observed positive result is a false positive (as contrasted with an observed positive result being a true positive) may be calculated using Bayes’s theorem.
The key concept of Bayes’s theorem is that the true rates of false positives and false negatives are not a function of the accuracy of the test alone, but also the actual rate or frequency of occurrence within the test population; and, often, the more powerful issue is the actual rates of the condition within the sample being tested.
Various proposals for further extension
Since the paired notions of Type I errors (or «false positives«) and Type II errors (or «false negatives«) that were introduced by Neyman and Pearson are now widely used, their choice of terminology («errors of the first kind» and «errors of the second kind«), has led others to suppose that certain sorts of mistake that they have identified might be an «error of the third kind«, «fourth kind«, etc.[9]
None of these proposed categories have met with any sort of wide acceptance. The following is a brief account of some of these proposals.
David
Florence Nightingale David (1909-1993),[3] a sometime colleague of both Neyman and Pearson at the University College London, making a humorous aside at the end of her 1947 paper, suggested that, in the case of her own research, perhaps Neyman and Pearson’s «two sources of error» could be extended to a third:
- I have been concerned here with trying to explain what I believe to be the basic ideas [of my «theory of the conditional power functions»], and to forestall possible criticism that I am falling into error (of the third kind) and am choosing the test falsely to suit the significance of the sample. (1947), p.339)
Mosteller
In 1948, Frederick Mosteller (1916-)[10] argued that a «third kind of error» was required to describe circumstances he had observed, namely:
- Type I error: «rejecting the null hypothesis when it is true«.
- Type II error: «accepting the null hypothesis when it is false«.
- Type III error: «correctly rejecting the null hypothesis for the wrong reason«. (1948, p.61)
Kaiser
In his 1966 paper, Henry F. Kaiser (1927-1992) extended Mosteller’s classification such that an error of the third kind entailed an incorrect decision of direction following a rejected two-tailed test of hypothesis. In his discussion (1966, pp.162-163), Kaiser also speaks of α errors, β errors, and γ errors for type I, type II and type III errors respectively.
Kimball
In 1957, Allyn W. Kimball, a statistician with the Oak Ridge National Laboratory, proposed a different kind of error to stand beside «the first and second types of error in the theory of testing hypotheses«. Kimball defined this new «error of the third kind» as being «the error committed by giving the right answer to the wrong problem» (1957, p.134).
Mathematician Richard Hamming (1915-1998) expressed his view that «It is better to solve the right problem the wrong way than to solve the wrong problem the right way«.
The famous Harvard economist Howard Raiffa describes an occasion when he, too, «fell into the trap of working on the wrong problem» (1968, pp.264-265).[11]
Mitroff and Featheringham
In 1974, Ian Mitroff and Tom Featheringham extended Kimball’s category, arguing that «one of the most important determinants of a problem’s solution is how that problem has been represented or formulated in the first place«.
They defined type III errors as either «the error… of having solved the wrong problem… when one should have solved the right problem» or «the error… [of] choosing the wrong problem representation… when one should have… chosen the right problem representation» (1974), p.383).
Raiffa
In 1969, the Harvard economist Howard Raiffa jokingly suggested «a candidate for the error of the fourth kind: solving the right problem too late» (1968, p.264).
Marascuilo and Levin
In 1970, Marascuilo and Levin proposed a «fourth kind of error» — a «Type IV error» — which they defined in a Mosteller-like manner as being the mistake of «the incorrect interpretation of a correctly rejected hypothesis«; which, they suggested, was the equivalent of «a physician’s correct diagnosis of an ailment followed by the prescription of a wrong medicine» (1970, p.398).
Usage examples
Statistical tests always involve a trade-off between:
- (a) the acceptable level of false positives (in which a non-match is declared to be a match) and
- (b) the acceptable level of false negatives (in which an actual match is not detected).
A threshold value can be varied to make the test more restrictive or more sensitive; with the more restrictive tests increasing the risk of rejecting true positives, and the more sensitive tests increasing the risk of accepting false positives.
Computers
The notions of «false positives» and «false negatives» have a wide currency in the realm of computers and computer applications.
Computer security
Security vulnerabilities are an important consideration in the task of keeping all computer data safe, while maintaining access to that data for appropriate users (see computer security, computer insecurity). Moulton (1983), stresses the importance of:
- avoiding the type I errors (or false positive) that classify authorized users as imposters.
- avoiding the type II errors (or false negatives) that classify imposters as authorized users (1983, p.125).
Spam filtering
A false positive occurs when «spam filtering» or «spam blocking» techniques wrongly classify a legitimate email message as spam and, as a result, interferes with its delivery. While most anti-spam tactics can block or filter a high percentage of unwanted emails, doing so without creating significant false-positive results is a much more demanding task.
A false negative occurs when a spam email is not detected as spam, but is classified as «non-spam«. A low number of false negatives is an indicator of the efficiency of «spam filtering» methods.
Malware
The term false positive is also used when antivirus software wrongly classifies an innocuous file as a virus. The incorrect detection may be due to heuristics or to an incorrect virus signature in a database. Similar problems can occur with antitrojan or antispyware software.
Computer database searching
In computer database searching, false positives are documents that are rejected by a search despite their relevance to the search question. False Negatives are documents that are retrieved by a search despite their irrelevance to the search question. False negatives are common in full text searching, in which the search algorithm examines all of the text in all of the stored documents and tries to match one or more of the search terms that have been supplied by the user. Consider how this relates to spam filtering — it is more severe to not retrieve a document you want than to retrieve a document you don’t want.
Most false positives can be attributed to the deficiencies of natural language, which is often ambiguous: e.g., the term «home» may mean «a person’s dwelling» or «the main or top-level page in a Web site».[12]
Optical character recognition (OCR)
Detection algorithms of all kinds often create false positives. Optical character recognition (OCR) software may detect an «a» where there are only some dots that appear to be an «a» to the algorithm being used.
Security screening
False positives are routinely found every day in airport security screening. The installed security alarms are intended to prevent weapons being brought onto aircraft; yet they are often set to such high sensitivity that they alarm many times a day for minor items, such as keys, belt buckles, loose change, mobile phones, and tacks in shoes (see explosive detection, metal detector.)
The ratio of false positives (identifying an innocent traveller as a terrorist) to true positives (detecting a would-be terrorist) is, therefore, very high; and because almost every alarm is a false positive, the positive predictive value of these screening tests is very low.
Biometrics
Biometric verification, such as for fingerprint, facial recognition or
iris recognition, is susceptible to type I and type II errors. The standard
biometric terminology for these errors are:
- False Positive (type I) — False Accept Rate (FAR) or False Match Rate (FMR)
- False Negative (type II) — False Reject Rate (FRR) or False Non-match Rate (FNMR)
The FAR may also be an abbreviation for the false alarm rate, depending on whether
the biometric system is designed to allow access or to recognize suspects. The FAR is
considered to be a measure of the security of the system, while the FRR measures the
inconvenience level for users. For many systems, the FRR is largely caused by low quality
images, due to incorrect positioning or illumination. The terminology FMR/FNMR is sometimes
preferred to FAR/FRR because the former measure the rates for each biometric comparison, while the
latter measure the application performance (ie. three tries may be permitted).
Several limitations should be noted for the use of these measures for biometric systems:
- (a) The system performance depends dramatically on the composition of the test database
- (b) The system performance measured in this way is the zero-effort error rate. Attackers prepared to use active techniques such as spoofing will decrease FAR.
- (c) Such error rates only apply properly to biometric verification (or one-to-one matching)systems. The performance of biometric identification or watch-list systems is measured with other indices (such as the cumulative match curve (CMC))
Medical screening
In the practice of medicine, there is a significant difference between the applications of screening and testing:
- Screening involves relatively cheap tests that are given to large populations, none of whom manifest any clinical indication of disease (e.g., Pap smears).
- Testing involves far more expensive, often invasive, procedures that are given only to those who manifest some clinical indication of disease, and are most often applied to confirm a suspected diagnosis.
For example, most States in the USA require newborns to be screened for phenylketonuria and hypothyroidism, among other congenital disorders. Although they display a high rate of false positives, the screening tests are considered valuable because they greatly increase the likelihood of detecting these disorders at a far earlier stage.[13]
The simple blood tests used to screen possible blood donors for HIV and hepatitis have a significant rate of false positives; however, physicians use much more expensive and far more precise tests to determine whether a person is actually infected with either of these viruses.
Perhaps the most widely discussed false positives in medical screening come from the breast cancer screening procedure mammography. The US rate of false positive mammograms is up to 15%, the highest in world.[14] The lowest rate in the world is in the Netherlands, 1%.[15]
Therefore if one decides to use a medical test for population screening purposes, the test must be so engineered as to be cheap, easy to administer, and not produce any false-negatives, if possible. Such tests usually produce more false-positives, which can subsequently be sorted out by more sophisticated (and expensive) testing.
Medical testing
False negatives and False positives are significant issues in medical testing.
False negatives may provide a falsely reassuring message to patients and physicians that disease is absent, when it is actually present. This sometimes leads to inappropriate or inadequate treatment of both the patient and their disease. A common example is relying on cardiac stress tests to detect coronary atherosclerosis, even though cardiac stress tests are known to only detect limitations of coronary artery blood flow due to advanced stenosis.
False negatives produce serious and counter-intuitive problems, especially when the condition being searched for is common. If a test with a false negative rate of only 10%, is used to test a population with a true occurrence rate of 70%, many of the «negatives» detected by the test will be false. (See Bayes’ theorem)
False positives can also produce serious and counter-intuitive problems when the condition being searched for is rare, as in screening. If a test has a false positive rate of one in ten thousand, but only one in a million samples (or people) is a true positive, most of the «positives» detected by that test will be false.[16]
Paranormal investigation
The notion of a false positive has been adopted by those who investigate paranormal or ghost phenomena to describe a photograph, or recording, or some other evidence that incorrectly appears to have a paranormal origin — in this usage, a false positive is a disproven piece of media «evidence» (image, movie, audio recording, etc.) that has a normal explanation.[17]
See also
- Prosecutor’s fallacy
- Free text search
- Information retrieval performance measures
- Negative information
- Jerzy Neyman
- Neyman-Pearson lemma
- Null hypothesis
- Odds ratio
- Egon Pearson
- Receiver-operator characteristic
- Search engine
- Sensitivity testing
- Spam filtering
- Specificity
- Statisticians’ and engineers’ cross-reference of statistical terms
Notes
- ↑ Excluding other sorts of intentional misrepresentation such as fraud. See Allchin (2001) for an extensive discussion of errors in science.
- ↑ 2.0 2.1 The magnitude of the error is contingent upon the amount by which the observation differs from its expected value.
- ↑ Namely, at Neyman & Pearson, 1933/1967, p.190.
- ↑ The convention is to write these as type I and type II respectively; not as type-I and type-II (or type 1 and type 2).
- ↑ Note that this terminology may be confusing; it fails to differentiate clearly between a positive test result and a positive unit (i.e., one has the condition). Consequently, to avoid ambiguity, it may be better to use the terms sensitivity and specificity to refer to the proportion of accurate results in the separate groups of genuinely negative and genuinely positive units.
- ↑ When developing detection algorithms or tests, a balance must be chosen between risks of false negatives and false positives. Usually there is a threshold of how close a match to a given sample must be achieved before the algorithm reports a match. The higher this threshold, the more false negatives and the fewer false positives.
- ↑ Note that this terminology may be confusing; it fails to differentiate clearly between a positive test result and a positive unit (i.e., one which actually has the condition). Consequently, to avoid ambiguity, it may be better to use the terms sensitivity and specificity to refer to the proportion of accurate results in the separate groups of genuinely positive and genuinely negative units.
- ↑ Fisher, R.A. (1966). The design of experiments. 8th edition. Hafner:Edinburgh.
- ↑ For example, Onwuegbuzie & Daniel (2003) claim to have identified an additional eight kinds of error.
- ↑ The 1981 President of the American Association for the Advancement of Science [1]
- ↑ Note that Raiffa, from his imperfect recollection, incorrectly attributed this «error of the third kind» to John Tukey (1915-2000).
- ↑ The false positive rate can be reduced by using a controlled vocabulary. However, this solution is expensive; because the vocabulary must be developed by an expert, and must be applied to documents by trained indexers.
- ↑ In relation to this newborn screening, recent studies have shown that there are more than 12 times more false positives than correct screens (Gambrill, 2006. [2])
- ↑ One consequence of the high false positive rate in the US is that, in any 10 year period, half of the American women screened receive a false positive mammogram. False positive mammograms are costly, with over $100 million spent annually in the US on follow-up testing and treatment. They also cause women unneeded anxiety. As a result of the high false positive rate in the US, as many as 90-95% of women who get a positive mammogram do not have the condition.
- ↑ The lowest rates are generally in Northern Europe where mammography films are read twice and a high threshold for additional testing is set (the high threshold decreases the power of the test).
- ↑ The probability that an observed positive result is a false positive may be calculated using Bayes’ theorem.
- ↑ Several sites provide examples of false positives, including The Atlantic Paranormal Society (TAPS) and Moorestown Ghost Research.
References
- Allchin, D., «Error Types», Perspectives on Science, Vol.9, No.1, (Spring 2001), pp.38-58.
- Betz, M.A. & Gabriel, K.R., «Type IV Errors and Analysis of Simple Effects», Journal of Educational Statistics, Vol.3, No.2, (Summer 1978), pp.121-144.
- David, F.N., «A Power Function for Tests of Randomness in a Sequence of Alternatives», Biometrika, Vol.34, Nos.3/4, (December 1947), pp.335-339.
- David, F.N., Probability Theory for Statistical Methods, Cambridge University Press, (Cambridge), 1949.
- Fisher, R.A., The Design of Experiments, Oliver & Boyd (Edinburgh), 1935.
- Gambrill, W., «False Positives on Newborns’ Disease Tests Worry Parents», Health Day, (5 June 2006). 34471.html
- Kaiser, H.F., «Directional Statistical Decisions», Psychological Review, Vol.67, No.3, (May 1960), pp.160-167.
- Kimball, A.W., «Errors of the Third Kind in Statistical Consulting», Journal of the American Statistical Association, Vol.52, No.278, (June 1957), pp.133-142.
- Lubin, A., «The Interpretation of Significant Interaction», Educational and Psychological Measurement, Vol.21, No.4, (Winter 1961), pp.807-817.
- Marascuilo, L.A. & Levin, J.R., «Appropriate Post Hoc Comparisons for Interaction and nested Hypotheses in Analysis of Variance Designs: The Elimination of Type-IV Errors», American Educational Research Journal, Vol.7., No.3, (May 1970), pp.397-421.
- Mitroff, I.I. & Featheringham, T.R., «On Systemic Problem Solving and the Error of the Third Kind», Behavioral Science, Vol.19, No.6, (November 1974), pp.383-393.
- Mosteller, F., «A k-Sample Slippage Test for an Extreme Population», The Annals of Mathematical Statistics, Vol.19, No.1, (March 1948), pp.58-65.
- Moulton, R.T., “Network Security”, Datamation, Vol.29, No.7, (July 1983), pp.121-127.
- Neyman, J. & Pearson, E.S., «On the Use and Interpretation of Certain Test Criteria for Purposes of Statistical Inference, Part I», reprinted at pp.1-66 in Neyman, J. & Pearson, E.S., Joint Statistical Papers, Cambridge University Press, (Cambridge), 1967 (originally published in 1928).
- Neyman, J. & Pearson, E.S., «The testing of statistical hypotheses in relation to probabilities a priori», reprinted at pp.186-202 in Neyman, J. & Pearson, E.S., Joint Statistical Papers, Cambridge University Press, (Cambridge), 1967 (originally published in 1933).
- Onwuegbuzie, A.J. & Daniel, L. G. «Typology of Analytical and Interpretational Errors in Quantitative and Qualitative Educational Research», Current Issues in Education, Vol.6, No.2, (19 February 2003).[4]
- Pearson, E.S. & N eyman, J., «On the Problem of Two Samples», reprinted at pp.99-115 in Neyman, J. & Pearson, E.S., Joint Statistical Papers, Cambridge University Press, (Cambridge), 1967 (originally published in 1930).
- Raiffa, H., Decision Analysis: Introductory Lectures on Choices Under Uncertainty, Addison-Wesley, (Reading), 1968.
External links
- Free Beta (Type II Error Rate) Calculator for Multiple Regression from Daniel Soper’s Free Statistics Calculators website. Computes the beta level for a study (i.e., the Type II error rate), given the observed alpha level, the number of predictors, the observed R-square, and the sample size.
- Bias and Confounding — presentation by Nigel Paneth, Graduate School of Public Health, University of Pittsburgh
- False Positives — Briefing paper on False Positives
|
v·d·e Statistics |
|
|---|---|
| Descriptive statistics |
Mean (Arithmetic, Geometric) — Median — Mode — Power — Variance — Standard deviation |
| Inferential statistics |
Hypothesis testing — Significance — Null hypothesis/Alternate hypothesis — Error — Z-test — Student’s t-test — Maximum likelihood — Standard score/Z score — P-value — Analysis of variance |
| Survival analysis |
Survival function — Kaplan-Meier — Logrank test — Failure rate — Proportional hazards models |
| Probability distributions |
Normal (bell curve) — Poisson — Bernoulli |
| Correlation |
Confounding variable — Pearson product-moment correlation coefficient — Rank correlation (Spearman’s rank correlation coefficient, Kendall tau rank correlation coefficient) |
| Regression analysis |
Linear regression — Nonlinear regression — Logistic regression |