Меню

Ошибка обобщения машинное обучение

From Wikipedia, the free encyclopedia

For supervised learning applications in machine learning and statistical learning theory, generalization error[1] (also known as the out-of-sample error[2] or the risk) is a measure of how accurately an algorithm is able to predict outcome values for previously unseen data. Because learning algorithms are evaluated on finite samples, the evaluation of a learning algorithm may be sensitive to sampling error. As a result, measurements of prediction error on the current data may not provide much information about predictive ability on new data. Generalization error can be minimized by avoiding overfitting in the learning algorithm. The performance of a machine learning algorithm is visualized by plots that show values of estimates of the generalization error through the learning process, which are called learning curves.

Definition[edit]

In a learning problem, the goal is to develop a function {displaystyle f_{n}({vec {x}})} that predicts output values y for each input datum {vec {x}}. The subscript n indicates that the function f_{n} is developed based on a data set of n data points. The generalization error or expected loss or risk I[f] of a particular function f over all possible values of {vec {x}} and y is the expected value of the loss function {displaystyle V(f)}:[3]

{displaystyle I[f]=int _{Xtimes Y}V(f({vec {x}}),y)rho ({vec {x}},y)d{vec {x}}dy,}

where {displaystyle rho ({vec {x}},y)} is the unknown joint probability distribution for {vec {x}} and y.

Without knowing the joint probability distribution rho , it is impossible to compute I[f]. Instead, we can compute the error on sample data, which is called empirical error (or empirical risk). Given n data points, the empirical error of a candidate function f is:

{displaystyle I_{n}[f]={frac {1}{n}}sum _{i=1}^{n}V(f({vec {x}}_{i}),y_{i})}

An algorithm is said to generalize if:

{displaystyle lim _{nrightarrow infty }I[f]-I_{n}[f]=0}

Of particular importance is the generalization error {displaystyle I[f_{n}]} of the data-dependent function f_{n} that is found by a learning algorithm based on the sample. Again, for an unknown probability distribution, {displaystyle I[f_{n}]} cannot be computed. Instead, the aim of many problems in statistical learning theory is to bound or characterize the difference of the generalization error and the empirical error in probability:

{displaystyle P_{G}=P(I[f_{n}]-I_{n}[f_{n}]leq epsilon )geq 1-delta _{n}}

That is, the goal is to characterize the probability {displaystyle 1-delta _{n}} that the generalization error is less than the empirical error plus some error bound epsilon (generally dependent on delta and n).
For many types of algorithms, it has been shown that an algorithm has generalization bounds if it meets certain stability criteria. Specifically, if an algorithm is symmetric (the order of inputs does not affect the result), has bounded loss and meets two stability conditions, it will generalize. The first stability condition, leave-one-out cross-validation stability, says that to be stable, the prediction error for each data point when leave-one-out cross validation is used must converge to zero as nrightarrow infty. The second condition, expected-to-leave-one-out error stability (also known as hypothesis stability if operating in the L_{1} norm) is met if the prediction on a left-out datapoint does not change when a single data point is removed from the training dataset.[4]

These conditions can be formalized as:

Leave-one-out cross-validation Stability[edit]

An algorithm L has {displaystyle CVloo} stability if for each n, there exists a {displaystyle beta _{CV}^{(n)}} and {displaystyle delta _{CV}^{(n)}} such that:

{displaystyle forall iin {1,...,n},mathbb {P} _{S}{|V(f_{S^{i}},z_{i})-V(f_{S},z_{i})|leq beta _{CV}^{(n)}}geq 1-delta _{CV}^{(n)}}

and {displaystyle beta _{CV}^{(n)}} and {displaystyle delta _{CV}^{(n)}} go to zero as n goes to infinity.[4]

Expected-leave-one-out error Stability[edit]

An algorithm L has Eloo_{err} stability if for each n there exists a beta_{EL}^m and a delta_{EL}^m such that:

{displaystyle forall iin {1,...,n},mathbb {P} _{S}left{left|I[f_{S}]-{frac {1}{n}}sum _{i=1}^{N}Vleft(f_{S^{i}},z_{i}right)right|leq beta _{EL}^{(n)}right}geq 1-delta _{EL}^{(n)}}

with {displaystyle beta _{EL}^{(n)}} and {displaystyle delta _{EL}^{(n)}} going to zero for nrightarrow infty .

For leave-one-out stability in the L_{1} norm, this is the same as hypothesis stability:

{displaystyle mathbb {E} _{S,z}[|V(f_{S},z)-V(f_{S^{i}},z)|]leq beta _{H}^{(n)}}

with {displaystyle beta _{H}^{(n)}} going to zero as n goes to infinity.[4]

Algorithms with proven stability[edit]

A number of algorithms have been proven to be stable and as a result have bounds on their generalization error. A list of these algorithms and the papers that proved stability is available here.

Relation to overfitting[edit]

This figure illustrates the relationship between overfitting and the generalization error I[fn] — IS[fn]. Data points were generated from the relationship y = x with white noise added to the y values. In the left column, a set of training points is shown in blue. A seventh order polynomial function was fit to the training data. In the right column, the function is tested on data sampled from the underlying joint probability distribution of x and y. In the top row, the function is fit on a sample dataset of 10 datapoints. In the bottom row, the function is fit on a sample dataset of 100 datapoints. As we can see, for small sample sizes and complex functions, the error on the training set is small but error on the underlying distribution of data is large and we have overfit the data. As a result, generalization error is large. As the number of sample points increases, the prediction error on training and test data converges and generalization error goes to 0.

The concepts of generalization error and overfitting are closely related. Overfitting occurs when the learned function f_S becomes sensitive to the noise in the sample. As a result, the function will perform well on the training set but not perform well on other data from the joint probability distribution of x and y. Thus, the more overfitting occurs, the larger the generalization error.

The amount of overfitting can be tested using cross-validation methods, that split the sample into simulated training samples and testing samples. The model is then trained on a training sample and evaluated on the testing sample. The testing sample is previously unseen by the algorithm and so represents a random sample from the joint probability distribution of x and y. This test sample allows us to approximate the expected error and as a result approximate a particular form of the generalization error.

Many algorithms exist to prevent overfitting. The minimization algorithm can penalize more complex functions (known as Tikhonov regularization), or the hypothesis space can be constrained, either explicitly in the form of the functions or by adding constraints to the minimization function (Ivanov regularization).

The approach to finding a function that does not overfit is at odds with the goal of finding a function that is sufficiently complex to capture the particular characteristics of the data. This is known as the bias–variance tradeoff. Keeping a function simple to avoid overfitting may introduce a bias in the resulting predictions, while allowing it to be more complex leads to overfitting and a higher variance in the predictions. It is impossible to minimize both simultaneously.

References[edit]

  1. ^ Mohri, M., Rostamizadeh A., Talwakar A., (2018) Foundations of Machine learning, 2nd ed., Boston: MIT Press
  2. ^ Y S. Abu-Mostafa, M.Magdon-Ismail, and H.-T. Lin (2012) Learning from Data, AMLBook Press. ISBN 978-1600490064
  3. ^ Mohri, M., Rostamizadeh A., Talwakar A., (2018) Foundations of Machine learning, 2nd ed., Boston: MIT Press
  4. ^ a b c Mukherjee, S.; Niyogi, P.; Poggio, T.; Rifkin., R. M. (2006). «Learning theory: stability is sufficient for generalization and necessary and sufficient for consistency of empirical risk minimization» (PDF). Adv. Comput. Math. 25 (1–3): 161–193. doi:10.1007/s10444-004-7634-z. S2CID 2240256.

Further reading[edit]

  • Olivier, Bousquet; Luxburg, Ulrike; Rätsch, Gunnar (eds.). Advanced Lectures on Machine Learning. pp. 169–207. ISBN 978-3-540-23122-6. Retrieved 10 December 2022.
  • Bousquet, Olivier; Elisseeff, Andr´e (1 March 2002). «Stability and Generalization». The Journal of Machine Learning Research. 2: 499–526. doi:10.1162/153244302760200704. Retrieved 10 December 2022.
  • Mohri, M., Rostamizadeh A., Talwakar A., (2018) Foundations of Machine learning, 2nd ed., Boston: MIT Press.
  • Moody, J.E. (1992), «The Effective Number of Parameters: An Analysis of Generalization and Regularization in Nonlinear Learning Systems», in Moody, J.E., Hanson, S.J., and Lippmann, R.P., Advances in Neural Information Processing Systems 4, 847-854.
  • White, H. (1992b), Artificial Neural Networks: Approximation and Learning Theory, Blackwell.

From Wikipedia, the free encyclopedia

For supervised learning applications in machine learning and statistical learning theory, generalization error[1] (also known as the out-of-sample error[2] or the risk) is a measure of how accurately an algorithm is able to predict outcome values for previously unseen data. Because learning algorithms are evaluated on finite samples, the evaluation of a learning algorithm may be sensitive to sampling error. As a result, measurements of prediction error on the current data may not provide much information about predictive ability on new data. Generalization error can be minimized by avoiding overfitting in the learning algorithm. The performance of a machine learning algorithm is visualized by plots that show values of estimates of the generalization error through the learning process, which are called learning curves.

Definition[edit]

In a learning problem, the goal is to develop a function {displaystyle f_{n}({vec {x}})} that predicts output values y for each input datum {vec {x}}. The subscript n indicates that the function f_{n} is developed based on a data set of n data points. The generalization error or expected loss or risk I[f] of a particular function f over all possible values of {vec {x}} and y is the expected value of the loss function {displaystyle V(f)}:[3]

{displaystyle I[f]=int _{Xtimes Y}V(f({vec {x}}),y)rho ({vec {x}},y)d{vec {x}}dy,}

where {displaystyle rho ({vec {x}},y)} is the unknown joint probability distribution for {vec {x}} and y.

Without knowing the joint probability distribution rho , it is impossible to compute I[f]. Instead, we can compute the error on sample data, which is called empirical error (or empirical risk). Given n data points, the empirical error of a candidate function f is:

{displaystyle I_{n}[f]={frac {1}{n}}sum _{i=1}^{n}V(f({vec {x}}_{i}),y_{i})}

An algorithm is said to generalize if:

{displaystyle lim _{nrightarrow infty }I[f]-I_{n}[f]=0}

Of particular importance is the generalization error {displaystyle I[f_{n}]} of the data-dependent function f_{n} that is found by a learning algorithm based on the sample. Again, for an unknown probability distribution, {displaystyle I[f_{n}]} cannot be computed. Instead, the aim of many problems in statistical learning theory is to bound or characterize the difference of the generalization error and the empirical error in probability:

{displaystyle P_{G}=P(I[f_{n}]-I_{n}[f_{n}]leq epsilon )geq 1-delta _{n}}

That is, the goal is to characterize the probability {displaystyle 1-delta _{n}} that the generalization error is less than the empirical error plus some error bound epsilon (generally dependent on delta and n).
For many types of algorithms, it has been shown that an algorithm has generalization bounds if it meets certain stability criteria. Specifically, if an algorithm is symmetric (the order of inputs does not affect the result), has bounded loss and meets two stability conditions, it will generalize. The first stability condition, leave-one-out cross-validation stability, says that to be stable, the prediction error for each data point when leave-one-out cross validation is used must converge to zero as nrightarrow infty. The second condition, expected-to-leave-one-out error stability (also known as hypothesis stability if operating in the L_{1} norm) is met if the prediction on a left-out datapoint does not change when a single data point is removed from the training dataset.[4]

These conditions can be formalized as:

Leave-one-out cross-validation Stability[edit]

An algorithm L has {displaystyle CVloo} stability if for each n, there exists a {displaystyle beta _{CV}^{(n)}} and {displaystyle delta _{CV}^{(n)}} such that:

{displaystyle forall iin {1,...,n},mathbb {P} _{S}{|V(f_{S^{i}},z_{i})-V(f_{S},z_{i})|leq beta _{CV}^{(n)}}geq 1-delta _{CV}^{(n)}}

and {displaystyle beta _{CV}^{(n)}} and {displaystyle delta _{CV}^{(n)}} go to zero as n goes to infinity.[4]

Expected-leave-one-out error Stability[edit]

An algorithm L has Eloo_{err} stability if for each n there exists a beta_{EL}^m and a delta_{EL}^m such that:

{displaystyle forall iin {1,...,n},mathbb {P} _{S}left{left|I[f_{S}]-{frac {1}{n}}sum _{i=1}^{N}Vleft(f_{S^{i}},z_{i}right)right|leq beta _{EL}^{(n)}right}geq 1-delta _{EL}^{(n)}}

with {displaystyle beta _{EL}^{(n)}} and {displaystyle delta _{EL}^{(n)}} going to zero for nrightarrow infty .

For leave-one-out stability in the L_{1} norm, this is the same as hypothesis stability:

{displaystyle mathbb {E} _{S,z}[|V(f_{S},z)-V(f_{S^{i}},z)|]leq beta _{H}^{(n)}}

with {displaystyle beta _{H}^{(n)}} going to zero as n goes to infinity.[4]

Algorithms with proven stability[edit]

A number of algorithms have been proven to be stable and as a result have bounds on their generalization error. A list of these algorithms and the papers that proved stability is available here.

Relation to overfitting[edit]

This figure illustrates the relationship between overfitting and the generalization error I[fn] — IS[fn]. Data points were generated from the relationship y = x with white noise added to the y values. In the left column, a set of training points is shown in blue. A seventh order polynomial function was fit to the training data. In the right column, the function is tested on data sampled from the underlying joint probability distribution of x and y. In the top row, the function is fit on a sample dataset of 10 datapoints. In the bottom row, the function is fit on a sample dataset of 100 datapoints. As we can see, for small sample sizes and complex functions, the error on the training set is small but error on the underlying distribution of data is large and we have overfit the data. As a result, generalization error is large. As the number of sample points increases, the prediction error on training and test data converges and generalization error goes to 0.

The concepts of generalization error and overfitting are closely related. Overfitting occurs when the learned function f_S becomes sensitive to the noise in the sample. As a result, the function will perform well on the training set but not perform well on other data from the joint probability distribution of x and y. Thus, the more overfitting occurs, the larger the generalization error.

The amount of overfitting can be tested using cross-validation methods, that split the sample into simulated training samples and testing samples. The model is then trained on a training sample and evaluated on the testing sample. The testing sample is previously unseen by the algorithm and so represents a random sample from the joint probability distribution of x and y. This test sample allows us to approximate the expected error and as a result approximate a particular form of the generalization error.

Many algorithms exist to prevent overfitting. The minimization algorithm can penalize more complex functions (known as Tikhonov regularization), or the hypothesis space can be constrained, either explicitly in the form of the functions or by adding constraints to the minimization function (Ivanov regularization).

The approach to finding a function that does not overfit is at odds with the goal of finding a function that is sufficiently complex to capture the particular characteristics of the data. This is known as the bias–variance tradeoff. Keeping a function simple to avoid overfitting may introduce a bias in the resulting predictions, while allowing it to be more complex leads to overfitting and a higher variance in the predictions. It is impossible to minimize both simultaneously.

References[edit]

  1. ^ Mohri, M., Rostamizadeh A., Talwakar A., (2018) Foundations of Machine learning, 2nd ed., Boston: MIT Press
  2. ^ Y S. Abu-Mostafa, M.Magdon-Ismail, and H.-T. Lin (2012) Learning from Data, AMLBook Press. ISBN 978-1600490064
  3. ^ Mohri, M., Rostamizadeh A., Talwakar A., (2018) Foundations of Machine learning, 2nd ed., Boston: MIT Press
  4. ^ a b c Mukherjee, S.; Niyogi, P.; Poggio, T.; Rifkin., R. M. (2006). «Learning theory: stability is sufficient for generalization and necessary and sufficient for consistency of empirical risk minimization» (PDF). Adv. Comput. Math. 25 (1–3): 161–193. doi:10.1007/s10444-004-7634-z. S2CID 2240256.

Further reading[edit]

  • Olivier, Bousquet; Luxburg, Ulrike; Rätsch, Gunnar (eds.). Advanced Lectures on Machine Learning. pp. 169–207. ISBN 978-3-540-23122-6. Retrieved 10 December 2022.
  • Bousquet, Olivier; Elisseeff, Andr´e (1 March 2002). «Stability and Generalization». The Journal of Machine Learning Research. 2: 499–526. doi:10.1162/153244302760200704. Retrieved 10 December 2022.
  • Mohri, M., Rostamizadeh A., Talwakar A., (2018) Foundations of Machine learning, 2nd ed., Boston: MIT Press.
  • Moody, J.E. (1992), «The Effective Number of Parameters: An Analysis of Generalization and Regularization in Nonlinear Learning Systems», in Moody, J.E., Hanson, S.J., and Lippmann, R.P., Advances in Neural Information Processing Systems 4, 847-854.
  • White, H. (1992b), Artificial Neural Networks: Approximation and Learning Theory, Blackwell.

Для контролируемого обучения приложений в машинном обучении и статистической теории обучения , ошибках обобщения [1] (также известных как вне образца ошибки [2] или риска ) является мерой того, насколько точно алгоритм способен предсказать значение результата для ранее невидимые данные. Поскольку алгоритмы обучения оцениваются на конечных выборках, оценка алгоритма обучения может быть чувствительной к ошибке выборки . В результате измерения ошибки прогнозирования для текущих данных могут не предоставить много информации о способности прогнозирования для новых данных. Ошибка обобщения может быть минимизирована, если избежать переобученияв алгоритме обучения. Производительность алгоритма машинного обучения визуализируется графиками, которые показывают значения оценок ошибки обобщения в процессе обучения, которые называются кривыми обучения .

Определение

В задаче обучения цель состоит в том, чтобы разработать функцию который предсказывает выходные значения для каждой исходной базы . Нижний индекс указывает, что функция разработан на основе набора данных точки данных. Ошибка обобщения или ожидаемые потери или риска , конкретной функции по всем возможным значениям а также это: [3]

куда обозначает функцию потерь, а— неизвестное совместное распределение вероятностей для а также .

Не зная совместного распределения вероятностей , невозможно вычислить . Вместо этого мы можем вычислить ошибку на выборочных данных, которая называется эмпирической ошибкой (или эмпирическим риском ). Данный точки данных, эмпирическая ошибка функции-кандидата является:

Алгоритм называется обобщающим, если:

Особое значение имеет ошибка обобщения функции, зависящей от данных который обнаруживается алгоритмом обучения на основе выборки. Опять же, для неизвестного распределения вероятностейневозможно вычислить. Вместо этого цель многих задач в теории статистического обучения состоит в том, чтобы ограничить или охарактеризовать разницу ошибки обобщения и эмпирической ошибки в вероятности:

То есть цель состоит в том, чтобы охарактеризовать вероятность что ошибка обобщения меньше, чем эмпирическая ошибка плюс некоторая граница ошибки (обычно зависит от а также ). Для многих типов алгоритмов было показано, что алгоритм имеет границы обобщения, если он удовлетворяет определенным критериям устойчивости . В частности, если алгоритм является симметричным (порядок входных данных не влияет на результат), имеет ограниченные потери и удовлетворяет двум условиям устойчивости, он будет обобщен. Первое условие стабильности, стабильность перекрестной проверки с исключением одного исключения , гласит, что для обеспечения стабильности ошибка прогнозирования для каждой точки данных при использовании перекрестной проверки с исключением одного исключения должна сходиться к нулю, как. Второе условие, устойчивость к ожидаемой устранению одной единственной ошибки (также известное как устойчивость гипотез, если работа вnorm ) выполняется, если прогноз для оставленной точки данных не изменяется при удалении одной точки данных из набора обучающих данных. [4]

Эти условия можно формализовать как:

Стабильность перекрестной проверки без исключения

Алгоритм имеет стабильность, если для каждого существует а также такой, что:

а также а также перейти к нулю как уходит в бесконечность. [4]

Стабильность ожидаемой ошибки с исключением одной ошибки

Алгоритм имеет стабильность, если для каждого существует и такой, что:

с участием а также идет к нулю для .

Для стабильности в норма, это то же самое, что и устойчивость гипотезы:

с участием идет к нулю как уходит в бесконечность. [4]

Алгоритмы с доказанной стабильностью

Доказано, что ряд алгоритмов стабильны и, как следствие, имеют ограничения на ошибку обобщения. Список этих алгоритмов и документов, доказавших стабильность, доступен здесь .

Отношение к переобучению

Этот рисунок иллюстрирует взаимосвязь между переобучением и ошибкой обобщения I [ f n ] — I S [ f n ]. Точки данных были сгенерированы из отношения y = x с добавлением белого шума к значениям y . В левом столбце набор тренировочных точек показан синим цветом. Полиномиальная функция седьмого порядка соответствовала обучающим данным. В правом столбце функция тестируется на данных, выбранных из базового совместного распределения вероятностей x и y.. В верхнем ряду функция соответствует образцу набора данных из 10 точек. В нижнем ряду функция соответствует образцу набора данных из 100 точек. Как мы видим, для небольших размеров выборки и сложных функций ошибка обучающего набора мала, но ошибка основного распределения данных велика, и мы переобучили данные. В результате ошибка обобщения велика. По мере увеличения количества точек выборки ошибка прогнозирования обучающих и тестовых данных сходится, а ошибка обобщения становится равной 0.

Понятия ошибки обобщения и переобучения тесно связаны. Переоснащение происходит, когда изученная функциястановится чувствительным к шуму в образце. В результате функция будет хорошо работать на обучающем наборе, но не будет хорошо работать на других данных из совместного распределения вероятностей а также . Таким образом, чем больше происходит переоснащение, тем больше ошибка обобщения.

Степень переобучения можно проверить с помощью методов перекрестной проверки , которые разбивают выборку на моделируемые обучающие выборки и тестовые выборки. Затем модель обучается на обучающей выборке и оценивается на тестовой выборке. Тестовая выборка ранее невидима для алгоритма и поэтому представляет собой случайную выборку из совместного распределения вероятностей а также . Этот тестовый образец позволяет нам приблизить ожидаемую ошибку и, как результат, приблизить конкретную форму ошибки обобщения.

Существует множество алгоритмов предотвращения переобучения. Алгоритм минимизации может наказывать более сложные функции (известный как регуляризация Тихонова ), или пространство гипотез может быть ограничено либо явно в форме функций, либо путем добавления ограничений к функции минимизации (регуляризация Иванова).

Подход к поиску функции, которая не переоснащается, расходится с целью поиска функции, которая является достаточно сложной, чтобы улавливать конкретные характеристики данных. Это известно как компромисс между смещением и дисперсией . Сохранение простой функции во избежание переобучения может привести к смещению в результирующих прогнозах, в то время как допустимость усложнения функции приведет к переобучению и более высокой дисперсии прогнозов. Невозможно свести к минимуму и то, и другое одновременно.

Ссылки

  1. ^ Мохри, М., Ростамизаде А., Талвакар А., (2018) Основы машинного обучения , 2-е изд., Бостон: MIT Press
  2. ^ Y S. Abu-Mostafa, M.Magdon-Исмаил, и H.-T. Линь (2012) Обучение на основе данных, AMLBook Press. ISBN  978-1600490064
  3. ^ Мохри, М., Ростамизаде А., Талвакар А., (2018) Основы машинного обучения , 2-е изд., Бостон: MIT Press
  4. ^ a b c Mukherjee, S .; Niyogi, P .; Poggio, T .; Рифкин, РМ (2006). «Теория обучения: стабильности достаточно для обобщения и необходимо и достаточно для согласованности минимизации эмпирических рисков» (PDF) . Adv. Comput. Математика . 25 (1–3): 161–193. DOI : 10.1007 / s10444-004-7634-Z . S2CID 2240256 .  

Дальнейшее чтение

  • Bousquet, O., S. Boucheron и G. Lugosi. Введение в статистическую теорию обучения . Расширенные лекции по машинному обучению Лекционные заметки по искусственному интеллекту 3176, 169-207. (Ред.) Буске, О., У. фон Люксбург и Г. Ратч, Springer, Гейдельберг, Германия (2004)
  • Буске, О. и А. Элиссиф (2002), Стабильность и обобщение, Журнал исследований в области машинного обучения, 499-526.
  • Деврое Л., Л. Дьёрфи и Г. Лугоши (1996). Вероятностная теория распознавания образов. Springer-Verlag. ISBN 978-0387946184 . 
  • Поджио Т. и С. Смейл. Математика обучения: работа с данными . Уведомления AMS, 2003 г.
  • Вапник, В. (2000). Природа статистической теории обучения. Информатика и статистика. Springer-Verlag. ISBN 978-0-387-98780-4 . 
  • Бишоп К.М. (1995), Нейронные сети для распознавания образов , Оксфорд: Oxford University Press, особенно раздел 6.4.
  • Финке М., Мюллер К.-Р. (1994), « Оценка апостериорных вероятностей с использованием стохастических сетевых моделей », в Mozer, Smolensky, Touretzky, Elman, & Weigend, eds., Proceedings of the Connectionist Models Summer School 1993 , Hillsdale, NJ: Lawrence Erlbaum Associates, стр. 324–331.
  • Геман, С., Биненсток, Э. и Дурсат, Р. (1992), « Нейронные сети и дилемма смещения / дисперсии », Neural Computing , 4, 1-58.
  • Хусмайер, Д. (1999), Нейронные сети для оценки условной вероятности: прогнозирование, выходящее за рамки точечных предсказаний , Берлин: Springer Verlag, ISBN 1-85233-095-3 . 
  • Маккаллах П. и Нелдер Дж. А. (1989) Обобщенные линейные модели , 2-е изд., Лондон: Chapman & Hall.
  • Мохри М., Ростамизаде А., Талвакар А. (2018) Основы машинного обучения , 2-е изд., Бостон: MIT Press.
  • Moody, JE (1992), « Эффективное количество параметров: анализ обобщения и регуляризации в нелинейных обучающих системах », в Moody, JE, Hanson, SJ, и Lippmann, RP, Advances in Neural Information Processing Systems 4, 847- 854.
  • Рипли, Б.Д. (1996) Распознавание образов и нейронные сети , Кембридж: Издательство Кембриджского университета.
  • Rohwer, R., и van der Rest, JC (1996), « Минимальная длина описания, регуляризация и мультимодальные данные », Neural Computing, 8, 595-609.
  • Рохас, Р. (1996), » Краткое доказательство свойства апостериорной вероятности нейронных сетей классификатора «, Нейронные вычисления , 8, 41-43.
  • Уайт, Х. (1990), » Коннекционистская непараметрическая регрессия: многослойные сети прямого распространения могут изучать произвольные сопоставления «, Neural Networks , 3, 535-550. Печатается в белом цвете (1992).
  • Уайт, Х. (1992a), « Непараметрическая оценка условных квантилей с использованием нейронных сетей », в Пейдж, К. и Ле Пейдж, Р. (ред.), Труды 23-го симпсума по интерфейсу: вычислительная наука и статистика , Александрия , Вирджиния: Американская статистическая ассоциация, стр. 190–199. Перепечатано в белом цвете (1992b).
  • Уайт, Х. (1992b), Искусственные нейронные сети: теория приближения и обучения , Блэквелл.

В предыдущих статьях мы определили, что такое ошибка обобщения в контексте машинного обучения и как ограничить ее с помощью различных неравенств. Мы также определили переобучение и то, как его можно исправить с помощью набора для проверки. Мы могли бы избежать парадокса выбора размера для нашего набора проверки, используя перекрестную проверку, которая оказалась несмещенной оценкой для E_out (N — 1). В этой статье мы дадим несколько практических примеров того, какие неравенства использовать в случае набора проверки и перекрестной проверки.

Пример — набор для проверки

Представьте, что у нас есть набор данных D с размером выборки N = 100. Мы разбиваем наш набор данных на две части; обучающий набор размером 75 и проверочный набор размером 25. Мы хотим оценить 100 моделей, что означает, что у нас есть 100 наборов гипотез и найти модель с наилучшей производительностью на нашем проверочном наборе. Мы скажем, что все модели имеют d_VC = 10. Затем мы хотим дать верхнюю границу нашей ошибки вне выборки. Давайте сначала проиллюстрируем процесс, который нам предстоит пройти:

Как уже говорилось, у нас есть 100 моделей для оценки, что дает 100 наборов гипотез. Нам неизвестны размеры этих наборов гипотез — это означает, что они могут иметь бесконечные размеры. Каждый набор гипотез обучается на обучающих данных и дает окончательную гипотезу g_n-. Это косвенно создает новую гипотезу для наших данных проверки:

Теперь мы знаем размеры нашей новой гипотезы, которая составляет M = 100. Мы оцениваем наши гипотезы на проверочном наборе и выбираем ту с минимальной ошибкой, E_val (g_m * -). Это наша оценка E_out (g_m *) в выборке. Мы помним, что после того, как мы нашли gm *, мы тренируем гипотезу на всех данных и возвращаем модель. Поскольку мы знаем размер нашего набора гипотез, мы можем дать верхнюю границу нашей ошибки вне выборки с помощью:

Мы помним, что наша ошибка в выборке в данном случае — E_val (g_m * -), которую мы используем для привязки E_out (g_m * -). Мы выводим не gm * -, а gm *. Однако мы можем представить, что E_out (g_m *) меньше или равно E_out (g_m * -), поскольку мы будем тренировать нашу окончательную гипотезу на всем нашем наборе данных. В целом можно сказать, что у нас есть:

Важно отметить, что в этом случае N равно размеру нашего набора для проверки! Представим, что мы выбираем уровень достоверности 95%, т. Е. Δ = 0,05, и ошибку выборки 0,20. Тогда имеем следующую оценку:

Вместо этого представьте, что мы просто обучили каждую модель на всех данных и выбрали функцию с минимальной ошибкой выборки. Это привело бы к совершенно другому процессу. Давайте сначала проиллюстрируем это:

В этом случае наш набор гипотез представляет собой объединение всех наших 100 наборов гипотез — мы не знаем, сколько их в каждом, поэтому мы не знаем М. Мы также не используем набор проверки — вместо этого мы делаем то, что каждый Модель Hm в нашем наборе гипотез дает окончательную гипотезу, и мы выбираем ту, которая имеет минимальную ошибку. Это то же самое, что выбрать окончательную гипотезу из объединения всех наших наборов гипотез — следовательно, мы не можем сказать, что это простой конечный набор гипотез. Вместо этого нам нужно найти размерность VC объединения нашей гипотезы. В итоге мы получим следующую оценку:

Мы помним, что каждый набор гипотез имеет d_VC = 10. Следовательно, нам нужно сначала вычислить границу VC для нашего набора гипотез, что можно сделать с помощью:

Допустим, наша окончательная гипотеза все еще имеет ошибку выборки 0,20. Тогда мы получим следующую оценку:

Мы ясно видим, что в первом случае граница более жесткая.

Пример — перекрестная проверка

Представьте, что у нас есть набор данных с N образцами. Вы отдаете его двум своим друзьям. Один из них применяет 5-кратное перекрестное тестирование: данные разделяются на 5 частей, а затем каждый раз, когда одна из складок резервируется для тестирования, а остальные четыре используются для обучения модели прогнозирования. Каждая из 5 складок используется для тестирования только один раз. Таким образом, ваш друг получает 5 моделей прогнозов и дает вам ту, которая имеет наименьшую ошибку теста. Другой друг применяет 10-кратное перекрестное тестирование таким же образом и возвращает вам модель с наименьшей ошибкой теста. Два друга работают независимо друг от друга. Пусть h_1 ∗ будет моделью, созданной первым другом, и E_in (h_1 *) его тестовой потерей, и пусть h_2 * будет моделью, созданной вторым другом, а E_in (h_2 *) его тестовой потерей. Мы хотим ограничить ошибку вне выборки для каждой гипотезы, выдвинутой вашими друзьями.

Давайте начнем с первого друга и его последней гипотезы, которая была найдена с помощью 5-кратной перекрестной проверки. Сначала мы можем визуализировать процесс:

Мы помним, что E_cv — это несмещенная оценка E_out (N — K). Можно сказать, что:

Мы используем неравенство для конечного набора гипотез, где M = 5, поскольку наш первый друг выдвигает всего 5 гипотез. Наша ошибка в выборке равна E_cv. N по-прежнему равно N, поскольку все данные были использованы в сумме. Следовательно, мы имеем следующее:

Давайте теперь сделаем то же самое для друга, который реализует 10-кратную перекрестную проверку. Тогда у нас было бы:

Теперь у нас есть 10 моделей, поэтому мы получим следующую оценку:

Заключение

Мы видели несколько примеров того, как разные границы могут использоваться в разных сценариях при использовании перекрестной проверки или простого набора проверки. В следующей статье мы увидим, как мы можем оценить ошибку обобщения в конкретном случае использования машин опорных векторов.

В контролируемое обучение приложения в машинное обучение и теория статистического обучения, ошибка обобщения[1] (также известный как ошибка вне выборки[2]) — это мера того, насколько точно алгоритм может предсказать значения результатов для ранее невидимых данных. Поскольку алгоритмы обучения оцениваются на конечных выборках, оценка алгоритма обучения может быть чувствительной к ошибка выборки. В результате измерения ошибки предсказания для текущих данных могут не предоставить много информации о предсказательной способности для новых данных. Ошибка обобщения может быть минимизирована, если избежать переоснащение в алгоритме обучения. Производительность машинное обучение алгоритм измеряется графиками значений ошибок обобщения в процессе обучения, которые называются кривые обучения.

Определение

В задаче обучения цель — разработать функцию f (x) прогнозирует выходные значения у на основе некоторых исходных данных Икс. В ошибка обобщения или ожидаемая ошибка, { displaystyle I [f_ {n}]} конкретной функции f_ {n} по всем возможным значениям Икс и у является:[3]

{ displaystyle I [f_ {n}] =  int _ {X  times Y} V (f_ {n} (x), y)  rho (x, y) dxdy,}

куда V обозначает функция потерь и  rho (х, у) неизвестно совместное распределение вероятностей за Икс и у.

Не зная совместного распределения вероятностей, невозможно вычислить Если]. Вместо этого мы можем вычислить эмпирическую ошибку на выборочных данных. Данный п точек данных, эмпирическая ошибка составляет:

{ displaystyle I_ {S} [f_ {n}] = { frac {1} {n}}  sum _ {i = 1} ^ {n} V (f_ {n} (x_ {i}), y_ {я})}

Алгоритм называется обобщающим, если:

{ displaystyle  lim _ {n  rightarrow  infty} I [f_ {n}] - I_ {S} [f_ {n}] = 0}

В ошибка обобщения { displaystyle I [f_ {n}]} не может быть вычислен для неизвестного распределения вероятностей. Вместо этого цель многих задач в теории статистического обучения состоит в том, чтобы ограничить или охарактеризовать разницу ошибки обобщения и эмпирической ошибки в вероятности:

{ displaystyle P_ {G} = P (I [f_ {n}] - I_ {S} [f_ {n}]  leq  epsilon)  geq 1-  delta _ {n}}

То есть цель — охарактеризовать вероятность { displaystyle 1-  delta _ {n}} что ошибка обобщения меньше, чем эмпирическая ошибка плюс некоторая граница ошибки  epsilon (обычно зависит от  дельта и пДля многих типов алгоритмов было показано, что алгоритм имеет границы обобщения, если он удовлетворяет определенным требованиям. стабильность критерии. В частности, если алгоритм является симметричным (порядок входных данных не влияет на результат), имеет ограниченные потери и удовлетворяет двум условиям устойчивости, он будет обобщен. Первое условие устойчивости, перекрестная проверка с исключением по одному стабильность, говорит, что для обеспечения стабильности ошибка прогнозирования для каждой точки данных при использовании перекрестной проверки с исключением одного и другого должна сходиться к нулю, как п  стрелка вправо  infty. Второе условие, устойчивость к ожидаемой устранению единственной ошибки (также известное как устойчивость гипотез, если работа в L_ {1} норма ) выполняется, если прогноз для оставленной точки данных не изменяется при удалении одной точки данных из набора обучающих данных.[4]

Эти условия можно формализовать как:

Стабильность перекрестной проверки без исключения

Алгоритм L имеет { displaystyle CVloo} стабильность, если для каждого п, существует { displaystyle  beta _ {CV} ^ {(n)}} и { displaystyle  delta _ {CV} ^ {(n)}} такой, что:

{ displaystyle  forall i  in  {1, ..., n },  mathbb {P} _ {S}  {| V (f_ {S ^ {i}}, z_ {i}) - V (f_ {S}, z_ {i}) |  leq  beta _ {CV} ^ {(n)} }  geq 1-  delta _ {CV} ^ {(n)}}

и { displaystyle  beta _ {CV} ^ {(n)}} и { displaystyle  delta _ {CV} ^ {(n)}} перейти к нулю как п уходит в бесконечность.[4]

Ожидаемая ошибка с единичным исключением Стабильность

Алгоритм L имеет Элоо_ {err} стабильность, если для каждого п существует  beta_ {EL} ^ m и  delta_ {EL} ^ m такой, что:

{ displaystyle  forall i  in  {1, ..., n },  mathbb {P} _ {S}  {| I [f_ {S}] - { frac {1} {n}}  sum _ {i = 1} ^ {N} V (f_ {S ^ {i}}, z_ {i}) |  leq  beta _ {EL} ^ {(n)} }  geq 1-  дельта _ {EL} ^ {(n)}}

с { displaystyle  beta _ {EL} ^ {(n)}} и { displaystyle  delta _ {EL} ^ {(n)}} идет к нулю для п  стрелка вправо  infty.

Для стабильности в L_ {1} норма, это то же самое, что и устойчивость гипотезы:

{ Displaystyle  mathbb {E} _ {S, z} [| V (f_ {S}, z) -V (f_ {S ^ {i}}, z) |]  leq  beta _ {H} ^ {(n)}}

с { displaystyle  beta _ {H} ^ {(n)}} идет к нулю как п уходит в бесконечность.[4]

Алгоритмы с доказанной стабильностью

Доказано, что ряд алгоритмов устойчивы и, как следствие, имеют ограничения на ошибку обобщения. Список этих алгоритмов и документов, доказавших стабильность, доступен. здесь.

Отношение к переобучению

Этот рисунок иллюстрирует взаимосвязь между переобучением и ошибкой обобщения. я[жп] — яS[жп]. Точки данных были получены из отношения у = Икс с добавлением белого шума к у значения. В левом столбце набор тренировочных точек показан синим цветом. Полиномиальная функция седьмого порядка соответствовала обучающим данным. В правом столбце функция тестируется на данных, взятых из базового совместного распределения вероятностей Икс и у. В верхнем ряду функция соответствует образцу набора данных из 10 точек. В нижнем ряду функция соответствует набору данных из 100 точек. Как мы видим, для небольших размеров выборки и сложных функций ошибка обучающего набора мала, но ошибка основного распределения данных велика, и мы переобучили данные. В результате ошибка обобщения велика. По мере увеличения количества точек выборки ошибка прогнозирования обучающих и тестовых данных сходится, а ошибка обобщения становится равной 0.

Понятия ошибки обобщения и переобучения тесно связаны. Переобучение происходит, когда изученная функция f_S становится чувствительным к шуму в образце. В результате функция будет хорошо работать на обучающем наборе, но не будет хорошо работать на других данных из совместного распределения вероятностей Икс и у. Таким образом, чем больше происходит переобучение, тем больше ошибка обобщения.

Величину переобучения можно проверить с помощью перекрестная проверка методы, которые разбивают выборку на моделируемые обучающие выборки и тестовые выборки. Затем модель обучается на обучающей выборке и оценивается на тестовой выборке. Тестовая выборка ранее невидима для алгоритма и поэтому представляет собой случайную выборку из совместного распределения вероятностей Икс и у. Этот тестовый образец позволяет нам аппроксимировать ожидаемую ошибку и, как результат, приблизить конкретную форму ошибки обобщения.

Существует множество алгоритмов предотвращения переобучения. Алгоритм минимизации может наказывать более сложные функции (известные как Тихоновские регуляризация ), либо пространство гипотез может быть ограничено либо явно в виде функций, либо путем добавления ограничений к функции минимизации (регуляризация Иванова).

Подход к поиску функции, которая не переоснащается, расходится с целью поиска функции, которая является достаточно сложной, чтобы улавливать определенные характеристики данных. Это известно как компромисс между смещением и дисперсией. Сохранение простой функции во избежание переобучения может привести к смещению в результирующих прогнозах, в то время как допущение ее усложнения приведет к переобучению и более высокому разбросу прогнозов. Невозможно минимизировать и то, и другое одновременно.

Рекомендации

  1. ^ Мохри, М., Ростамизаде А., Талвакар А., (2018) Основы машинного обучения, 2-е изд., Бостон: MIT Press
  2. ^ И С. Абу-Мостафа, М. Магдон-Исмаил и Х.-Т. Линь (2012) Обучение на основе данных, AMLBook Press. ISBN  978-1600490064
  3. ^ Мохри, М., Ростамизаде А., Талвакар А., (2018) Основы машинного обучения, 2-е изд., Бостон: MIT Press
  4. ^ а б c Mukherjee, S .; Niyogi, P .; Poggio, T .; Рифкин., Р. М. (2006). «Теория обучения: стабильности достаточно для обобщения и необходимо и достаточно для согласованности минимизации эмпирического риска» (PDF). Adv. Comput. Математика. 25 (1–3): 161–193. Дои:10.1007 / s10444-004-7634-z.

дальнейшее чтение

  • Bousquet, O., S. Boucheron и G. Lugosi. Введение в статистическую теорию обучения. Расширенные лекции по машинному обучению Лекционные заметки по искусственному интеллекту 3176, 169-207. (Ред.) Буске, О., У. фон Люксбург и Г. Ратч, Springer, Гейдельберг, Германия (2004)
  • Буске, О. и А. Элиссиф (2002), Стабильность и обобщение, Журнал исследований в области машинного обучения, 499-526.
  • Деврое Л., Л. Дьёрфи и Г. Лугоши (1996). Вероятностная теория распознавания образов. Springer-Verlag. ISBN  978-0387946184.
  • Поджио Т. и С. Смейл. Математика обучения: работа с данными. Уведомления AMS, 2003 г.
  • Вапник В. (2000). Природа статистической теории обучения. Информатика и статистика. Springer-Verlag. ISBN  978-0-387-98780-4.
  • Бишоп, К. (1995), Нейронные сети для распознавания образов, Oxford: Oxford University Press, особенно раздел 6.4.
  • Финке М., Мюллер К.-Р. (1994), «Оценка апостериорных вероятностей с использованием стохастических сетевых моделей, «Мозер, Смоленский, Турецкий, Эльман и Вайгенд, ред., Материалы Летней школы коннекционистских моделей 1993 г., Hillsdale, NJ: Lawrence Erlbaum Associates, стр. 324–331.
  • Геман, С., Биненшток, Э. и Дурсат, Р. (1992), «Нейронные сети и дилемма смещения / дисперсии «, Нейронные вычисления, 4, 1-58.
  • Хусмайер, Д. (1999), Нейронные сети для оценки условной вероятности: прогнозирование помимо точечных прогнозов, Берлин: Springer Verlag, ISBN  1-85233-095-3.
  • Маккаллах П. и Нелдер Дж. А. (1989) Обобщенные линейные модели, 2-е изд., Лондон: Chapman & Hall.
  • Мохри, М., Ростамизаде А., Талвакар А., (2018) Основы машинного обучения, 2-е изд., Бостон: MIT Press.
  • Муди, Дж. Э. (1992) «Эффективное число параметров: анализ обобщения и регуляризации в нелинейных обучающих системах «, в Moody, J.E., Hanson, S.J., and Lippmann, R.P., Достижения в системах обработки нейронной информации 4, 847-854.
  • Рипли, Б. (1996) Распознавание образов и нейронные сети, Кембридж: Издательство Кембриджского университета.
  • Ровер, Р., и ван дер Рест, Дж. К. (1996) «Минимальная длина описания, регуляризация и мультимодальные данные,» Нейронные вычисления, 8, 595-609.
  • Рохас, Р. (1996) «Краткое доказательство апостериорного вероятностного свойства нейронных сетей-классификаторов,» Нейронные вычисления, 8, 41-43.
  • Уайт, Х. (1990) «Коннекционистская непараметрическая регрессия: многослойные сети прямого распространения могут изучать произвольные сопоставления,» Нейронные сети, 3, 535-550. Печатается в белом цвете (1992).
  • Уайт, Х. (1992a) «Непараметрическая оценка условных квантилей с помощью нейронных сетей, «в Пейдж, К. и Ле Пейдж, Р. (ред.), Материалы 23-го симпсума по интерфейсу: вычислительная наука и статистика, Александрия, Вирджиния: Американская статистическая ассоциация, стр. 190–199. Перепечатано в белом цвете (1992b).
  • Уайт, Х. (1992b), Искусственные нейронные сети: теория приближения и обучения, Блэквелл.

Характер приближений в информационных моделях

Специфичность информационных моделей проявляется не только в способах их синтеза, но и характере делаемых приближений (и связанных с ними ошибок). Отличия в поведении системы и ее информационной модели возникают вследствие свойств экспериментальных данных.

  • Информационные модели ab initio являются неполными. Пространства входных и выходных переменных не могут, в общем случае, содержать все параметры, существенные для описания поведения системы. Это связано как с техническими ограничениями, так и с ограниченностью наших представлений о моделируемой системе. Кроме того, при увеличении числа переменных ужесточаются требования на объем необходимых экспериментальных данных для построения модели (об этом см. ниже). Эффект опущенных (скрытых) входных параметров может нарушать однозначность моделируемой системной функции F.
  • База экспериментальных данных, на которых основывается модель G рассматривается, как внешняя данность. При этом, в данных всегда присутствуют ошибки разной природы, шум, а также противоречия отдельных измерений друг другу. За исключением простых случаев, искажения в данных не могут быть устранены полностью.
  • Экспериментальные данные, как правило, имеют произвольное распределение в пространстве переменных задачи. Как следствие, получаемые модели будут обладать неодинаковой достоверностью и точностью в различных областях изменения параметров.
  • Экспериментальные данные могут содержать пропущенные значения (например, вследствие потери информации, отказа измеряющих датчиков, невозможности проведения полного набора анализов и т.п.). Произвольность в интерпретации этих значений, опять-таки, ухудшает свойства модели.

Такие особенности в данных и в постановке задач требуют особого отношения к ошибкам информационных моделей.

Ошибка обучения и ошибка обобщения

Итак, при информационном подходе требуемая модель G системы F не может быть полностью основана на явных правилах и формальных законах. Процесс получения G из имеющихся отрывочных экспериментальных сведений о системе F может рассматриваться, как обучение модели G поведению F в соответствии с заданным критерием, настолько близко, насколько возможно. Алгоритмически, обучение означает подстройку внутренних параметров модели (весов синаптических связей в случае нейронной сети) с целью минимизации ошибки модели E = left| {G - F}right|.

Прямое измерение указанной ошибки модели на практике не достижимо, поскольку системная функция F при произвольных значениях аргумента не известна. Однако возможно получение ее оценки:

E_L = sumlimits_{X in X}{left| {Gleft( X right) - Y}right|},

где суммирование по X проводится по некоторому конечному набору параметров X, называемому обучающим множеством. При использовании базы данных наблюдений за системой, для обучения может отводиться некоторая ее часть, называемая в этом случае обучающей выборкой. Для обучающих примеров X отклики системы Y известны7С учетом описанных выше особенностей экспериментальных данных.
. Норма невязки модельной функции G и системной функции Y на множестве X играет важную роль в информационном моделировании и называется ошибкой обучения модели.

Для случая точных измерений (например, в некоторых задачах классификации, когда отношение образца к классу не вызывает сомнений) однозначность системной функции для достаточно широкого класса G моделей гарантирует возможность достижения произвольно малого значения ошибки обучения EL. Нарушение однозначности системной функции в присутствии экспериментальных ошибок и неполноты признаковых пространств приводит в общем случае к ненулевым ошибкам обучения. В этом случае предельная достижимая ошибка обучения может служить мерой корректности постановки задачи и качества класса моделей G.

В приложениях пользователя обычно интересуют предсказательные свойства модели. При этом главным является вопрос, каковым будет отклик системы на новое воздействие, пример которого отсутствует в базе данных наблюдений. Наиболее общий ответ на этот вопрос дает (по-прежнему недоступная) ошибка модели E. Неизвестная ошибка, допускаемая моделью G на данных, не использовавшихся при обучении, называется ошибкой обобщения модели EG.

Основной целью при построении информационной модели является уменьшение именно ошибки обобщения, поскольку малая ошибка обучения гарантирует адекватность модели лишь в заранее выбранных точках (а в них значения отклика системы известны и без всякой модели!). Проводя аналогии с обучением в биологии, можно сказать, что малая ошибка обучения соответствует прямому запоминанию обучающей информации, а малая ошибка обобщения — формированию понятий и навыков, позволяющих распространить ограниченный опыт обучения на новые условия. Последнее значительно более ценно при проектировании нейросетевых систем, так как для непосредственного запоминания информации лучше приспособлены не нейронные устройства компьютерной памяти.

Важно отметить, что малость ошибки обучения не гарантирует малость ошибки обобщения. Классическим примером является построение модели функции (аппроксимация функции) по нескольким заданным точкам полиномом высокого порядка. Значения полинома (модели) при достаточно высокой его степени являются точными в обучающих точках, т.е. ошибка обучения равна нулю. Однако значения в промежуточных точках могут значительно отличаться от аппроксимируемой функции, следовательно ошибка обобщения такой модели может быть неприемлемо большой.

Поскольку истинное значение ошибки обобщения не доступно, в практике используется ее оценка. Для ее получения анализируется часть примеров из имеющейся базы данных, для которых известны отклики системы, но которые не использовались при обучении. Эта выборка примеров называется тестовой выборкой. Ошибка обобщения оценивается, как норма уклонения модели на множестве примеров из тестовой выборки.

Оценка ошибки обобщения является принципиальным моментом при построении информационной модели. На первый взгляд может показаться, что сознательное не использование части примеров при обучении может только ухудшить итоговую модель. Однако без этапа тестирования единственной оценкой качества модели будет лишь ошибка обучения, которая, как уже отмечалось, мало связана с предсказательными способностями модели. В профессиональных исследованиях могут использоваться несколько независимых тестовых выборок, этапы обучения и тестирования повторяются многократно с вариацией начального распределения весов нейросети, ее топологии и параметров обучения. Окончательный выбор «наилучшей» нейросети выполняется с учетом имеющегося объема и качества данных, специфики задачи, с целью минимизации риска большой ошибки обобщения при эксплуатации модели.

Каталог статей

  • Выбор модели, переоснащение и недооборудование
    • Ошибка обучения и ошибка обобщения
    • Выбор модели
      • Набор для проверки
      • K-кратная перекрестная проверка
    • Недостаточное и переобучение
      • Сложность модели
    • Подгонка полинома
    • Снижение веса
      • L2 регуляризация
      • Pytorch реализация снижения веса
    • dropout
      • Реализация отсева в Pytorch
  • Исчезающий градиент и взрывной градиент
  • Произвольно инициализировать параметры модели
    • Случайная инициализация PyTorch по умолчанию
    • Ксавье случайная инициализация
  • резюме

Выбор модели, переоснащение и недооборудование

Ошибка обучения и ошибка обобщения

Ошибка обучения (ошибка обучения) относится к ошибке, которую модель показывает в наборе данных обучения.
Ошибка обобщения — это ожидаемая ошибка модели для любой выборки тестовых данных, которая часто приближается к ошибке в наборе тестовых данных.
Чтобы вычислить ошибку обучения и ошибку обобщения, вы можете использовать функции потерь, представленные ранее, такие как функция потерь квадрата, используемая в линейной регрессии, и функция потерь кросс-энтропии, используемая в регрессии softmax.
Следовательно, ожидаемая ошибка обучения меньше или равна ошибке обобщения. То есть, как правило, параметры модели, полученные из набора обучающих данных, сделают производительность модели на наборе обучающих данных лучше или равной производительности на наборе тестовых данных. Поскольку ошибку обобщения невозможно оценить по ошибке обучения, слепое уменьшение ошибки обучения не означает, что ошибка обобщения будет уменьшена.

Модели машинного обучения должны быть направлены на уменьшение ошибок обобщения.

Выбор модели

Набор для проверки

Набор тестов можно использовать только один раз после выбора всех гиперпараметров и параметров модели. Вы не можете использовать тестовые данные для выбора моделей, таких как параметры настройки.
Зарезервируйте часть данных вне набора обучающих данных и набора тестовых данных для выбора модели. Эта часть данных называется набором данных проверки, или для краткости набором данных проверки.

K-кратная перекрестная проверка

Поскольку набор данных проверки не участвует в обучении модели, слишком расточительно резервировать большой объем данных проверки, когда данных обучения недостаточно. Один из способов улучшить

K

K

Сложите перекрестную проверку (

K

K

-кратная перекрестная проверка). в

K

K

При перекрестной проверке сверток мы разбиваем исходный набор обучающих данных на

K

K

Наборы субданных, которые не пересекаются, мы делаем

K

K

Вторичное обучение и проверка модели. Каждый раз мы используем набор дополнительных данных для проверки модели и других

K

1

K-1

Наборы вспомогательных данных для обучения модели. На это

K

K

При обучении и проверке набор дополнительных данных, используемых для проверки модели, каждый раз отличается. Наконец, мы

K

K

Ошибка суб-обучения и ошибка проверки усредняются отдельно.

Недостаточное и переобучение

  • Первый тип заключается в том, что модель не может получить более низкую ошибку обучения.Мы называем это явление недостаточным соответствием;
  • Другой тип заключается в том, что ошибка обучения модели намного меньше, чем ее ошибка на наборе тестовых данных.Мы называем это явление переобучением. На практике нам приходится иметь дело с недооборудованием и переоборудованием одновременно, насколько это возможно. Хотя существует множество факторов, которые могут вызвать эти две проблемы подгонки, здесь мы сосредоточимся на двух факторах: сложности модели и размере обучающего набора данных.

Сложность модели

Рисунок 3.4 Влияние сложности модели на недостаточное и переобучение

Еще один важный фактор, влияющий на недостаточную и избыточную подгонку, — это размер набора обучающих данных. Вообще говоря, если количество выборок в наборе обучающих данных слишком мало, особенно когда количество параметров модели (по элементам) меньше, вероятность переобучения выше. Кроме того, ошибка обобщения не увеличивается по мере увеличения количества выборок в наборе обучающих данных. Поэтому в пределах допустимого диапазона вычислительных ресурсов мы обычно надеемся, что набор обучающих данных будет больше, особенно когда сложность модели высока, например, модель глубокого обучения с большим количеством слоев.

Подгонка полинома

Нормальная посадка

Недостаточное оснащение

Переоснащение

Снижение веса

В предыдущем разделе мы наблюдали явление переобучения, то есть ошибка обучения модели намного меньше, чем ее ошибка на тестовом наборе. Хотя увеличение набора обучающих данных может уменьшить переобучение, получение дополнительных обучающих данных часто обходится дорого. В этом разделе представлен общий метод решения проблем с переобучением: снижение веса.

L2 регуляризация

Снижение веса эквивалентно

L

2

L_2

Регуляризация нормы (регуляризация). Регуляризация добавляет штрафной член к функции потерь модели, чтобы уменьшить значения изученных параметров модели, что является распространенным методом борьбы с переобучением. Сначала опишем

L

2

L_2

Нормализация регуляризации, а затем объясните, почему это также называется снижением веса.

L

2

L_2

Добавлена ​​регуляризация нормы на основе исходной функции потерь модели.

L

2

L_2

Нормальный штрафной срок для получения функции, которую необходимо минимизировать для обучения.

L

2

L_2

Штраф за норму относится к произведению суммы квадратов каждого элемента весового параметра модели и положительной константы. Возьмите функцию потерь линейной регрессии из раздела 3.1 (линейная регрессия)

(

w

1

,

w

2

,

b

)

=

1

n

i

=

1

n

1

2

(

x

1

(

i

)

w

1

+

x

2

(

i

)

w

2

+

b

y

(

i

)

)

2

ell(w_1, w_2, b) = frac{1}{n} sum_{i=1}^n frac{1}{2}left(x_1^{(i)} w_1 + x_2^{(i)} w_2 + b — y^{(i)}right)^2

Например, где

w

1

,

w

2

w_1, w_2

Весовой параметр,

b

b

Параметр отклонения, образец

i

i

Вход

x

1

(

i

)

,

x

2

(

i

)

x_1^{(i)}, x_2^{(i)}

С этикеткой

y

(

i

)

y^{(i)}

, Количество образцов

n

n

. Использовать векторные весовые параметры

w

=

[

w

1

,

w

2

]

boldsymbol{w} = [w_1, w_2]

Средства с

L

2

L_2

Новая функция потерь нормального штрафного члена имеет вид

(

w

1

,

w

2

,

b

)

+

λ

2

n

w

2

,

ell(w_1, w_2, b) + frac{lambda}{2n} |boldsymbol{w}|^2,

Где гиперпараметры

λ

>

0

lambda > 0

. Когда все весовые параметры равны 0, срок штрафа самый маленький. когда

λ

lambda

Когда он больше, штрафной член имеет большую долю в функции потерь, что обычно приближает элемент изученного весового параметра к 0. когда

λ

lambda

Если установлено значение 0, штраф не действует. В приведенной выше формуле

L

2

L_2

Норма в квадрате

w

2

|boldsymbol{w}|^2

После раскладывания

w

1

2

+

w

2

2

w_1^2 + w_2^2

. С

L

2

L_2

После штрафного члена нормы в небольшом пакетном стохастическом градиентном спуске мы будем использовать веса в разделе линейной регрессии.

w

1

w_1

с

w

2

w_2

Метод итерации изменен на

w

1

(

1

η

λ

B

)

w

1

η

B

i

B

x

1

(

i

)

(

x

1

(

i

)

w

1

+

x

2

(

i

)

w

2

+

b

y

(

i

)

)

,

w

2

(

1

η

λ

B

)

w

2

η

B

i

B

x

2

(

i

)

(

x

1

(

i

)

w

1

+

x

2

(

i

)

w

2

+

b

y

(

i

)

)

.

begin{aligned} w_1 &leftarrow left(1- frac{etalambda}{|mathcal{B}|} right)w_1 — frac{eta}{|mathcal{B}|} sum_{i in mathcal{B}}x_1^{(i)} left(x_1^{(i)} w_1 + x_2^{(i)} w_2 + b — y^{(i)}right),\ w_2 &leftarrow left(1- frac{etalambda}{|mathcal{B}|} right)w_2 — frac{eta}{|mathcal{B}|} sum_{i in mathcal{B}}x_2^{(i)} left(x_1^{(i)} w_1 + x_2^{(i)} w_2 + b — y^{(i)}right). end{aligned}

видимый,

L

2

L_2

Вес заказа регуляризации нормы

w

1

w_1

с

w

2

w_2

Умножьте число меньше 1, а затем вычтите градиент без штрафа. следовательно,

L

2

L_2

Регуляризация нормы также называется снижением веса. Ослабление веса увеличивает ограничение модели, которое необходимо изучить, штрафуя параметры модели большими абсолютными значениями, что может быть эффективным при переобучении. В реальных сценариях мы иногда добавляем сумму квадратов элементов отклонения к сроку штрафа.

Pytorch реализация снижения веса

%matplotlib inline
import torch
import torch.nn as nn
import numpy as np
import sys
sys.path.append(".")
import d2lzh_pytorch as d2l

print(torch.__version__)
1.3.1
def fit_and_plot_pytorch(wd):
    # Ослабьте весовые параметры. Названия веса обычно заканчиваются на вес
    net = nn.Linear(num_inputs, 1)
    nn.init.normal_(net.weight, mean=0, std=1)
    nn.init.normal_(net.bias, mean=0, std=1)
    optimizer_w = torch.optim.SGD(params=[net.weight], lr=lr, weight_decay=wd) # Затухание весовых параметров
    optimizer_b = torch.optim.SGD(params=[net.bias], lr=lr)  # Неправильное затухание параметра отклонения
    
    train_ls, test_ls = [], []
    for _ in range(num_epochs):
        for X, y in train_iter:
            l = loss(net(X), y).mean()
            optimizer_w.zero_grad()
            optimizer_b.zero_grad()
            
            l.backward()
            
            # Вызвать пошаговую функцию в двух экземплярах оптимизатора, чтобы обновить вес и смещение соответственно
            optimizer_w.step()
            optimizer_b.step()
        train_ls.append(loss(net(train_features), train_labels).mean().item())
        test_ls.append(loss(net(test_features), test_labels).mean().item())
    d2l.semilogy(range(1, num_epochs + 1), train_ls, 'epochs', 'loss',
                 range(1, num_epochs + 1), test_ls, ['train', 'test'])
    print('L2 norm of w:', net.weight.data.norm().item())

dropout

Расчетное выражение многослойного персептрона имеет вид

h

i

=

ϕ

(

x

1

w

1

i

+

x

2

w

2

i

+

x

3

w

3

i

+

x

4

w

4

i

+

b

i

)

h_i = phileft(x_1 w_{1i} + x_2 w_{2i} + x_3 w_{3i} + x_4 w_{4i} + b_iright)

Вот

ϕ

phi

Есть функция активации,

x

1

,

,

x

4

x_1, ldots, x_4

Вход, скрытый блок

i

i

Весовой параметр

w

1

i

,

,

w

4

i

w_{1i}, ldots, w_{4i}

, Параметр отклонения

b

i

b_i

. Когда для этого скрытого слоя используется метод отбрасывания, скрытые блоки этого уровня будут отброшены с определенной вероятностью. Пусть вероятность отбрасывания равна

p

p

, То есть

p

p

Вероятность

h

i

h_i

Будет очищено, есть

1

p

1-p

Вероятность

h

i

h_i

Разделит на

1

p

1-p

Сделайте растяжку. Вероятность отбрасывания — это гиперпараметр метода отбрасывания. В частности, пусть случайная величина

ξ

i

xi_i

Вероятности быть 0 и 1 равны

p

p

с

1

p

1-p

. При использовании метода отбрасывания мы вычисляем новый скрытый блок

h

i

h_i’

h

i

=

ξ

i

1

p

h

i

h_i’ = frac{xi_i}{1-p} h_i

из-за

E

(

ξ

i

)

=

1

p

E(xi_i) = 1-p

,следовательно

E

(

h

i

)

=

E

(

ξ

i

)

1

p

h

i

=

h

i

E(h_i’) = frac{E(xi_i)}{1-p}h_i = h_i

которыйМетод discard не меняет ожидаемое значение входных данных.

Многослойный перцептрон с использованием метода отбрасывания для скрытого слоя

Реализация отсева в Pytorch

net = nn.Sequential(
        d2l.FlattenLayer(),
        nn.Linear(num_inputs, num_hiddens1),
        nn.ReLU(),
        nn.Dropout(drop_prob1),
        nn.Linear(num_hiddens1, num_hiddens2), 
        nn.ReLU(),
        nn.Dropout(drop_prob2),
        nn.Linear(num_hiddens2, 10)
        )

for param in net.parameters():
    nn.init.normal_(param, mean=0, std=0.01)

Исчезающий градиент и взрывной градиент

Когда нейронная сеть имеет большое количество слоев, численная стабильность модели имеет тенденцию к ухудшению. Предположим, что слой

L

L

Многослойного перцептрона

l

l

Этаж

H

(

l

)

boldsymbol{H}^{(l)}

Весовой параметр

W

(

l

)

boldsymbol{W}^{(l)}

, Выходной слой

H

(

L

)

boldsymbol{H}^{(L)}

Весовой параметр

W

(

L

)

boldsymbol{W}^{(L)}

. Для удобства обсуждения параметр отклонения не рассматривается, а функции активации всех скрытых слоев устанавливаются как отображение идентичности.

ϕ

(

x

)

=

x

phi(x) = x

. Данный ввод

X

boldsymbol{X}

, Первый из многослойных персептронов

l

l

Вывод слоя

H

(

l

)

=

X

W

(

1

)

W

(

2

)

W

(

l

)

boldsymbol{H}^{(l)} = boldsymbol{X} boldsymbol{W}^{(1)} boldsymbol{W}^{(2)} ldots boldsymbol{W}^{(l)}

. В это время, если количество слоев

l

l

Больше,

H

(

l

)

boldsymbol{H}^{(l)}

Расчет может ослабнуть или взорваться. Например, предположим, что входные и весовые параметры всех слоев являются скалярными. Например, весовые параметры равны 0,2 и 5, а выход 30-го слоя многослойного персептрона является входом.

X

boldsymbol{X}

Соответственно и

0.

2

30

1

×

1

0

21

0.2^{30} approx 1 times 10^{-21}

(Затухание) и

5

30

9

×

1

0

20

5^{30} approx 9 times 10^{20}

Продукт (взрыв). Точно так же, когда слоев больше, расчет градиента более подвержен затуханию или взрыву.

Произвольно инициализировать параметры модели

Случайная инициализация PyTorch по умолчанию

Есть много способов случайной инициализации параметров модели. использоватьtorch.nn.init.normal_()Сделайте модельnetВесовые параметры использования метода случайной инициализации нормального распределения. Однако в PyTorchnn.ModuleВ параметрах модуля принята более разумная стратегия инициализации (для конкретного метода выборки различных типов слоев см.Исходный код), поэтому нам вообще не нужно рассматривать.

Ксавье случайная инициализация

Существует также более часто используемый метод случайной инициализации, называемый случайной инициализацией Xavier [1].
Предположим, что количество входов полностью связанного слоя равно

a

a

, Количество выходов

b

b

, Случайная инициализация Xavier сделает каждый элемент весового параметра в этом слое случайным образом выборкой с равномерным распределением

U

(

6

a

+

b

,

6

a

+

b

)

.

Uleft(-sqrt{frac{6}{a+b}}, sqrt{frac{6}{a+b}}right).

Его конструкция в основном учитывает, что после инициализации параметров модели на дисперсию выходных данных каждого слоя не должно влиять количество входов уровня, а на дисперсию градиента каждого слоя не должно влиять количество выходных данных уровня.

резюме

  • Регуляризация добавляет штрафной член к функции потерь модели, чтобы уменьшить значения изученных параметров модели, что является распространенным методом борьбы с переобучением.
  • Снижение веса эквивалентно

    L

    2

    L_2

    Регуляризация нормы обычно приближает изученные весовые параметры к 0.

  • Снижение веса можно пропустить через оптимизаторweight_decayУкажите гиперпараметры.
  • Вы можете определить несколько экземпляров оптимизатора, чтобы использовать разные итерационные методы для разных параметров модели.
  • Мы можем справиться с переобучением, используя метод discard.
  • Метод отбрасывания используется только при обучении модели.
  • Типичными проблемами, связанными с численной стабильностью глубинных моделей, являются затухание и взрыв. Когда нейронная сеть имеет большое количество слоев, численная стабильность модели имеет тенденцию к ухудшению.
  • Обычно нам нужно случайным образом инициализировать параметры модели нейронной сети, например весовые параметры.

0 0 голоса
Рейтинг статьи
Подписаться
Уведомить о
guest

0 комментариев
Старые
Новые Популярные
Межтекстовые Отзывы
Посмотреть все комментарии

А вот еще интересные материалы:

  • Яшка сломя голову остановился исправьте ошибки
  • Ясность цели позволяет целеустремленно добиваться намеченного исправьте ошибки
  • Ясность цели позволяет целеустремленно добиваться намеченного где ошибка
  • Ошибка обновления турбо страницы яндекс wordpress
  • Ошибка обновления статуса промо акции