В стандартном процессе обработки данных имеется ряд источников ошибок:
-
ошибки
в первичных данных (ошибки измерений,
сбои информационно – измерительных
систем) — намеренный ввод неправильных
сведений в оперативном режиме, сокращение
текста при вводе данных операторами,
ошибки в данных, полученных путем
обмена, ввод ошибочных данных клиентами,
использование различных форматов
данных в разных системах; -
ошибки,
возникающие в процессе эксплуатации
технологий обработки данных; -
ошибки,
связанные со сбоями вычислительной
техники, программных средств.
Ошибки
вычислительной техники на несколько
порядков менее вероятны, чем ошибки при
занесении данных на носитель. Ошибки в
первичных данных возникают из-за
несовершенства измерительных систем,
средств регистрации и передачи информации.
В результате могут появиться значения
параметров, выходящие за физически
допустимые пределы, ошибки в кодировании
значений ключевых характеристик,
появление двух одинаковых экземпляров
свойств объекта и др.
Можно
выделить четыре категории ошибок
(http://www.dwinfocenter.org/errors.html):
неполные данные, неправильные данные,
непонятные данные, непоследовательные
данные.
Неполные
данные –
т.е. в них имеются отсутствующие записи.
Чаще всего возникает по причине сбоев
в системах сбора данных. Сюда же относятся
отсутствующие
поля – задача
сбора данных решалась частным образом
– хотелось как можно быстрее создать
БД, при этом не думали о будущем. Записи
или поля которые при проектировании не
предусматривались, то есть это был
небрежный проект, без предварительного
исследования источников данных и
информационных потребностей пользователей.
Неправильные
данные — то
есть данные, имеющие ошибки, связаны с:
-
неправильным
применением кодов
— это обычно происходит, когда используются
старые протоколы обработки данных,
исторические данные; -
неправильными
расчетами, агрегацией — эта
ситуация возникает при загрузке уже
ранее вычисленных данных (необходимо
иметь исходные данные для проверки
результатов расчетов); -
ошибочным
вводом информации в источнике данных
– это связано с плохими формами ввода
(последовательность записи года, месяца,
дня в дате, плохое качество бумажного
источника, др.), здесь необходимы более
жесткие системы контроля ввода данных.
Непонятные
данные связаны с:
-
неправильным
парсингом кодов
– это плохо составленный алгоритм
конвертирования кодов или плохое
соответствие двух классификаторов; -
хранением
значений атрибутов в разных полях
— это ситуация, где источник передает
данные по различным каналам связи, на
различных носителях и форматах; -
дупликацией
данных —
возникает в пределах одной системы, а
особенно при объединении разных
источников информации; -
непродуманным
использованием схем форматирования,
чтобы уменьшить использование памяти,
например, можно хранить число в виде 4
байт, а можно сохранить в виде двух
байт, но при этом это число не может
превышать значение 32000,
другой пример, хранение цифровых данных
сначала в символьном виде, а затем в
виде числа – при преобразовании могут
исчезнуть значащие нули; -
применением
неизвестных кодов
– при анализе БД, можно найти неизвестные
значения кодов – это или ошибка при
вводе данных или ошибка в алгоритме
конвертирования – включен не тот код; -
ошибками
несовместимости
– эта категория охватывает наиболее
широкий диапазон проблем, это связано
с единицами измерения, ошибками в
представлении даты и времени,
непоследовательном использовании
различных кодов, др.; -
различными
кодами с одним тем же значением атрибута
– используются
два разных классификатора для одного
объекта; -
непоследовательными
именами и адресами
— это случай различных кодов с одним и
тем же значением, например, при изменении
названия организации можно вести новый
код, а можно создать таблицу «Жизненный
цикл изменения кодов».
Непоследовательные
данные
связаны с:
-
непоследовательными
правилами
получения
вычисленных
характеристик
– это когда значения поля вычисляются
неодинаково по разным формулам, в
зависимости от района, метода; -
непоследовательной
агрегацией данных
— это случай использования различных
правил при вычислении одних и тех же
статистических характеристик в
различных ситуациях, например, в области
исследования климата принят одинаковый
период обобщения данных (30 лет, каждые
5 лет производится пересчет); -
использованием
неодинаковых атомарных единиц
представления данных
– это бывает при использовании разных
моделей данных; -
разными
единицами оценки объемов данных в
логических единицах
— это случай разного использования
единиц хранения атомарной информации; -
непоследовательным
использованием атрибута
– например, можно в поле адрес хранить
всю информацию о клиенте, а можно
отдельно улицу, дом, почтовый индекс,
город, регион, страна, второй случай
более правильный; -
непоследовательной
датой — это
случай непоследовательного использования
атрибута, когда сливаются данные из
двух систем, в которых различная политика
использования дат (дата ввода измерения,
дата ввода в систему, дата передачи); -
непоследовательным
использованием пространства памяти,
пустых значений и так далее,
например, чтобы отмечать отсутствующие
измерения, забракованные или вычисленные
значения, необходимо иметь признак
качества для каждого такого значения
атрибута; -
отсутствием
ссылочной целостности
— может привести к ошибкам в значениях
одних и тех же атрибутов в разных
таблицах; -
не
синхронизированной агрегацией
— некоторая суммарная информация может
быть получена независимо в различных
таблицах, например, среднемесячное
значение можно получить путем агрегации
срочных значений, а можно на основе
среднесуточных значений; -
сложностью
ведения хранилища данных — увеличивается
геометрически со временем –
уходят
специалисты, которые знали данные,
алгоритмы и проблемы БД.
БД
представляют сложные человеко-машинные
системы, реальная достоверность сбора
первичной информации в которых
определяется как надежность работы
технических систем, так и ошибками,
вносимыми операторами. Основными
причинами
искажений
в процессе создания БД являются:
-
отсутствие
или неточность инструкции и стандартов
работы; -
несовершенство
или отсутствие макетов таблиц –
документов, нечеткость заполнения
первичных документов, смятие или
загрязненность первичных (машинных)
документов; -
сложность
применяемых классификаторов и форм
занесения данных, несоответствие макета
первичного документа форме ввода данных
на компьютере; -
недостаточная
квалификация оператора, недобросовестное
отношение к работе – небрежность,
невнимательность, халатность; -
неточность
в документации; -
плохая
организация хранения и учета носителей
информации; -
преднамеренное
искажение информации в корыстных целях; -
недостаточная
сознательность, безразличие и
безответственность в работе; -
организационные
недостатки в работе оператора –
отсутствие постоянного закрепленного
рабочего места, совместительство,
нарушения или отсутствие графика
работы, отвлечение на другие работы; -
обезличка
в работе и отсутствие контроля; -
отсутствие
морального и материального стимулирования
хорошей работы; -
низкая
трудовая дисциплина; -
неритмичность
в работе (много потерь времени на этап
врабатываемости); -
завышенный
темп работы, усталость, возбужденное
или угнетенное состояние оператора; -
недостатки
в организации рабочего места (плохое
освещение, шум), неудобная конструкция
рабочего места, плохая регулировка и
настройка (где лежит документ и
клавиатура); -
недостаточная
автоматизация ввода данных; -
сбои
измерительной системы (неправильная
работа датчика – погрешность измерения,
приближенная запись) и ЭВМ при вводе
данных (залипание клавиш; некачественность,
физический износ и старение технического
носителя; нарушение работоспособности
из-за климатических и механических
воздействий, флуктуации напряжения
питающей сети); -
сбои
аппаратуры при обработке данных
(ошибочное вычисление значения); -
искажения
в процессе передачи данных по каналам
связи (наводки и помехи атмосферного
и производственного характера, шум и
частотные искажения в каналах связи); -
ошибки в алгоритмах
и программах; -
форматные
ошибки (изменение формата атрибута,
количества байт, добавление или пропуск
символа, появление запрещенных символов
в атрибуте, сдвиг атрибутов, нарушающих
шаблон сообщения, пропуск или появление
дополнительных служебных символов,
изменение количества реквизитов).
Средняя
вероятность ошибки при вводе информации
с клавиатуры находится в диапазоне
(0.5-1.5) 10 -3
ошибок / символ.
Методы
контроля данных
Процесс
управления качеством данных можно
разделить на следующие этапы:
– определение
качества исходных данных;
– определение
правил обеспечения качества этих данных;
– разработка
процессов очистки данных;
– внедрение этих
процессов;
– контроль
данных.
Для
этапа исследования можно использовать
средства профилирования – они осуществляют
быстрый анализ данных во всех исходных
системах, выдавая заключение и предлагая
инструкции по построению обработки
данных. Определение и построение правил
обеспечения качества данных крайне
важно для стандартизации, сравнения и
консолидации данных.
Проверка
качества данных становится отдельным
этапом работ при загрузке БД. Обеспечение
качества данных – нетривиальная задача.
Основными методами контроля являются:
-
самоконтроль;
-
дублирование
операций (или части операций) при вводе
информации (двойной ввод); -
применение
помехоустойчивых кодов, базирующихся
на использовании признаков делимости
чисел (четность, нечетность) запрещении
использования некоторых символов,
введение избыточной информации в
передаваемые данные; -
осуществление
программно-логического контроля
(совместимость, непротиворечивость,
нахождение в некотором заданном
интервале значений, дополнение атрибутов
до заданного формата поля, контроль
существования значения атрибута,
сравнение из различных источников).
Для
сведения к минимуму потерь от случайных
искажений требуется создавать или
использовать уже готовые программы:
-
ведения
системного журнала СУБД, подробно
фиксирующего каждую операцию над БД
(описание транзакции, адреса компьютера,
пользователя, время, тип и адрес изменения
данных, значение данных до и после
выполнения транзакции); -
контроля
достоверности, использующие соответствующие
методы контроля данных; -
отката,
создания контрольных точек и повторного
исполнения транзакции, вызвавшей
искажение БД.
Учитывая
характер наиболее массовых ошибок,
целесообразно предусматривать три
категории алгоритмов качества данных
на каждом этапе преобразования информации:
-
контроль
соблюдения форматов записи данных на
носитель (синтаксический контроль); -
контроль
числовых значений параметров и ключевых
характеристик измерений при вводе
данных (семантический контроль); -
контроль
выходной информации из БД (прагматический
контроль).
Синтаксический
– это по существу контроль достоверности
данных, не затрагивающий содержательного
смыслового аспекта информации. Предметом
этого контроля являются контроль
форматов представления данных, шаблонов
и масок ввода данных, наличия атрибутов
(их номенклатуры), порядка следования,
наличие служебных признаков в структуре
сообщения, упорядоченности данных,
появления запрещенных символов,
комбинаций, полноты поступления первичной
информации и сопровождающих ее метаданных.
Семантический
контроль оценивает смысловое содержание
информации, его логичность,
непротиворечивость, диапазон возможных
значений параметров (предельные значения,
область значений), динамику их изменения,
возможных отклонений. Примером
семантического контроля могут служить
переписные листы населения, где двухлетний
мальчик показан женатым, а девятилетний
ребенок — грамотным.
Прагматический
контроль определяет потребительскую
ценность (полезность) информации для
пользователя, своевременность и
актуальность данных, их полноту и
доступность. Реализуется экспертной и
социологической оценкой данных.
При создании БД
очень часто используют средства очистки.
К сожалению, такой подход, позволяет
удалить только ошибочные данные. Средства
очистки данных выполняют базовые функции
контроля данных:
-
проверка
значений атрибутов БД на пределы
допустимого диапазона; -
проверка
орфографии; -
проверка
стандартных сокращений; -
поиск
неверных кодов.
По
назначению
контроль различается на профилактический,
рабочий и генезисный. Профилактический
– тестовый контроль надо проводить как
можно чаще, включать во все этапы
переработки. Рабочий контроль —
диагностический
(проверка работоспособности системы)
устанавливает места и причины
неисправности. Генезисный
контроль проводится для выяснения
технического состояния системы в прошлые
моменты времени с целью определения
причин сбоев и отказов системы, имевших
место в прошлом, сбор статистических
данных об ошибках, их характере – типах
ошибок, величине, последствиях этих
ошибок для пользователя.
По
способу реализации
контроль может быть организационный,
программный, аппаратный и комбинированный.
Организационный
контроль представляет собой комплекс
мероприятий, предназначенный для
выявления ошибок на всех этапах
переработки данных с участием человека.
Методами организационного контроля
являются разработка нормативных
документов, обучение, выборочная
проверка, контроль комплектности
документов, сроков и условий передачи
документов, условий и длительности
хранения технических носителей данных,
кондиционности бланков (носителей) и
качества их заполнения и визуальный
осмотр. Необходимо обеспечить правильный
подбор и обучение персонала, на который
будут возложены проведение наблюдения,
систематический контроль за ходом
наблюдений, широкая разъяснительная
работа. Следует предусмотреть
соответствующие меры во избежание
сознательного искажения фактов, приписок
и т.д., что является не только нарушением
государственной дисциплины, но и прямым
преступлением, наносящим вред интересам
дела.
Программный
контроль основан на программировании
логических методов проверки достоверности
данных. Примерами логического контроля
являются:
-
наличие
связей между отдельными измеряемыми
показателями, например, влажность,
измеренная и вычисленная по значениям
сухого и смоченного термометра; -
сравнение
с измеренными параметрами на соседнем
приборе, станции; -
экстраполяция
значений во времени, статистический
прогноз; -
интерполяция
данных между двумя измеренными значениями
во времени или пространстве; -
счетный
контроль заключается в проверке точности
арифметических расчетов, применявшихся
при составлении отчетности или путем
сравнения полученных данных с другими
источниками по этому же вопросу.
Аппаратный
контроль – контроль значений параметров
на этапе измерений, включается в платы,
служащие для преобразования данных из
физических значений в натуральные
(сопротивление в температуру,
электропроводность в соленость воды,
и т.д.).
По
степени выявления и корректировки
ошибок контроль делится на:
-
обнаруживающий,
фиксирующий только сам факт наличия
или отсутствия ошибки; -
локализующий,
позволяющий определить и место ошибки,
например, искаженный символ, атрибут,
др.; -
исправляющий,
выполняющий функции обнаружения,
локализации и исправления ошибки.
Примерами
исправляющих методов являются:
-
анализ
текста свободного формата
для выявления в данных имен и адресов
позволяет идентифицировать компонент
имени, должности, организации и адреса
даже в случае непоследовательно
введенных данных (стандартизация слов,
связанных с описанием организации,
позволяет программе полностью проверить
данные об организации, включая сокращения,
и стандартизировать описание организации
в едином согласованном формате); -
стандартизация
представления значений некоторых полей
— данные
имен и адресов могут вводиться в
различных форматах, многие из которых
вполне грамматически корректны.
Например, «Улица», «Ул.» и «Ул»
обозначают одно и то же очевидное
понятие в составе адреса, существуют
и другие стандарты для этих и других
подобных случаев, программы стандартизации
трансформируют такие поля в согласованный
набор обозначений; -
проверка
допустимости — средства
распознавания допустимых международных
и национальных адресов, проверяют
допустимость адресных данных.
Оформление
результатов контроля данных
Данные
наблюдения считаются принятыми, если
они прошли контроль и, если потребовалось,
в них внесены исправления. Основными
показателями
качества контроля данных
являются:
-
экономические
– материальные, трудовые и временные
затраты на контроль; -
технико–эксплуатационные
– алгоритмическая сложность контроля,
вид и величина получаемой избыточности,
точность и надежность контроля,
универсальность — возможность использовать
на различных этапах технологического
процесса переработки данных, при решении
различных задач, обработки различных
видов данных; -
системные
– удобство работы, наглядность и форма
представления результатов, требования
к квалификации и количеству операторов,
конфигурация компьютера, необходимое
программное обеспечение.
С
целью унификации и стандартизации
методов контроля данных для международного
обмена данными разрабатываются
Руководства по алгоритмам и процедурам
контроля данных, представляемых в
систему международного обмена данными.
В них рассматриваются алгоритмы и
процедуры «базового» или общего
контроля, которые в максимальной степени
беспристрастны и опираются на общеизвестные
физические законы и не допускающие
множества толкований логических
категорий.
Как
бы тщательно ни был составлен инструментарий
наблюдения, проведен инструктаж
исполнителей, материалы измерения
всегда нуждаются в контроле. Прежде
всего, проверяется полнота охвата
наблюдениями. С этой целью производится
сверка данных по спискам, пересчитываются
заполненные документы. Одновременно
на этой стадии проверяется полнота
заполнения форм отчетности, анкет и
т.д.
Содержанием
контроля данных является выполнение
комплекса проверок, позволяющих убедиться
в общей пригодности данных для решения
различных научных и производственных
задач.
Проблема
контроля данных очень сложная и требует
отдельного рассмотрения в зависимости
от специфики конкретного вида данных.
Контроль данных на технических носителях
состоит из трех этапов:
-
контроль
сопроводительных документов и форматов
записи (тестирование носителя данных,
получение контрольных распечаток); -
проверка
соответствия полноты и содержания
массивов программе наблюдений; -
контроль
значений физических параметров и
характеристик пространственно-временного
размещения наблюдений (проверка
упорядоченности данных, полноты
наблюдений, реальности данных, соблюдения
физических законов, проверка на
статистические критерии, закономерностей
изменения данных в пространстве и во
времени).
Подготовка
данных к обмену представляет собой
передачу сведений о контроле и калибровке
измерительных приборов, о массиве
данных, об оценке его качества. Выполнение
всех этих этапов контроля позволяет
повысить качество обмениваемых комплектов
данных.
Данные,
представляемые в обмен, должны быть
снабжены сопроводительной документацией,
содержащей описание структуры данных,
сведения об источниках данных. Ключевые
характеристики в БД должны содержать
сведения о пространственно – временных
координатах каждого измерения, типе
платформ, размерностях параметров,
используемых методах измерений, типах
приборов, а сами результаты измерений
и определений должны быть исправлены
инструментальными поправками. Значения
параметров должны быть приведены с
точностью, соответствующей паспортным
характеристикам измерительных систем
и возможностям аналитических методов
определений.
Каждому
измеренному, определенному или
вычисленному параметру после контроля
должен быть присвоен признак качества,
не менее трех градаций – значение
достоверно, сомнительно и забраковано.
Для данных о природной среде используются
следующие градации:
0
– величина не вызывают сомнений;
1
– величина восстановлена;
2
– величина сомнительна;
3
– величина забракована;
4
— наблюдения не проводились;
5
– явление отсутствует;
6
– величина сомнительна по применяемым
алгоритмам контроля;
7-8
–резерв;
9
– контроль качества не проводился.
На
основе анализа статистики этих признаков
качества делается вывод о качестве
всего массива данных. Для обозначения
качества БД рекомендуется использовать
следующие коды:
0 все данные
не вызывают сомнений;
-
небольшая
часть данных сомнительна (0-10%), но может
быть использована; -
существенная
часть данных сомнительна (10-50%), но может
быть использована; -
более
половины данных сомнительны (50-80%), но
могут быть использованы; -
почти
все данные сомнительны (80-100%), но могут
быть использованы; -
небольшая
часть данных сомнительна (0-10%), но не
может быть использована; -
существенная
часть данных сомнительна (10-50%), но не
может быть использована; -
более
половины данных сомнительны (50-80%), но
не могут быть использованы; -
резерв;
-
информация
о качестве массива данных отсутствует.
Организация
работ по повышению качества данных
Соседние файлы в папке Lektsii
- #
- #
- #
- #
- #
- #
- #
- #
- #
- #
- #
Качество данных (КД) – характеристика, которая отражает степень их пригодности к использованию. В зависимости от сферы использования это понятие может относиться и к набору значений количественных либо качественных переменных.
Во время недавних опросов, проведенных в среде высшего руководства 1 200 компаний Европы и США, более 97% респондентов указали, что ошибки в контактных клиентских данных являются для них серьезной проблемой. Оказалось, что 83% фирм терпят финансовые убытки из-за низкого качества информации. По оценкам специалистов, они оцениваются в среднем в размере 15% от реальных доходов компаний. При этом лишь 35% фирм централизованно управляют данными. Кроме того, аналитики авторитетного агентства Gartner установили, что плохое качество используемых данных отрицательно влияет на продуктивность работы различных компаний, из-за чего их производительность сокращается на 20%.
Источники и процессы работы с данными
К источникам данных относятся следующие объекты:
- наборы данных;
- традиционные системы, предназначенные для записывания выполняемых операций;
- документы;
- операции с информацией.
С данными могут проводиться следующие манипуляции:
- перемещение информации из того или иного источника в определенную базу данных, а также объединение данных в одном формате;
- преобразование, то есть подготовка имеющейся информации к последующему хранению в оптимальной форме, благодаря чему существенно упрощается реализация запросов пользователей, которые требуются для принятия решений;
- загрузка, предусматривающая размещение данных в хранилище посредством добавления фактов или же внесения корректировок в уже имеющиеся;
- анализ в виде Data Mining, OLAP либо сводных отчетов;
- выдача результатов в приемлемом для юзера виде.
Эти сведения применяются в словаре метаданных (СМ), в который автоматически добавляются словари источников данных, а также описываются форматы для того чтобы в дальнейшем их был удобнее согласовать между собой. Помимо этого, в словаре метаданных присутствует информация касательно периодичности пополнения и о том, каким образом данные согласованы между собой по времени. Ключевой задачей словаря метаданных является освобождение разработчика от необходимости самостоятельного стандартизирования всей информации. Следует стремиться к тому, чтобы создаваемое хранилище никоим образом не конфликтовало с используемыми системами.
Вся информация зачастую предоставляется пользователям в формате многоразмерных баз данных. В качестве измерения может использоваться стоимость, время, географический регион и другие факторы, выбор которых определяется сферой бизнеса.
Зачем нужен контроль качества данных
Одним из ключевых требований, которому должна соответствовать грамотная база данных и выбранная система сбора информации – высокое качество данных. На основании полученной информации в дальнейшем будут рассчитываться показатели, демонстрирующие, насколько эффективно ведется бизнес и является ли он на данный момент стабильным.
Если окажется, что сохраненные данные содержат ошибки, в дальнейшем это может привести к неправильному выполнению расчетов, а это может спровоцировать серьезные убытки для предприятия. По этой причине большинство крупных компаний, работа которых характеризуется большими денежными оборотами, уделяют особенное внимание контролю качества данных.
При этом для многих фирм одним из ключевых факторов является сумма затрат, которые требуются для реализации грамотной системы контроля данных. Крупные организации готовы выделять большие бюджеты, чтобы организовать полноценную проверку загружаемой в базу информации, а также ее очистку от бесполезных сведений. В то же время нередко случается так, что даже крупные компании, организовывая работу собственного хранилища данных, не принимают во внимание, что контроль качества данных должен выполняться на постоянной основе, поэтому такие мероприятия не заложены в их бюджет. Не в последнюю очередь это объясняется ограниченным финансированием IT-отделов, из-за которого сложно выделить отдельного сотрудника, в обязанности которого входил бы только постоянный контроль данных.
Кто должен заниматься контролем
Перед важными расчетами необходимо быть уверенным в качестве исходных данных. Кроме назначения ответственного за качество персональных и других данных, компании должны проводить разъяснительную работу среди сотрудников, чтобы они были готовы выполнять некоторую часть этой работы. У таких пользователей больше возможностей понять и выявить производственные причины, по которым появляется бессмысленная или просто неверная информация.
Характеристики качества данных
Качество данных определяется рядом международных и российских стандартов. При этом стоит отметить, что к данному понятию относятся исключительно сведения, которые в дальнейшем используются для принятия управленческих решений.
Качество данных определяется на основании нескольких ключевых критериев:
- происхождение загружаемой информации;
- полнота полученных сведений;
- то, насколько своевременно они были получены;
- насколько точной является информация.
В соответствии с нормами, указанными в стандарте ISO/IEC25012:2008, к ним добавляют следующие характеристики: конфиденциальность, легкость получения доступа к имеющимся данным, результативность их использования, а также возможность их восстановления. Зависимыми от применяемых систем являются 10 из 15 характеристик качества основных данных.
Объективная оценка качества поступающих данных предусматривает контроль нескольких факторов:
- правильность;
- легкость получения доступа;
- сумма, необходимая для обеспечения качества;
- сумма, которую компании нужно тратить для того, чтобы исправить допущенные ошибки.
Чтобы иметь возможность применять метрики, необходимо использовать правила проверки, которые формализуют порядок, в соответствии с которым сотрудниками компании выполняется расчет и измерение указанных факторов. Чтобы добиться реального результата, недостаточно отталкиваться только от стандартных правил и метрик, требуется комплексный подход.
Управление качеством основных данных: главные принципы
Чтобы обеспечить высокое качество используемой информации, компании должны выполнять несколько базовых условий:
1. Работа с сотрудниками компании всех уровней. В данном случае речь идет и о рядовых специалистах, и о топ-менеджерах компании. Это важно для оптимизации работы компании.
2. Организация управления КД путем влияния на источник, из которого поступает вся информация. Не стоит считать, что достаточно обращать внимание на точность информации, получаемой в результате проведенных изменений и внесении корректировок, чтобы обеспечить стабильно высокое качество данных. Добиться действительно высоких результатов можно только в том случае, если используемая система управления КД затрагивает источник, из которого добывается информация.
3. Регулярная модернизация. КД должно постоянно усовершенствоваться. Чтобы это реализовать, нужен серьезный подход к проверке информации, полученной в результате проведения измерений, а также к постоянной корректировке основных данных. Следует понимать, что даже в таком случае ошибки неизбежны. Исключить их повторяемость можно только посредством проведения глубокого анализа и поиска причин, которые мешают росту качества основных данных. Так что компании нужно позаботиться о модернизации не только используемых процессов управления данными, но и в принципе любых бизнес-процессов, реализация которых предусматривает использование какой-либо информации.
Системное управление качеством основных данных
Управление качеством данных опирается на три важнейших элемента.
Организационная структура
Создание грамотной организационной структуры помогает более эффективно распределять роли, а также назначать сотрудников, которые в дальнейшем будут нести ответственность за правильность обработки и выполнения других операций по обработке информации. Зачастую крупные организации, которые уделяют особое внимание качеству данных, создают для этого специальные отделы, ответственные за оперативный оборот данных и отслеживание любых операций с ними.
Процессы управления КД
В соответствии ГОСТом и другими стандартами процессы управления КД делятся на три группы: выполнение операций над данными,
непрерывный контроль качества данных, повышение КД.
Инструменты управления КД
У бизнеса есть широкий арсенал инструментальных систем для обработки и выполнения операций с данными. К ним относятся системы управления мастер-данными, продукты Data Quality, программы для работы с аналитикой.
Качество данных для BI-системы
BI-технологии – современные и эффективные инструменты для получения и анализа бизнес-данных. Они автоматизируют обработку даже крупных объемов информации, жизненно необходимой руководству компании для принятия решений.
Современные BI-решения развиваются по четырем направлениям:
1. Хранение. Сохранение данных, применяемых для бизнес-анализа, организуется в хранилищах data warehouse. Данные собираются из различных транзакционных источников. Их структурируют таким образом, чтобы обеспечить наибольшую эффективность в процессе поиска, извлечения и обработки.
2. Интеграция. Интеграционная составляющая BI-системы представляет собой инструменты для работы с данными.
3. Анализ. Это самый важный блок BI-систем, в котором применяются OLAP-инструменты, позволяющие рассматривать различные срезы данных и выявлять тренды и зависимости, в соответствие с выбранными критериями.
К ключевым задачам BI-систем относятся:
- повышение эффективности управления бизнесом;
- снижение издержек;
- поддержка принятия стратегических решений;
- снижение управленческих рисков;
- операционный контроль.
Качество данных и ETL
Важнейшей составляющей BI-систем являются процедуры ETL (Extraction, Transformation, Loading). При их реализации часто возникают проблемы, связанные с качеством данных:
- Несколько значений одного и того же показателя.
- Множество источников данных.
- Разные уровни истории. Это серьезная и распространенная проблема. Для ее решения приходится пользоваться несколькими источниками. Например, это могут быть отчетности за разные годы.
- Чистота и точность данных. Данные включаемые в хранилище, обязательно должны проверяться на чистоту.
- Дробление для проверки и дальнейшего утверждения.
Дисциплина КД
Любая проблема, связанная с КД, влечет за собой значительные и неожиданные расходы. Чтобы их избежать, специалисты рекомендуют придерживаться следующих несложных правил:
- Осуществлять оценку качества данных до начала разработки конкретного проекта.
- Уделять внимание, прежде всего, проверке и оценке, а не технологии ПО. Для этой цели можно отчасти использовать инструменты для профилирования данных.
- Проводить проверку на старте каждого этапа разработки BI-системы. Так можно минимизировать убытки и избежать задержек запуска проектов или остановки производственных процессов.
- Проверять, все ли данные, необходимые для выполнения решаемой задачи, в наличии. При этом масштаб оценки должен определяться пользовательскими требованиями.
Этапы проверки КД
Процедура проверки качества данных выполняется в четыре шага, после каждого из которых назначаются сотрудники, которые в дальнейшем будут нести ответственность за внесение каких-либо корректировок в аналитическую или учетную системы:
- Контроль качества всей загружаемой информации. Грамотно устроенная система контроля качества данных предусматривает использование встроенных интеграционных шлюзов, работающих на основании заранее заложенных правил контроля, в соответствии с которыми выполняется проверка данных, поступающих из любых источников. За счет использования такого решения можно значительно сократить время, необходимое для загрузки информации. К перечню таких правил относится выполнение проверки любых загружаемых данных на предмет целостности, присутствия всех необходимых взаимосвязей и атрибутов, которые в дальнейшем будут отображаться в учете для формирования правильной отчетности. Этот этап является одним из наиболее важных, так как в дальнейшем за счет него можно будет быстро поправить систематические недочеты, а также обучить персонал внимательному учету данных.
- Контроль качества данных после их загрузки. Сюда входит выполнение определенного перечня мероприятий, чтобы убедиться в полноте полученных данных на агрегатном уровне. Если мероприятия по контролю КД не проводились до загрузки в базу данных, то в таком случае все они должны быть выполнены уже после проведения загрузки. Если в процессе проведения указанных операций будет обнаружено, что данные не соответствуют правилам и им требуются поправки, создается специализированный протокол ошибок и выполненных корректировок. В дальнейшем протокол может использоваться для того чтобы дополнить оформленную отчетность полезной информацией, что особенно важно, к примеру, для компаний, работающих в банковской сфере. Также на этом этапе проверяется полнота информации, соответствие сделок.
- Контроль КД после расчета агрегатов. На этом шаге выполняется проверка корректности загруженной информации, полученной в результате вычислений с использованием набора различных сведений. После устранения ошибок, которые были обнаружены на этом этапе, может осуществляться расчет отчетных форм.
- Контроль качества рассчитанных отчетов. Данный этап требуется для того чтобы уполномоченные сотрудники компании могли убедиться в том, что составленная отчетность отражает достоверную информацию. Выполняется классический контроль данных, а также ручная верификация формы на уровне детальных данных.
Даже обеспечив корректность данных, невозможно автоматически получать достоверную и качественную отчетность. В ближайшее время вряд ли стоит ожидать окончательную автоматизацию подобных процессов.
Функции контроля КД помогают отследить ошибки и вовремя внести требующиеся коррективы в структуру и методы учета. С их помощью можно оперативно вносить необходимые изменения, когда отчетность готовится в авральном режиме. Во многом эффективность работы зависит от правильного распределения ответственности. Сочетание автоматизированных средств загрузки данных, их контроля и расчета с оперативной реакцией персонала обеспечивает конечный успех.
24.12.2019
С этим файлом связано 5 файл(ов). Среди них: Задания надзор.docx, oahomwrkmm_ovs_1-1 (5).pdf, 1 Практическая Дрозд Л.А..docx, Studbooks_245164.rtf, Pogreshnost_okruglenia.pptx.
Показать все связанные файлы
Подборка по базе: Курсовой проект контроль качества вент-ии.docx, Доклад. Актуальные проблемы совершенствования системы управления, Контроль качества изготовления деталей.docx, Лабораторная работа №1 по дисциплине «Интеллектуальные системы и, Лекция 2 Организация и методы сбора информации. Анализ предметно, Контроль качества.docx, ВЗК-182С Воскобойников Н.А Правовое обеспечение информационной б, Ненашева. Системы управления биотехнологическими процессами.docx, Курсовая работа Правовые системы.docx, Тема 1.1. Сущность понятия «дополнительное образование».pdf
1
Тема: Основные понятия качества информационной системы.
Качество информационной системы — это совокупность свойств системы, обусловливающих возможность ее использования для удовлетворения определенных в соответствии с ее назначением потребностей. Количественные характеристики этих свойств определяются показателями, которые необходимо контролировать и учитывать. Основными показателями качества информационных систем являются надежность, достоверность, безопасность (см. выше), эффективность.
Надежность. Это- свойство системы сохранять во времени в установленных пределах значения всех параметров, характеризующих способность выполнять требуемые функции в заданных режимах и условиях применения.
Надежность — важнейшая характеристика качества любой системы, поэтому разработана специальная теория — теория надежности.
Теория надежности может быть определена как научная дисциплина, изучающая закономерности, которых следует придерживаться при разработке и эксплуатации систем для обеспечения оптимального уровня их надежности с минимальными затратами ресурсов.
Надежность — комплексное свойство системы; оно включает в себя более простые свойства, такие как безотказность, ремонтопригодность, долговечность и т д.
Безотказность — свойство системы сохранять работоспособное состояние в течение некоторого времени или наработки (наработка — продолжительность или объем работы системы).
Ремонтопригодность — свойство системы, заключающееся в приспособленности к предупреждению и обнаружению причин возникновения отказов, повреждений и поддержанию, и восстановлению работоспособного состояния путем проведения технического обслуживания и ремонтов.
Долговечность — свойство системы сохранять при установленной системе технического обслуживания и ремонта работоспособное состояние до наступления предельного состояния, то есть такого момента, когда дальнейшее использование системы по назначению недопустимо или нецелесообразно.
Показатель надежности — это количественная характеристика одного или нескольких свойств, определяющих надежность системы. В основе большинства показателей надежности лежат оценки наработки системы, то есть продолжительности или объема работы, выполненной системой.
Показатель надежности, относящийся к одному из свойств надежности, называется единичным.
Комплексный показатель надежности характеризует несколько свойств, определяющих надежность системы.
На сегодняшний день разработано много конкретных практических способов повышения надежности информационных систем.
Для обеспечения надежности технических средств чаще всего выполняется:
1) резервирование (дублирование) технических средств (компьютеров и их компонентов, сегментов сетей и т. д.);
2) использование стандартных протоколов работы устройств ИС;
3) применение специализированных технических средств защиты информации.
Для обеспечения надежности функционирования программного комплекса ИС выполняется:
1) тщательное тестирование программ, опытное исполнение программы с целью обнаружения в ней ошибок (обязательное условие эффективного тестирования — по крайней мере один раз выполнить все разветвления программы в каждом из возможных направлений);
2) использование стандартных протоколов, интерфейсов, библиотек процедур, лицензионных программных продуктов;
3) использование структурных методов для обеспечения надежной работы программных комплексов (иерархическое построение программ, разбиение программ на сравнительно независимые модули и т. д.);
4) изоляция параллельно работающих процессов, в результате чего ошибки в работе одной программы не влияют на работу операционной системы и других программ.
Надежность информационных систем не самоцель, а средство обеспечения своевременной и достоверной информации на ее выходе. Поэтому показатель достоверности функционирования имеет для информационных систем главенствующее значение.
Достоверность.
Достоверность
функционирования — свойство системы, обусловливающее безошибочность производимых ею преобразований информации. Достоверность функционирования информационной системы полностью определяется и измеряется достоверностью ее результатной информации.
2
Достоверность информации — это свойство информации отражать реально существующие объекты с необходимой точностью. Достоверность информации измеряется вероятностью того, что отражаемое информацией значение параметра отличается от истинного значения этого параметра в пределах необходимой точности.
Одним из наиболее действенных средств обеспечения достоверности информации в ИС является ее контроль. Контроль — процесс получения и обработки информации с целью оценки соответствия фактического состояния объекта предъявляемым к нему требованиям и выработки соответствующего управляющего решения.
Методы контроля достоверности информации, применяемые в ИС, весьма разнообразны.
Классификация методов контроля может быть выполнена по большему числу признаков, в частности: по назначению, по уровню исследования информации, по способу реализации, по степени выявления и коррекции ошибок.
Классификация методов контроля достоверности по назначению
Профилактический контроль и одна из наиболее распространенных его форм — тестовый контроль, предназначены для выявления состояния системы в целом и отдельных ее звеньев до включения системы в рабочий режим. Целью профилактического контроля, осуществляемого часто в утяжеленном режиме работы системы, является выявление и прогнозирование неисправностей в ее работе с последующим их устранением.
Рабочий контроль, или контроль в рабочем режиме, выполняется в процессе выполнения системой возложенных на нее функций. Он, в свою очередь, может быть разделен на функциональный контроль и контроль качества продукции. Функциональный контроль может преследовать цель либо только проверки работоспособности (отсутствия неисправностей) системы, либо, кроме того, установления места и причины неисправности (диагностический контроль).
Контроль качества продукции является контролем достоверности информации как одного из важнейших показателей качества продукции выпускаемой ИС.
Генезисный контроль проводится для выяснения технического состояния системы в прошлые моменты времени с целью определения причин сбоев и отказов системы, имевших место в прошлом; сбора статистических данных об ошибках, их характере, величине и последствиях (экономических потерях) этих ошибок для ИС.
Классификация методов контроля достоверности по уровню исследования информации
Синтаксический контроль — это, по существу, контроль достоверности данных, не затрагивающий содержательного, смыслового аспекта информации. Предметом синтаксического контроля являются отдельные символы, реквизиты, показатели: допустимость их наличия, допустимость их кодовой структуры, взаимных сочетаний и порядка следования.
Семантический контроль оценивает смысловое содержание информации, ее логичность, непротиворечивость, согласованность, диапазон возможных значений параметров, отражаемых информацией, динамику их изменения.
Прагматический контроль определяет потребительную стоимость (полезность, ценность) информации для управления, своевременность и актуальность информации, ее полноту и доступность.
Классификация методов контроля достоверности по способу реализации
Организационный контроль достоверности является одним из основных в ИС. Он представляет собой комплекс мероприятий, предназначенных для выявления ошибок на всех этапах участия эргатического звена в работе системы, причем обязательным элементом этих мероприятий является человек или коллектив людей.
Программный контроль основан на использовании специальных программ и логических методов проверки достоверности информации или правильности работы отдельных компонентов системы и всей системы в целом.
Программный контроль, в свою очередь, подразделяется на программно-логический, алгоритмический и тестовый.
Программно-логический контроль базируется на использовании синтаксической или семантической избыточности; алгоритмический контроль использует как основу вспомогательный усеченный алгоритм преобразования информации, логически связанный с основным рабочим алгоритмом.
Аппаратный контроль реализуется посредством специально встроенных в систему дополнительных технических схем. Этот вид контроля также подразделяется на непрерывный и оперативный (аппаратно-логический) контроль достоверности, а также непрерывный контроль работоспособности.
Классификация методов контроля достоверности по степени выявления и коррекции
ошибок
Обнаруживающий фиксирует только сам факт наличия или отсутствия ошибки.
3
Локализующий позволяет определить, как факт наличия, так и место ошибки (например, символ, реквизит и т. д.).
Исправляющий выполняет функции и обнаружения, и локализации, и исправления ошибки.
Эффективность. Это свойство системы выполнять поставленную цель в заданных условиях использования и с определенным качеством. Показатели эффективности характеризуют степень приспособленности системы к выполнению поставленных перед нею задач и являются обобщающими показателями оптимальности функционирования ИС, зависящими от локальных показателей, каковыми являются надежность, достоверность, безопасность.
Кардинальным обобщающим показателем является экономическая эффективность системы, характеризующая целесообразность произведенных на создание и функционирование системы затрат.
Качество ИС связано с дефектами, заложенными на этапе проектирования и проявляющимися в процессе эксплуатации. Любые свойства ИС, в том числе и дефектологические, могут проявляться лишь во взаимодействии с внешней средой, включающей технические средства, персонал, информационное и программное окружение.
В зависимости от целей исследования и этапов жизненного цикла ИС дефектологические свойства разделяют на дефектогенность, дефектабельность и дефектоскопичность.
Дефектогенность определяется влиянием следующих факторов:
— численность разработчиков ИС, их профессиональными и психофизиологическими характеристиками;
— условия и организация процесса разработки ИС;
— характеристики инструментальных средств и компонентов ИС;
— сложность задач;
— степень агрессивности внешней среды (потенциальная возможность внешней среды вносить преднамеренные дефекты, например, воздействие вирусов).
Дефектабельность характеризует наличие дефектов ИС и определяется их числом и местонахождением. Другими факторами, влияющими на дефектабельность являются:
— структурно-конструктивные особенности ИС;
— интенсивность и характеристики ошибок, приводящих к дефектам.
Дефектоскопичность характеризует возможность проявления дефектов в виде отказов и сбоев в процессе отладки, испытаний или эксплуатации. На дефектоскопичность влияют:
— количество, типы и характер распределения дефектов в ИС;
— устойчивость ИС к проявлению дефектов;
— характеристики средств контроля и диагностики дефектов;
— квалификация обслуживающего персонала.
Оценка качества ИС является крайне сложной задачей ввиду многообразия интересов пользователей. Поэтому невозможно предложить одну универсальную меру качества и приходится использовать ряд характеристик, охватывающих весь спектр предъявляемых требований. Наиболее близки к задачам оценки качества ИС модели являются задачи оценки качества программного обеспечения, являющегося одной из важных составных частей системы. В настоящее время используется несколько абстрактных моделей качества программного обеспечения, основанных на определении характеристики и показателя качества, критерия и метрики.
Критерий может быть определен как независимый атрибут ИС или процесса ее создания. С помощью такого критерия может быть измерена характеристика качества ИС на основе той или иной метрики. Совокупность нескольких критериев определяет показатель качества, формируемый исходя из требований, предъявляемых к системе. В настоящее время наибольшее распространение получила иерархическая модель взаимосвязи компонент-качества ИС. Вначале определяются характеристики качества, в числе которых могут быть, например, общая и исходная полезность, удобство эксплуатации. Далее формируются показатели, к числу которых могут быть отнесены: практичность, целостность, корректность, удобство обслуживания, оцениваемость, гибкость, адаптируемость, мобильность, возможность взаимодействия. Каждому показателю качества ставится в соответствие группа критериев. Надо отметить, что один и тот же критерий может характеризоваться несколькими показателями.
Итак, при оценке качества информационной системы используются показатели качества и соответствующие им критерии:
1) практичность — работоспособность, возможность обучения, коммуникативность, объем ввода, скорость ввода-вывода;
2) целостность — регулирование, контроль доступа;
3) эффективность — эффективность использования памяти и функционирования;
4) корректность — трассируемость, завершенность, согласованность;
4
5) надежность — точность, устойчивость к ошибкам, согласованность, простота;
6) удобство обслуживания — согласованность, простота, краткость, информативность, модульность;
7) оцениваемость — наличие измерительных средств, информативность, модульность;
8) гибкость — распространяемость, общность, информатирован-ность, модульность;
9) адаптируемость — общность, информативность, модульность, аппаратная и программная независимость;
10) мобильность — информативность, модульность, аппаратная и программная независимость;
11) возможность взаимодействия- модульность, унифицируемость процедур связи, унифицируемость данных.
С помощью метрик можно дать количественную или качественную оценку качества ИС.
Рассмотрим типы метрик и шкал для измерения критериев.
Первый тип — метрики, которые используют интервальную шкалу, характеризуемую относительными величинами или реально измеряемыми физическими показателями (например, временем наработки на отказ, вероятностью ошибки, объемом информации и др.).
Второй тип — метрики, которым соответствует порядковая шкала, позволяющая ранжировать характеристики путем сравнения с опорными значениями.
Третий тип — метрики, которым соответствует номинальная шкала, определяющая наличие рассматриваемого свойства или признака у рассматриваемого объекта без учета градаций по этому признаку. Например, интерфейс может быть «простым для понимания», «умеренно простым» и
«сложным для понимания».
Развитием иерархического подхода является представленная на рис. модель классификации критериев качества ИС. Имеется два типа критериев:
1) функциональные критерии (с их помощью оценивается степень выполнения ИС основных целей или задач);
2) конструктивные критерии (предназначены для оценки компонентов ИС, не зависящих от ее целевого назначения).
Существует три основных определения, относящихся к качеству ИС:
1.
Качество ИС — совокупность полезных свойств системы с точки зрения пользователей в соответствии с ее назначением и предъявленными к ней требованиями.
2.
Характеристика качества ИС — понятие, отражающее отдельные измеримые факторы, влияющие на качество системы.
3.
Критерий качества — численный показатель, характеризующий оцениваемое свойство системы и обеспечивающий возможность определения затрат, необходимых для достижения требуемого уровня качества.
Критерии качества информационных систем:
5
Рис. Модель классификации критериев качества информационных систем
Стандарты серии ИСО 9000 впервые создали общую основу для стандартов на системы управления качеством, применимых, в том числе и при разработке ИС. Их концептуальной основой является процессный подход, суть которого определяется тем, что любую деятельность можно представить в виде сети процессов, каждый из которых характеризуется входными и выходными данными.
Важнейшей компонентой ИС является ее интеллектуальная составляющая, содержание которой выражено в программных средствах.
Задания для самоконтроля:
1. Составить тест 10 вопросов (1 вопрос – 1 категория).
2. Создать схемы:
— типы метрик и шкал для измерения критериев;
— показатели качества и соответствующие им критерии;
— дефектологические свойства;
— методы контроля достоверности по степени выявления и коррекции ошибок;
— методы контроля достоверности по способу реализации;
— методы контроля достоверности по уровню исследования информации;
— методы контроля достоверности по назначению;
— основные понятия качества информационной системы.