Версия 19:20, 29 июня 2022

Содержание

1 Типизация признаков
2 Нормализация данных
3 Декорреляция
4 Аномалии в наборе данных
5 Пропуски в наборе данных

Типизация признаков

Преобразование числа

Обычно с числами довольно удобно работать и преобразовывают их достаточно редко.

Дискретизация

Преобразование в порядковый признак. (берём в числах диапазоны и диапазонам сопоставляем категории)
Преобразование в категориальный признак. (НО теряется информация о порядке)

Преобразование порядкового типа

рис1. (A<B<C)

Преобразование в число(берём его порядковый номер)
Преобразование в k бинарных категорий(если число значений конечно и равно k):

{[math]ord_1, ..., ord_k[/math]} - множество значений порядкового признака.(см. рис1)

Преобразование категории

рис2. (A<B<C)

Бинарную категорию можно преобразовать в число: или
Категорию из k значений {[math]c_1, ..., c_k[/math]} можно бинаризовать получив k бинарных категорий:[math]b_i(c) := (c = c_i)[/math](см. рис2)(НО обратное преобразование иногда невозможно(получим много true и не понятно, к какой категории относить))
One-hot encoding - преобразование категорий в числа (0, 1): one-hot[math]_i(c) = [c = c_i][/math]

Нормализация данных

Применяются независимо к столбцу X

Важно в sklearn.preprocessing есть метод normalize, но это не то, что нам нужно, он рассматривает нормализацию с геометрической точки зрения (представляет объект в виде вектора), а не по столбцам

Минмакс, [0;1] масштабирование

После нормализации: [math]\min[X_{new}] = 0[/math] и [math]\max[X_{new}] = 1[/math]

Стандартизация, Z-масштабирование

После нормализации: [math]\mathbb{E}[X_{new}] = 0[/math] и [math]\mathbb{D}[X_{new}] = 1[/math]

Декорреляция

рис3

1. Есть матрица X.

2. Матрицу центрировали ([math]\mathbb{E}[X_j] = 0[/math]).

3. Ковариация вычисляется по следующей формуле:

4. Если же матрица нормализована так, что [math]\mathbb{D}[X_j] = 1[/math], то из произведения мы получим не ковариационную, а корреляционную матрицу

5. Декорреляция вычисляется по формуле:

где [math]\Sigma^{1/2}[/math] находится из разложения Холецкого

Утверждение:

После декорреляции:

[math]\Sigma = \dfrac{X^TX}{n}[/math]

.

Аномалии в наборе данных

Аномалии - плохие объекты для построения нашей модели

Задача поиска аномалий является отдельной задачей машинного обучения, про которую можно почитать здесь

Пропуски в наборе данных

Иногда в таблице с данными существую пустоты(они же пропуски), про работу с пропусками можно почитать тут

@@ Строка 9: / Строка 9: @@
 == Преобразование порядкового типа ==
 [[File:Преобразование_порядкового_типа_в_k_категорий.png|250px|thumb|рис1. (A<B<C)]]
 * Преобразование в число(берём его порядковый номер)
 * Преобразование в k бинарных категорий(если число значений конечно и равно k):
@@ Строка 22: / Строка 23: @@
 = Нормализация данных =
 Применяются независимо к столбцу X
@@ Строка 41: / Строка 43: @@
 = Декорреляция =
 [[File:Декорреляция.png|300px|thumb|рис3]]
 . Есть матрица X.
@@ Строка 66: / Строка 69: @@
 = (\Sigma^{-T/2} * \Sigma^{T/2})*(\Sigma^{1/2}*\Sigma^{-1/2}) = I * I = I</tex>.
 }}
+= Аномалии в наборе данных =
+Аномалии - плохие объекты для построения нашей модели
+Задача поиска аномалий является отдельной задачей машинного обучения, про которую можно почитать [http://neerc.ifmo.ru/wiki/index.php?title=поиск_аномалий здесь]
+= Пропуски в наборе данных =
+Иногда в таблице с данными существую пустоты(они же пропуски), про работу с пропусками можно почитать [http://neerc.ifmo.ru/wiki/index.php?title=Работа_с_пропусками_в_наборе_данных тут]

Предварительная обработка данных — различия между версиями

Версия 19:20, 29 июня 2022

Содержание

Типизация признаков

Преобразование числа

Преобразование порядкового типа

Преобразование категории

Нормализация данных

Декорреляция

Аномалии в наборе данных

Пропуски в наборе данных

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты