181 читали · 1 год назад
Как определить взаимосвязь между категориями
Стандартным приемом для определения взаимосвязи между числовыми колонками является вычисление коэффициента корреляции Пирсона, однако с категориальными данными такой финт не пройдет, так как они, как правило, не упорядочены (читай тут). Рассмотрим способ, который можно использовать. Сначала сгенерируем тестовый набор данных, о присутствии автомобилей разных марок в заданных локациях: import numpy as np import pandas as pd np.random.seed(0) autos_l = ['BMW', 'Mercedes', 'VOLGA', 'GEEP'] locations_l = ['Russia', 'Germany', 'USA'] prob_d = {'BMW':[0...
395 читали · 3 года назад
3 способа найти зависимость в данных
Как определять факторы, влияющие на исследуемую переменную. Рассмотрим некоторые из эффективных и простых подходов. Изучение вопроса проведем на примере игрушечного датафрейма df_m о параметрах доходов...