Ответ на пост «Итоги голосования Пикабутян о ЗП»5
Данное авторское "исследование" - полная херня, и я, социолог по образованию и аналитик данных по профессии, сейчас объясню, почему.
1. Некорректно составленный вопрос о размере доходов.
А именно - шкала ответов. Когда в вариантах ответов указываются числовые диапазоны, они не должны пересекаться друг с другом ни началом, ни концом. Иначе респонденты, попадающие в одно и то же значение пересечения диапазонов будет относить себя к разным группам. У кого-то ЗП 80 тысяч, один отнесёт себя к категории 40-80, другой к 80-120. А это уже разные уровни доходов.
После такого шкалирования можно дальше даже не продолжать. Потому что результаты ответа на такой вопрос искажены наглухо. Но мы продолжим.
2. Региональный вопрос и его интерпретация.
Сначала автор указывает в вариантах ответов только города федерального значения без их областных территорий. А потом натягивает статистику на глобус словами "можно предположить, что к Москве и Питеру относятся так же те, кто работают в МО и ЛО". Не можно. При составлении вопроса нужно было это учесть. И либо выделить эти области отдельными вариантами, либо объединить с центрами "Москва и МО" и "Санкт-Петербург и ЛО".
И опять это критически важно, потому что кто-то будет читать вопрос буквально: "Моего подмосковного города в вариантах нет, но я и не в Москве", поэтому выберет "остальное", а кто-то будет рассуждать "Ну моего города тут нет, но я тут всего в 35 км от СПб, выберу этот вариант". И опять перекосы из-за интерпретации респондентом неоднозначных вариантов ответа в анкете.
3. На первый вопрос ответило больше людей, чем на второй. А отсечь тех, кто на первый вопрос ответил, а второй проигнорировал, автор не потрудился.
4. Как итог, автор накладывает одну искажённую статистику на другую. Миша, всё хуйня, давай по новой, тебе за это никто не заплатит.
5. Если уж искать взаимосвязи между регионами и уровнем доходов, то нужно, как минимум, делать перекрёстную сводную таблицу, как максимум, использовать метод хи-квадрат. Но поскольку опрос создан на непрофильной платформе, у автора просто нет данных в табличном виде, где 1 строка - 1 респондент, и провести адекватный корреляционный анализ он не сможет, только описательная статистика, к тому же ещё и кривая (см. пп. 1 и 2). И размер выборки в данном случае эти проблемы не нивелирует, а только углубляет.
6. И это мы ещё не учитываем, что:
- могут голосовать люди с мультиаккаунтом;
- могут голосовать несовершеннолетние, просто по фану натыкать, потому что могут, и потому что опрос на Пикабу не гарантирует, что ответы будут собираться с юридически дееспособных граждан (в отличие от опросов Росстата, ВЦИОМа, Левады и иже с ними).
И ещё ряд факторов типа поло-возрастной структуры выборки, которые учитываются в официальных исследованиях, но не учитываются тут.
Я всё, можете открывать форточку.
P.S. В Москве 120 тысяч - это немного, а в каком-нибудь Спирово в Тверской области - это прям дорохо-бохато. Поэтому я считаю максимально адекватной мерой оценки финансового благосостояния населения ВЦИОМовскую шкалу, которая уже стала классикой, кто участвовал в телефонных опросах, тот её наверняка встречал: денег не хватает даже на еду; хватает на еду, но не хватает на одежду и т.д.
P.P.S. Как автор посчитал среднее и медиану по диапазонам, для меня, загадка. Видимо, какая-то авторская методика. Среднее, медиану считают по наборам числовых значений, а не по группам диапазонов.
Да ну это всё из разряда опросов про размер зарплат на хабре (популярная там тема одно время была на полных серьёза щщах), где по людейле в интернете выходило, что 100% людей пользуются интернетом.
Мне там прям нещадно сливали карму за невинные вопросы "ну кто ж честно скажет, что работает за чашку риса на галере".