2

Статистика

Часто говорят, что статистика - это инструмент. На самом деле, нет. У статистики есть инструменты, а сама статистика - это просто усиленный ими здравый смысл. Усиленная способность понимать мир (это в идеале, конечно, а не на практике).

В этом посте я привёл пример как статистика не работает.
То есть, есть запрос посчитать кто опаснее для женщины: "мужчина" или "медведь" и это невозможно посчитать. Тут не вина статистики, тут вина нашего человеческого языка, что нам кажется, что это как-то можно сравнить.

Я сейчас приведу простые примеры, где неоднозначность сведена к минимуму и вы сможете увидеть суть этой неоднозначности. А ещё на этих примерах будет понятно как на самом деле правильно считать среднее


Допустим, вы хотите посчитать среднюю плотность деревьев в лесу.
Здесь нет неоднозначности: совершенно любой человек понимает, что среднее здесь высчитывается относительно площади.
Точный результат - это количество деревьев/площадь леса
Правильная оценка если не хотите считать каждое дерево будет выглядеть так:
Берём карту леса, обводим границы.

Вносим в компьютер и генерируем небольшое количество случайно заданных координат внутри самого леса (технически псевдослучайных, но для любых задач кроме задач типа защиты от взлома, компьютерные псевдослучайные числа можно считать случайными).
Это можно сделать, сгенерировав много координат и отбросив те, что не попали в границы леса. Или разбить лес на много квадратов и просто выбрать некоторые из них и ещё много как.

В зависимости от необходимой точности, можно обойтись 10 точками, а 20 вам хватит для любой реалистичной задачи. Но они должны быть СЛУЧАЙНО выбраны. Я натыкал точек в фотошопе и это не походит. Это не тот рандом, что нужен.

В зависимости от необходимой точности, можно обойтись 10 точками, а 20 вам хватит для любой реалистичной задачи. Но они должны быть СЛУЧАЙНО выбраны. Я натыкал точек в фотошопе и это не походит. Это не тот рандом, что нужен.

Идём с GPS по этим координатам и там измеряем, сколько деревьев попало в квадрат или в радуис заранее уговоренный от точной точки в GPS.
Потом находим среднее арифметическое от этих значений. Важное уточнение, что точки должны быть выбраны генератором случайных чисел. Если они выбраны как либо иначе - то дать верный результат они могут лишь по счастливому совпадению (Большая часть статистики касающейся людей, в той или иной степени рассчитывает на такие счастливые совпадения, но об этом будет потом).

Почему у нас нет никаких неоднозначностей тут? Потому что мы измеряем среднее по площади и никаких других средних тут и не придумаешь.

А что насчёт средней глубины озера?
Если Вы человек - то всё ровно также. Плаваете с GPS координатами по точкам и измеряете глубину и считаете среднее. Оно в пределе совпадает с объёмом воды поделённым на площадь озера.
А если вы - рыба? Если вы рыба, то (в зависимости от того какая рыба), вам может иногда быть более естественным другое определение средней глубины - отвечающее на вопрос: "Какая в среднем глубина озера, если ты находишься в случайной точке воды?"
Это будет среднее не по площади, а среднее по объёму. Если бы была бы формула, описывающая глубину f(x,y) - то в первом случае, нужно посчитать интеграл f(x,y)*x*y*dx*dy, а во втором интеграл f(x,y)*f(x,y)*dx*dy. То есть, в первом случае, по равномерной плотности координат x и y, а во втором по сложной формуле плотности f(x,y).

Но мы не рыбы. Если кто - то будет настаивать, что именно так мерить среднюю глубину - то лучше на всякий случай держаться от него подальше.

Но, технически, он не неправ. Как видите, здесь УЖЕ возникает два ЕСТЕСТВЕННЫХ значения среднего в отличие от леса.

Статистика просто открывает тот факт, что мир - сложный. Мы можем договориться считать что угодно как угодно, но природа явно говорит, что есть много развилок и каждая из них говорит о том, что каждая из них имеет конкретный смысл. Они просто не умещаются в категории повседневного языка.
Проблема с медведем в том, что не только невозможно поставить маячки и провести измерения, но и в том, чтобы договориться среднее что и по чему мы будем считать. И каждый представляет себе в голове что-то отличное от того, что представляет другой.

Кстати, есть задачки, которые вызывали и вызывают спор даже у математиков, потому что неоднозначность прошла мимо радара, человек решил задачу исходя из своего понимания, смотрит на другое решение с другим ответом, а другое понимание ему кажется дурацким и необоснованным. Это относится к так называемому парадоксу Бертрана, потому как если оценка среднего опирается на задание чего-то наугад, то важно очень точно понимать что значит наугад. Если Вам интересно, попробуйте решить эту задачу и написать ответ:

Представьте, что в окружность радиуса R вписан равносторонний треугольник. Мы наугад проводим хорду (отрезок, соединяющий две точки на окружности). Какова вероятность того, что эта случайная хорда окажется длиннее стороны треугольника

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества