Помогите разобраться в классификациях аналитиков
На данный момент прохожу курс на junior аналитика данных в яндекс практикуме.
Решил посмотреть тематические каналы, посмотреть вакансии, чтобы как то начать вливаться во все это и столкнулся с такой ситуацией, что
ресурсы посвящены разным ответвлениям аналитики, например когда искал тематические телеграм каналы, там были
- A/B тесты
- продуктовая аналитика
- бизнес аналитика
- BI системы
И тому подобное.
При этом для такой профессии как "Аналитик данных", я каналов не нашел
(Возможно не там или не так искал, буду очень признателен если поделитесь полезными и/или интересными ресурсами по этой теме)
А по вакансиям почти все это бизнес или продуктовый аналитик.
В итоге, есть ли именно профессия аналитика данных, или изучавшие это направление люди, выбирают какую нибудь конкретную тему (BI системы к примеру), и работают и развиваются уже в ней.
Объясните чайнику, не ругайте, не бейте, не оскорбляйте.
P.S. В самом курсе прошел:
- основы python в аналитике
- pandas
- визуализация
- работа с jupyter notebook
Было пока 2 учебных проекта:
Один по очистке, подготовке данных
Второй исследовательский анализ данных.
Наверняка что то забыл, это для понимания, возможно я вообще рано лезу.
Полезная книга для тех кто работает с pandas - "Изучаем pandas"
Авторы: Майкл Хейдт, Артем Груздев
Год: 2019
Количество страниц: 734
Pandas – популярная библиотека Python, применяющаяся для практического анализа данных в реальных проектах. Она предлагает воспользоваться эффективными, быстрыми и высокопроизводительными структурами данных, которые упрощают предварительную обработку и анализ информации. Это учебное пособие существенно поможет вам, предоставив в ваше распоряжение внушительный набор инструментов, предлагаемых библиотекой pandas для выполнения различных операций с данными и их анализа.
Обучение и понимание Pandas 1
В общем, есть меня задачка изучить до автоматизма библиотеки для работы Data.
Ничего лучше, чем придумывать себе задачки и практиковаться не придумал.
Данный пост больше для критики и предложений и поделиться первыми успехами.
Сделал небольшую страницу для получения валютного курса с сайта центробанка.
Предлагаю на обзор и на критику.
Надо ли изучать что-то фундаментально?
У нас в слаке этот вопрос поднимался не единожды. Лично я считаю, что на этапе создания базы надо изучать фундаментально. Не прям всё, но база есть база. Если здесь понимания основ не заложили - дальше о каком изучении может быть речь? Я считаю подход "изучать нужные куски" дилетантским. Он хорошо работает для тех, кто уже имеет базу по данному или очень близкому предмету. Для новичков он совершенно не годится. Поэтому хочу поделиться впечатлением от книги, которую сейчас изучаю.
Stefanie Molin - Hands-On Data Analysis with Pandas, 2nd Edition - 2021
Предупрежу сразу: книга на английском языке. Для счастливых обладателей уровня B2 всё будет понятно, остальным увы - на русском этой книги, вроде как, нет. Если кто нашел - сигнальте.
Так вот, здесь как раз всё разжёвывается и в клювик складывается. Очень много полезных ремарок и советов. Например, в самом начале книги очень подробные инструкции по установке среды. В файлах к книге есть очень полезный файлик для проверки установки, всё ли нужное у вас установилось. И инструкция выглядит не как у некоторых. А у некоторых она выглядит так:
Инструкция, как установить Анаконду:
1. Установить Анаконду.
2. Если не получилось, сделать что-нибудь, чтобы получилось.
Не, в этой книге всё прям по пунктам расписано. Например, кто знал, что для того, чтоб закрыть юпитер, нужно нажать Ctrl-C? Из новичков, кто знал, сознайтесь? Вот!
Очень много ссылок на дополнительную инфу буквально по каждому вопросу! Опять-таки на дополнительную инфу для тех, кому было мало! А не вместо (как у некоторых, да-да).
Объяснение pandas начинается с того, что в структурах данных есть классы питона (имена пишутся верблюжьим способом), а есть объекты (имена пишутся змеиным способом). А далее объясняются основные структуры: DataFrame, Series, Index. И их атрибуты. Дальше рассматриваются способы создания датафрейма и объясняется, каким образом там замешан NumPy. И по ходу дела постоянно полезные советы. Например, как сделать, чтобы при выводе часть столбцов не зажёвывалась:
pd.set_option('display.max_columns', <new_value>)
Вроде бы, автору книги не сильно тяжело о таком рассказывать.
К каждой главе есть куча юпитеровских тетрадок, можно открыть и своими собственными ручками всё потрогать. После убийственного курса гугленья, когда даже ночами снились кошмары о том, как я гуглю вообще всё, нет, ВООБЩЕ ВСЁ, эта книжка - просто умиление какое-то.
В общем, с самых первых страниц эта книга постоянно заставляет меня испытывать это ощущение "Ааа!!! Так вот оно что!", поэтому я ее категорически советую. Читается очень легко, не бойтесь терминологии и специфической лексики, обычного не технического английского вполне хватает. У кого не получается найти книгу, пишите мне, расскажу, где найти.
Статистика. Основы.
Статистика и математика являются важными частями DataScience. Сегодня поговорим про самые простые и довольно часто встречающиеся понятия.
Мода - значение, которое встречается в наборе данных чаще всего, например мода данного набора значений [1,1,2,2,2,2,2,3,3,3] - 2. Для вычисления моды можно использовать метод из Pandas. Пример из официальной документации:
>>> df = pd.DataFrame({'A': [1, 2, 1, 2, 1, 2, 3]})Медиана - если отсортировать список, например список котиков по мере увеличения их роста, в середине будет находиться котик, обладающий самым типичным размером.
>>> df.mode()
A
0 1
1 2
В Pandas есть соответствующий метод median().
Среднее значение - если у нас есть несколько значений, то для нахождения медианы нужно сложить значения и разделить пополам (или же сложить значения и разделить на их количество если их больше, чем два).
Выброс - значение, сильно выбивающееся из ряда значений. Выбросы могут сильно исказить многие статистические методы, поэтому что бы избавиться он них, убирают некий процент самых больших и самых малых значений.
Размах - разница между самым большим и самым малым значением. Так как размах чувствителен к выбросам, для его вычисления применяют межквартильный размах - когда из нашего ряда убраны 25% самых больших и самых малых значений.
Отклонение - разность между средним и самым большим значением.
Стандартное отклонение - для этого нужно сложить все отклонения и поделить на количество значений и возвести в квадрат. std - standard deviation (стандартное отклонение).
>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count 3.0
mean 2.0
std 1.0
min 1.0
25% 1.5
50% 2.0
75% 2.5
max 3.0
dtype: float64
P.S. Данная информация является базовой, для ознакомления с основами статистики, если будет интересно, я буду раз продолжить знакомство со статисткой DataScience.
Что такое PANDAS/PANS-синдромы?
PANDAS (Pediatric Autoimmune Neuropsychiatric Disorders Associated With Streptococcal Infections); PANS (Pediatric Acute-onset Neuropsychiatric Syndrome) - детские аутоиммунные нервно-психические расстройства, вызванные такими инфекциями как стрептококковая инфекция, микоплазма, мононуклеоз, болезнь Лайма и даже вирус гриппа H1N1. Данные синдромы имеют очень интересный механизм действия: иммунная система ребёнка атакует базальные ганглии собственного мозга вместе с агентами инфекций.
Случаи данных синдромов описываются примерно так: обычно это ребенок в возрасте от 3 до 14 лет, который был социально адаптирован, физически крепок, и просто жил, как и все дети его возраста. Но теперь он шагает по кругу в течение нескольких часов, моет руки до крови, произносит одну фразу снова и снова. Родители таких детей впадают в панику, ибо видят как их ребёнок практически сошёл с ума.
Признаки и симптомы PANDAS/PANS включают:
Внезапные симптомы ОКР;
Проблемы с едой, вплоть до анорексии;
Сенсорные проблемы, такие как чувствительность к звуку и свету;
Заметно ухудшается почерк;
Частое мочеиспускание или ночное недержание мочи;
Ухудшаются моторные навыки;
Тики;
Ребёнок становится очень невнимательным и испытывает трудности с памятью;
Панические атаки из-за вещей, которые не имели значения для ребёнка несколько дней назад, такими как грозы или ошибки в тексте;
Страх спать одному;
Крики, длящиеся часами;
Страх перед микробами (мизофобия) и другие более традиционные симптомы ОКР.
В случае обнаружения данных симптомов у Вашего ребёнка, то немедленно обратитесь к педиатру.
Подведём итоги: ПАНДАС/ПАНС - это синдромы компульсий (как при ОКР) и тиков, появляющиеся у детей из-за инфекций. Но к счастью данные патологии являются обратимыми: используется терапия антибиотиками. Также можно попробовать фаготерапию.
Стоит отметить, что несмотря на проведённые клинические исследования, подтверждающие данные синдромы, до сих пор идут споры в научном обществе на счёт "точности" механизмов и возбудителей и данных синдромов.
Если уважаемым пикабушникам будет интересна данная тема, то могу подробнее рассказать про механизм действия синдромов, и немного про собственные эксперименты со стрептококковой инфекцией.
Часть информации взял отсюда (https://kids.iocdf.org/what-is-ocd/pandas/).


