Зачем мне энтропия в ML
В современном мире, где данные становятся основным капиталом компаний, способность понимать методы энтропии и теорию информации выходит на передний план в области машинного обучения, дата-сайенса и ML-инженерии.
Иначе продакшен будет бесконечно искать эффективные данные для своих моделей…
Теория, основанная на работах Клода Шеннона, дает нам формальные инструменты для измерения количества информации, содержащейся в сигналах, системах и данных.
Знаешь теорию энтропии и информации – знаешь КПД данных.
Энтропия, взаимная информация, скорость передачи данных, оптимизация кодирования и шума в каналах – все это позволяет инженерам и аналитикам грамотно оценивать, насколько полезны те или иные данные.
Важно не только количество, но и качество.
Предположим, у вас тысячи запросов интернет-пользователей.
Как понять, что эта информация вообще может быть полезна в оценке эффективности маркетинга? – только через анализ энтропии.
Энтропия и взаимная информация используются для оценки информативности признаков.
Вместо того, чтобы уповать на рандом – вы выбираете только качественные параметры.
А они уменьшают неопределенность целевой переменной и исключают избыточные или нерелевантные признаки.
А это плюс к скорости модели и минус к ее объему.
Энтропия используется в вероятностных моделях (например, Naive Bayes, Hidden Markov Models) для оценки неопределенности и информативности апостериорных распределений.
Энтропия — всё для оценки минимальной длины кодирования данных в алгоритмах сжатия, Хаффмана и Lempel-Ziv, с целью уменьшения объема данных для хранения и передачи.
Мы могли еще перечислить пару десятков пунктов, где теория информации и энтропии апают ваши скиллы на пару десятков баллов. Но хватит.
Так что практикуемся, но и не забываем про теорию...
