Есть компании, которые взлетают за одну ночь. А есть Databricks — её основали ещё в 2013 году создатели Apache Spark, того самого открытого движка, на котором до сих пор крутится половина «биг-даты» планеты. Тринадцать лет это была уважаемая, но нишевая история «для дата-инженеров»: платформа, куда корпорации сгружают терабайты сырых данных и гоняют по ним аналитику. Ключевая идея — «lakehouse», гибрид озера данных и хранилища. Скучновато для заголовков.
Как данные стали золотом
А потом случился ИИ — и выяснилось, что данные — это топливо для нейросетей, а Databricks сидит ровно на этой трубе. Компания молниеносно перепозиционировалась из «аналитики» в «ИИ-инфраструктуру» и выкатила целую линейку продуктов под ИИ-агентов: Lakebase (база данных для агентов), Unity (ИИ-шлюз), Omnigent (оркестрация агентов). CEO Али Годси управляет армией примерно из 3000 инженеров.
Четыре апрайза за полтора года
И инвесторы понесли деньги мешками. Новый раунд — около $3 млрд при оценке $188 млрд, лид-инвестор фонд Coatue, закрытие ожидается летом 2026-го. Это уже четвёртый пересмотр оценки за полтора года, и график выглядит как вертикальный старт ракеты:
• декабрь 2024 — $62 млрд • сентябрь 2025 — $100 млрд • февраль 2026 — $134 млрд • июль 2026 — $188 млрд
Плюс $54 млрд оценки всего за семь месяцев. Databricks теперь дороже большинства публичных корпораций — и при этом всё ещё остаётся частной компанией.
Почему это важно
История Databricks — идеальный портрет нынешнего ИИ-бума. Взлетают не только те, кто делает сами модели, но и те, кто владеет инфраструктурой под них: данными, вычислениями, трубопроводом. TechCrunch метко называет Databricks «любимым вторым актом ИИ» — бизнес, придуманный задолго до бума, но именно нейросети превратили его в золото. И пока рынок готов платить $188 млрд за компанию, которая по сути продаёт «лопаты» для золотой лихорадки, лихорадка явно далека от финала.
Мы решили ускорить NameNode. Сначала увеличили количество потоков. Сервер посмотрел на нас и сказал: “Спасибо, теперь мне плохо быстрее”. Потому что очередь — это не когда мало людей у окошка. Очередь — это когда окошко одно, а люди уже начали жить в очереди. И вот стоит запрос getFileInfo. Он ничего не хочет. Он просто спросить. Но таких “просто спросить” — девять тысяч. И каждый с выражением лица: “я на секундочку”. А система в этот момент думает: “Если все на секундочку, почему у меня уже среда?” И тут приходит администратор. Не человек — профессия. У него в глазах не усталость. У него в глазах jstack. Он говорит: “Сейчас мы посмотрим, кто держит lock”. Это очень сильная фраза. В обычной жизни так не говорят. В обычной жизни говорят: “Кто последний?” А тут: “Кто держит lock?” И сразу понятно — люди давно не отдыхают. Сделали jstack -l. И NameNode завис. То есть мы хотели узнать, почему он зависает. И для этого дали ему команду зависнуть окончательно. Это называется диагностика. В медицине так нельзя, а в IT — пожалуйста. Потом решили: “Больше -l не делать”. Это тоже важный этап зрелости инженера. Когда ты не знаешь, что делать, но уже знаешь, чего делать нельзя. На этом держится половина промышленной эксплуатации. Потоки стоят. Очередь RPC растёт. CallQueueLength смотрит на тебя как очередь в поликлинике в понедельник утром. Там уже не запросы. Там судьбы. Один запрос пришёл открыть файл. Второй — узнать информацию о файле. Третий — удалить файл. Четвёртый — просто посмотреть список. И каждый считает, что он главный. open говорит: “Без меня вообще ничего не начнётся”. getFileInfo говорит: “Я маленький, я быстро”. delete говорит: “Я сейчас освобожу место”. А NameNode говорит: “Вы все говорите одновременно. Я один”. И где-то рядом DataNode. У него вообще своя жизнь. Он пишет: “Block token verification failed”. Что это значит? Это значит: “Я помню блок, но не помню пароль от воспоминаний”. Блок есть. Токен есть. Ключа нет. Как в жизни: человек есть, пропуск есть, база сказала — не знаю такого. Потом появляется Hive Metastore. Это уже не сервис. Это посредник между болью и базой данных. Цепочка красивая: Trino идёт в Metastore. Metastore идёт в HAProxy. HAProxy идёт в PgBouncer. PgBouncer идёт в PostgreSQL. PostgreSQL смотрит на Patroni. Patroni смотрит в вечность. И где-то посередине возникает timeout. Все говорят: “Это не у меня”. Trino говорит: “Я просто спросил”. Hive говорит: “Я передал”. HAProxy говорит: “Я балансировал”. PgBouncer говорит: “Я пулил”. PostgreSQL говорит: “Я вообще живой благодаря Patroni”. Patroni говорит: “Я лидер, но не крайний”. И вот в логе появляется прекрасное: Connection is not available. Очень человеческая фраза. Не “ошибка”. Не “сбой”. А именно — “соединение недоступно”. Как хороший специалист в отпуске. Он есть. Он где-то числится. Но сейчас недоступен. Тогда мы увеличиваем pool. Потому что если не хватает соединений, надо дать больше соединений. Это логично до первой тысячи. Потом выясняется, что больше соединений — это не решение, а способ быстрее узнать, где следующая проблема. Сначала не хватало соединений. Потом не хватает потоков. Потом не хватает памяти. Потом не хватает терпения. Потом не хватает людей, которые помнят, зачем это всё было построено. А Trino тем временем живёт отдельно. У него 185 нод. Потом уже 275. Два координатора. Большой кластер. Очень большой. Такой большой, что когда запрос не выполняется, это уже не ошибка, а коллективное мероприятие. И он пишет: No nodes available to run query. Вот это особенно красиво. Двести семьдесят пять нод. И ни одной свободной. Как парковка у торгового центра перед Новым годом. Ты смотришь на кластер и говоришь: “Но вот же они. Стоят”. А Trino отвечает: “Физически — да. Духовно — нет”. Потом Trino находит утечку памяти. Он пишет: “Memory leak detected”. И перечисляет query id. Длинные такие, солидные. Как номера уголовных дел. Запрос уже завершился. Но память держит. Он ушёл, но вещи оставил. Как родственник после праздников: “Я только куртку заберу потом”. И память ждёт. День ждёт. Ночь ждёт. ZGC ходит рядом, тихий, интеллигентный. Говорит: “Я бы убрал, но оно формально занято”. ZGC вообще похож на хорошего уборщика в музее. Всё видит, всё понимает, но экспонаты трогать нельзя. Потом начинается Kafka. Kafka — это когда ты решил, что логов много, но всё равно хочешь их сохранить. Потому что вдруг пригодятся. Что именно пригодится — неизвестно. Но удалять нельзя. Вдруг потом спросят: “А кто удалил?” И вот HDFS audit летит в Kafka. Ranger audit летит в Kafka. Spark читает Kafka. Пишет ORC. Trino читает ORC. Человек читает Trino. И в конце человек всё равно делает grep. Потому что сколько бы мы ни строили платформу данных, настоящий BI начинается с: cat log | grep ERROR А потом awk. awk — это такой маленький Hadoop для одного человека. Если человек злой и выспался — он заменяет половину enterprise-стека. Потом Spark Streaming. Он должен читать поток, парсить, складывать. Очень просто. Пока не появляется offset. Offset — это память о том, где ты остановился. В жизни этого очень не хватает. Spark говорит: “Я помню”. Kafka говорит: “А я помню, что ты помнишь”. YARN говорит: “Подожди, у меня ресурсов нет”. И всё стоит, потому что кто-то где-то попросил executor, а YARN отвечает: “Ваш запрос очень важен для нас. Оставайтесь на линии”. Executor ждёт. Driver ждёт. Kafka ждёт. Пользователь ждёт. Только данные не ждут. Данные приходят. И это главная особенность Big Data. Маленькие данные можно отложить. Большие — нельзя. Они идут. Как отопительный сезон. Как отчётность. Как родственники на дачу. Потом мы смотрим Grafana. Grafana — это когда всё плохо, но красиво. Линии бегут. CPU прыгает. Network падает. Heatmap светится. И ты уже не решаешь проблему, а любуешься её динамикой. Особенно приятно, когда график показывает, что проблема была ночью. В три часа. Когда ты спал. То есть теоретически спал. Потому что в 03:17 пришло сообщение: “NameNode опять залип”. И ты смотришь на телефон. На мир. На потолок. И думаешь: “Когда я был маленький, я хотел заниматься компьютерами”. Вот оно. Занимаешься. Потом появляется PostgreSQL. Мы смотрим самые тяжёлые таблицы. SDS. DBS. SEQ_SCAN большой. Очень обидно, когда таблица называется из трёх букв, а проблем создаёт на весь день. Делаем ANALYZE. И сразу вопрос: “А он не заблокирует?” Потому что в промышленной базе любая команда звучит как угроза. Даже ANALYZE. Хотя по названию вроде культурная вещь. А всё равно страшно. Потом индексы. Индексы — это как полки в гараже. Пока их нет, всё лежит на полу, но все знают, где что. Потом ставишь полки — и сначала становится хуже. Потому что теперь надо понять, на какую полку ты положил то, что раньше просто пинал ногой. Но без индексов нельзя. С индексами тоже нельзя просто так. В этом и состоит архитектура. А ещё есть HAProxy. У него параметры. Много параметров. maxconn, timeout, backlog, nbthread. Ты смотришь на них и понимаешь: люди не настраивают HAProxy. Люди ведут с ним переговоры. “Сколько соединений ты выдержишь?” “Смотря как попросите”. “А если увеличить?” “А если я упаду?” И ты такой: “Давай аккуратно”. В Big Data слово “аккуратно” означает: сначала на одной ноде, потом на всех, потом откат, потом опять на всех, но уже с другим значением. Потом Ansible. Ansible — это способ ошибиться сразу на 185 серверах, но с чувством порядка. Одна команда — и везде одинаково. Если правильно — праздник. Если неправильно — тоже везде одинаково. Красота стандартизации. Особенно хорош site.retry. Это файл, где записаны те, кто не смог. У людей тоже должен быть life.retry. Список задач, на которых мы отвалились, но потом вернёмся. А пока возвращаемся к NameNode. NameNode сидит. У него 500 гигабайт heap. ZGC. Метрики. JMX. Очереди. Потоки. Handlers. И всё равно он иногда смотрит в одну точку. Потому что размер памяти не отменяет смысла происходящего. Можно дать человеку большой кабинет. Можно дать ему три секретаря. Можно дать ему кофемашину. Но если к нему каждую секунду забегают тысячи людей с вопросом: “А этот файл есть?” — рано или поздно он начнёт отвечать глазами. И вот мы сидим ночью. Смотрим на логи. Там Java. Thrift. SocketTimeoutException. Read timed out. Очень честная ошибка: “Я читал, читал — и устал”. И в этот момент приходит мысль: Big Data — это не про большие данные. Это про большую ответственность за маленькие настройки. Один timeout. Один pool. Один индекс. Один handler count. Одна очередь. Один jstack -l. И всё. У тебя уже не кластер. У тебя роман. Роман о человеке, который хотел просто хранить файлы. Потом просто читать таблицы. Потом просто ускорить запросы. Потом просто понять, почему оно висит. Потом просто дожить до утра. И самое смешное — утром оно заработает. Само. Ты придёшь, а графики ровные. Очередь ноль. CPU нормальный. Metastore отвечает. Trino выполняет. Kafka пишет. Spark читает. И все скажут: “Ну вот, видишь, прошло”. А ты знаешь: оно не прошло. Оно просто ждёт следующего релиза.
Привет, мои дорогие любители экономии! На связи «Правда.Всем» . Пока мы с вами героически воюем в пунктах выдачи за свои законные права по возврату вещей и пишем претензии, крупные бренды тихонько стоят в сторонке, хихикают и грабят нас с тыла. Причём абсолютно легально. Роспотребнадзор тут бессилен — у нас же свободный рынок.
Сегодня я покажу вам три скрытых «налога на невнимательность», за которые 90% покупателей исправно платят каждый божий день, даже не замечая, как у них улетают деньги. Погнали проверять карманы.
1. Налог на бренд «Умный дом» (Плата за русскую коробочку)
Решили вы стать технологичным барином и купить «умную розетку» или датчик протечки от какого-нибудь раскрученного бренда. Отдаёте на кассе 2500 рублей, приносите домой, радуетесь.
В чём абсурд: Если у вас правильные руки и вы вскроете этот датчик, то внутри обнаружите стандартную, копеечную микросхему китайской платформы Tuya или протокола Zigbee. В интернете точно такой же датчик, собранный китайцами на том же самом заводе в ночную смену, но без красивого логотипа, стоит рублей 500. Самое смешное: он без единого писка подключится к вашей Алисе и будет работать идеально. Вы просто подарили две тысячи рублей сверху за красивый картон и русские буквы на упаковке.
2. «Налог на роскошь» по версии вашей севшей батареи
Если вы до сих пор свято верите, что цены в интернетах для всех одинаковые — у меня для вас плохие новости. Крупные агрегаторы такси, сайты бронирования отелей и онлайн-магазины давно выкинули единые ценники на помойку. Ими рулит Big Data и алгоритмы динамического ценообразования.
Как это работает: Заходите вы на сайт с новенького Айфона, да ещё и через дорогой безлимитный интернет. Алгоритм моментально считывает параметры вашего устройства, ставит жирную галочку: «О, мажор пожаловал!» — и вуаля! Цена на тот же самый отель или фен для вас становится на 5–10% выше, чем для человека со старенького Андроида.
Высшая степень цинизма: Приложения умеют проверять уровень заряда вашей батареи. Если у вас осталось 2% зарядки, хитрый скрипт понимает: «Так, этот кожаный мешок сейчас паникует и готов заказать такси или забронировать хату за любые бабки, пока телефон не сдох». И цена на поездку волшебным образом улетает в стратосферу. Бизнес, ничего личного.
3. «Фитнес-налог» или сладкая ложь за тройной ценник
Заглянем в отдел «Здоровое питание» в супермаркете. Обычная шоколадка грустит на полке за 50 рублей. А рядом лежит протеиновый батончик со звенящими надписями «Fit», «Eco», «0% сахара» и ценником в 150 рублей. Спортсмены и худеющие гордо переплачивают тройную цену, чувствуя себя повелителями ЗОЖа.
В чём абсурд: Переверните эту святую обёртку и почитайте состав мелким шрифтом. Вместо белого сахара туда щедрой рукой насыпали мальтодекстрин, концентрированный финиковый сироп или концентрат яблочного сока. Ребята, для вашей поджелудочной это точно такой же сахарный удар с ноги, от которого глюкоза прыгает до потолка. А калорий в этом «полезном» батончике порой больше, чем в Сникерсе! Но вы платите лишнюю сотку просто за то, чтобы маркетологи погладили ваше эго.
Сюда же — безглютеновая истерия: Надпись «Без глютена» на пачке соли или бутылке растительного масла (где его, блин, и так никогда не было по законам природы) автоматически удорожает товар на треть. Налог на знание биологии, не иначе.
Что с этим делать?
Включаем холодный, циничный пофигизм и бьём маркетологов их же оружием:
Ищите ОЕМ-аналоги техники. Почти у каждой дорогой брендовой штуки есть копеечный брат-близнец без пафосного логотипа.
Перед крупной покупкой билетов, отелей или дорогой техники — проверяйте цену с двух разных телефонов (своего и друга/мужа). Вы очень сильно удивитесь разнице.
Плюйте в глаза лицевой стороне упаковок с надписями «ПП» и «Фитнес». Разворачивайте и читайте состав сзади.
Хватит спонсировать хитрые скрипты и чужие виллы. Мы эти деньги зарабатываем трудом, а у нас их забирают с помощью красивых фантиков.
Признавайтесь в комментариях: сравнивали цены с разных телефонов? На какую сумму вас в последний раз нагрел «умный» алгоритм? Погнали обсуждать!
Антропология цифрового следа: когда вы стали массивом данных
Изображение сгенерировано в иллюстративных целях
Конец эпохи личной жизни. Мы десятилетиями ждали прихода «Большого Брата» — тоталитарного ока из космоса или правительственных бункеров. Реальность оказалась ироничнее: мы не просто впустили наблюдателя в дом, мы сами купили ему билеты в первый ряд своей жизни, оплатив их по подписке. Сегодня производитель вашего фитнес-браслета может запросто узнать, сколько раз, как часто, с каким ритмом и амплитудой вы совершаете те или иные действия, да с вашим “джойсиком” то же.
Камера видеонаблюдения, подключенная к облаку, не просто смотрит и хранит видео — она его анализирует. Для системы больше нет «просто изображения». Есть массив данных: ваши микроэмоции, векторы движений, социальные связи и так далее. Мы перестали быть зрителями перед экранами своих смартфонов. Мы стали главным контентом, который наши смартфоны и прочие подключенные к сети устройства изучают в режиме 24/7. К сожалению, многие не понимают, что речь идет не о непосредственно изображениях, как в старых детективах, где клиентам и полиции нужны были фотографии или видеозаписи, а о чистой математике и статистике, для которых пока не существует внятной юридической среды.
Ваше голое тело никому не интересно, а то, куда вы смотрите в торговом центре, может сказать нейросети больше, чем ваша фотография.
Instagram и TikTok: могут анализировать не только ваши лайки, но и «dwell time» — те доли секунды, на которые вы замедлили скроллинг, засмотревшись на определенный тип лица или интерьера. Это визуальный дактилоскоп вашего подсознания.
YouTube: запросто может учесть ваши реакции через микро-паузы и повторные просмотры фрагментов, выстраивая профиль ваших эмоциональных триггеров.
Маркетплейсы (Amazon, Wildberries): мгновенно могут узнать о ваших скрытых потребностях по косвенным признакам — от частоты покупок до времени суток, когда вы наиболее импульсивны.
Изображение сгенерировано в иллюстративных целях
Наши симпатии в приложениях для знакомств — это не просто поиск пары, а добровольное заполнение анкеты для рекламных сетей. Каждый свайп вправо формирует ваш индивидуальный «визуальный код». Механика DCO (Dynamic Creative Optimization): в режиме реального времени именно для вас ИИ генерирует изображение и ролик, используя накопленные датчиками, камерой и микрофоном смартфона данные о вас. С помощью ИИ товар давно не продают абстрактной толпе. Алгоритм препарирует ваши подсознательные триггеры и создает персональную презентацию, манипулируя вашим желанием купить. Вы покупаете вещь не потому, что она хороша, а потому, что её предложил образ вашей мечты, чей типаж вы сами подтвердили тысячей предыдущих кликов.
Для нейросетей ваш голос — лишь верхушка айсберга. Система давно вышла за пределы слов: ей не нужно вслушиваться в содержание ваших историй, она ищет маркеры контекста. Акустические маркеры статуса: ваш смартфон в фоновом режиме анализирует сигнатуру окружающей среды. Для ИИ ваш доход звучит совершенно определенно: специфический шум помпы кофемашины Jura, высокочастотный свист двигателя Dyson, низкочастотный рокот V8 в закрытом пространстве гаража. Вы можете хранить молчание, но вещи вокруг вас «кричат». Акустический профиль среды — это невидимый паспорт вашего благосостояния, который ИИ считывает быстрее, чем вы успеваете поздороваться. И снова: вас не подслушивают в банальном смысле и не вмешиваются в вашу жизнь в юридическом поле. Никто не оскорблен, не опозорен. Просто статистика. Вашу «Ауди» и так видит любой прохожий…
Изображение сгенерировано в иллюстративных целях
Смартфон больше не просто телефон с экраном, это сенсорный хаб, который буквально «щупает» ваше состояние через тактильный контакт. Тактильный ИИ: акселерометр и гироскоп фиксируют ваш физический ритм. Ритм скроллинга, сила нажатия и микродрожание рук выдают системе всё: от степени вашего интереса к посту до вашего физического состояния. Изменения в кинематике пальцев позволяют алгоритмам машинного обучения распознавать фазы усталости или даже опьянение. Цифровое «шестое чувство»: благодаря умным часам и фитнес-браслетам ИИ получил прямой доступ к вашей вегетативной нервной системе. Оптические датчики непрерывно анализируют кровоток, позволяя нейросетям по изменению пульса считывать скрытый стресс, страх или возбуждение. Датчики, что фиксируют ваши интимные ритмы и частоту игры с “джойстиком”, уже давно перевели биологию вашего тела в чистые математические графики.
В перспективе коммерческие и государственные институты препарируют вас с помощью ИИ, превращая человека (личность) в статистическую абстракцию, которую они используют, чтобы превратить вашу жизнь в адаптированный под вас тоннель потребления и карьеры.
Если визуализировать весь массив информации, собранной о вас, мы не увидим портрета и фигуры Человека. В многомерном пространстве данных вы выглядите как 3D-модель микроорганизма — сложная структура с тысячами «отростков-рецепторов». Каждый такой отросток — это ваш триггер, за который платформы и алгоритмы дергают в нужный момент.
Мультимодальные автономные агенты (Agentic AI) и технологии Edge AI могут быть встроены в ваши смартфоны и отправлять заинтересованным лицам уже сформированные и сжатые наборы данных, собранных о вас, которые ни разу не «видеозапись» и не «звук», но говорят о вас больше, чем они. Мы привыкли к дежурным запросам гаджетов: то к камере, то к микрофону, то к контактам. Но стоит осознать: «доступ к функции» — это всегда доступ к вашему подсознанию. Вы не просто разрешаете приложению «сделать фото», вы даете владельцам системы право изучать вашу реакцию на мир, ваше поведение.
И практически всегда вспоминать закон бесполезно: в сборе статистики преступления нет, приписать «движению пальцем» статус личной информации — вообще за рамками логики, иначе можно сразу демонтировать все системы видеонаблюдения в мире. Зафиксировать скрытую когнитивную аналитику юридически или технически очень сложно. Можно издать какой угодно закон о защите личных данных, и на бумаге все будет хорошо, а реализовать его на практике стоит воли, а также больших интеллектуальных и материальных ресурсов.
Изображение сгенерировано в иллюстративных целях
Много было сказано о маркетинге и потреблении, а что же с работой? Системы класса Talent Intelligence непрерывно собирают открытые данные кандидатов. Оцениваются профили в LinkedIn, GitHub, публикации, активность на профессиональных форумах и даже поведение в социальных сетях. Алгоритмы вычисляют «индекс готовности к смене работы» (Internal Mobility / Intent Data) еще до того, как человек обновит резюме.
Крупные корпорации переходят от учета должностей к учету конкретных навыков (Skills-based организации). ИИ-платформы (например, SAP SuccessFactors, Workday) автоматически присваивают сотрудникам теги способностей и определяют их оптимальную следующую роль. Внутри систем уже прописаны вилки зарплат и грейды под каждый профиль навыков.
В сферах доставки, такси и клининга (Uber, Яндекс, Додо Пицца) человека оценивает и распределяет на роль только алгоритм. У курьера или уборщика нет резюме — у него есть ID, рейтинг, история выполненных заказов и автоматически рассчитанная системой ставка.
Системы электронных трудовых книжек и госуслуг аккумулируют всю историю занятости, образования и доходов гражданина. Объединение этих баз с налоговыми данными дает полную картину профессионального пути человека.
Если алгоритм на основе раннего цифрового следа (например, из-за низкой успеваемости в 18 лет или случайных постов в соцсетях) один раз присвоит человеку категорию «разносчик пиццы», выбраться из нее будет практически невозможно. Так устроены алгоритмы работы со статистикой. Цифровое досье попав на дно уже никогда не всплывет.
Не удивляйтесь, если через лет десять-двадцать вам не нужно будет пыжиться с резюме: в глубинах серверных корпораций будут храниться базы данных, в которых уже все расписано: «уборщик», «менеджер», «глава отдела», «разносчик пиццы» с назначенными окладами и режимом работы.
Финал, к которому мы идем: - когда алгоритмы в серверных будут решать, кем нам работать и сколько зарабатывать на основе анализа нашего сознательно и подсознательного. Как думаете, мы уже прошли точку невозврата, или от этого цифрового поводка еще можно отвязаться?»
Если кто не в курсе: Confluent — это компания, которая делает Apache Kafka удобным для бизнеса. Kafka — штука, через которую гоняют потоки данных в реальном времени. Ваши банковские уведомления, рекомендации на стриминговых сервисах, мониторинг логистики — всё это работает на подобных технологиях.
И вот IBM 31 марта просто взяла и купила всю эту историю за 11 лярдов. Для понимания масштаба — это крупнейшая сделка в AI-инфраструктуре за весь 2026 год.
Зачем им это? Всё просто: нейросети жрут данные. Но не любые, а свежие, прямо сейчас. Чтобы AI-агенты принимали решения в реальном времени, им нужен постоянный поток информации — и Kafka как раз та труба, по которой всё это течёт. Без неё ваш умный ИИ-ассистент превращается в тормозного бота, который отвечает на вчерашние вопросы.
IBM, похоже, делает ставку на то, что будущее AI — это не просто умные модели, а целая инфраструктура вокруг них. Модель без данных в реальном времени — как гоночный болид без бензина.
В общем, гонка вооружений в AI идёт уже не только за мозги, но и за водопровод.
Вы наверняка слышали про Polymarket и их скандальный опрос про ядерный удар. Децентрализованные рынки предсказаний — популярная тема в мире. Но крипта, ставки на реальные события, финансовая ответственность — всё это делает прямой аналог Polymarket невозможным (и опасным) в нашей юрисдикции.
Я решил пойти другим путем. Я сместил фокус с азарта и валюты (будь то виртуальной или реальной) на большие данные, анализ мнений и точность предсказаний. Вместо «ставок» — заработок рейтинговых очков, вместо вывода денег — помощь благотворительным организациям.
Дизайн главной страницы
Немного о себе
Меня зовут Никита, я студент 3 курса технического университета, учусь на программиста и работаю младшим тестировщиком. Люблю придумывать и реализовывать проекты в сфере IT на разных платформах и с использованием разных технологий. Мой GitHub.
О чем вообще речь?
Платформа предсказаний — это место, где пользователи делают прогнозы на исход реальных событий. Политика, спорт, технологии, культурные события — всё, что можно сформулировать как вопрос с ответом "Да"/"Нет".
Но если на Polymarket тебя мотивируют деньги (и ты рискуешь ими), то у нас мотивация другая:
Проверить свою интуицию. Насколько хорошо ты чувствуешь мир? Твой личный рейтинг точности покажет это.
Увидеть, что думают другие. Это не просто "лайки" под постом, а реальная статистика прогнозов тысяч людей.
Поучаствовать в добром деле. Точные прогнозы конвертируются в благотворительность. Твоя интуиция может помочь тем, кому нужна помощь.
Почему это интересно не только пользователям, но и бизнесу?
Здесь скрывается главный потенциал платформы, который я вижу как разработчик и аналитик.
Каждый прогноз — это точка данных. А тысячи прогнозов по сотням событий — это набор данных, который может ответить на важные вопросы:
Как формируется коллективное мнение?
Какие темы люди предсказывают точнее всего?
Какие темы интересуют людей?
Есть ли корреляция между уверенностью пользователя и его точностью?
Можно ли на основе прогнозов "толпы" строить модели, предсказывающие реальные события лучше, чем эксперты?
Для крупных компаний и исследовательских центров такая платформа может стать инструментом:
Краудсорсинговые прогнозы вместо дорогих опросных агентств.
Тестирование гипотез на реальной аудитории перед запуском продукта.
Сбор общественного мнения в режиме реального времени, а не по результатам "вчерашних" исследований.
Пока это выглядит как амбициозная цель, но архитектура платформы уже закладывает возможность агрегации и экспорта данных для внешних заказчиков.
Как это работает для обычного пользователя?
Для человека, который просто хочет проверить свою интуицию, всё максимально просто:
Регистрируешься.
Участвуешь в опросах — выбираешь исход события, оцениваешь свою уверенность.
После наступления события система засчитывает результат. Твой рейтинг точности растет или падает.
И здесь появляется элемент, который делает процесс осмысленным: благотворительность.
Ты не просто гадаешь ради гадания. Твоя активность копит виртуальные очки. В любой момент ты можешь конвертировать их в реальное пожертвование в проверенный фонд. Никаких финансовых рисков для тебя. Никакой азартной составляющей.
Это создает здоровую экосистему: людям интересно соревноваться в точности (пусть даже не за деньги), а приятный бонус в виде участия в добром деле удерживает их на платформе.
Техническая часть
Изначально проект задумывался как монолит, но в процессе перерос в микросервисную архитектуру. Не скажу, что это было необходимо на старте, но для прокачки скилла и будущего масштабирования — самое то.
Бэкенд: .NET 8, разделен на несколько сервисов. Взаимодействие через MassTransit.
Инфраструктура: Docker, YARP Proxy.
Базы: PostgreSQL для основных данных + Redis для кэширования.
Фронтенд: React + TypeScript, верстка на Tailwind (спасибо нейросетям за генерацию шаблонов, это спасло кучу времени).
Текущее состояние
Сейчас проект вырос до состояния, когда технически я могу развивать его и дальше (архитектура гибкая, стек понятный), но как разработчик и технический лидер я упираюсь в потолок компетенций, не связанных с кодом. Страница проекта доступна по ссылке.
Одному тянуть тяжело, потому что нужно принимать решения, в которых я не эксперт. Но для движения дальше мне не хватает двух взглядов на мир.
Кого мне не хватает:
У меня хорошо развито аналитическое и техническое мышление, но когда дело доходит до финансовой модели — я безнадежен. Нужен человек, который сможет ответить на вопросы:
Сколько это стоит — содержать платформу при 1000 и при 100 000 пользователей?
Где здесь деньги? (Кроме благотворительных взносов).
Какая у нас юнит-экономика и почему мы не разоримся завтра? Если вы видите цифры там, где я вижу только код, и умеете строить простые финмодели для стартапов — нам по пути.
Я имею небольшой опыт управления командами (хакатоны и студенческие проекты), но мне тяжело дается планирование будущего. Нужен человек, который поможет решить эти вопросы:
"Ок, мы сделали опросы. А что через 6 месяцев? Куда двигаем продукт?"
"Кто наш реальный пользователь и как до него достучаться?"
"Как нам не просто выживать, а масштабировать идею?" Если вы умеете составлять стратегию и видите путь там, где я вижу только туман — приходите, будем прокладывать маршрут вместе.
Если вы чувствуете, что можете закрыть хотя бы один из этих пробелов, и хотите обсудить, во что это может вырасти — пишите в телеграм или в личку.
Если хотите обсудить код, стек или просто затестить платформу и поругать её — пишите в телеграм или в личку. Вместе веселее.
P.S. Почему не Polymarket? Потому что я верю, что ценность предсказаний — не в деньгах, которые на них можно поставить, а в данных, которые они генерируют. И в том, что даже простой интерес к своей интуиции может быть направлен на добрые дела. Или я слишком наивен? Жду критику в комментариях.