3

Ответ на пост «128 ГБ в кармане или eGPU на коленке - что реально взять под локальные нейросети в бюджете до 350 000 рублей»

от свидетеля ИИ ПУЗЫРЕЙ, оперы ddr5 по полмиллиона рублей и т.д.:

да откуда такое старое желез за 350к? и тесты примерно оттуда же из 2024-2025 релизных годов. Я просто напомню что ai max 395 128гб напаяной lddr5 тогда стоил 120-140т.р. За эти деньги собирался игровой/ИИ-сервер на 512-1024гб и оставлял тот же 395+ далеко позади. Что сделали разработчики этого чуда систем, правильно выкупили наше б/у гавно за Х1 и застопили отгрузку ОЗУ заплатив Х2. Зато сейчас любой их релиз по цене Х10-Х15 выстреливает как горячие пирожки, ну или почти... а производительность, ну кроме MAC 5 ultra 512gb за 10K$ с 2024г не вышло в релиз ни одной железки (rtx 5090, A5000 96gb это как раз конец 2024), все остальное серверное железо Rubin, Instinct которое тупо впаривают по Х20-Х40 тому кто вынужден брать.

128 ГБ в кармане или eGPU на коленке - что реально взять под локальные нейросети в бюджете до 350 000 рублей

Ок, что приходит первое в голову, когда стоит задача локального запуска (очень условно) тяжелых нейросетей вроде Llama 3 70B или Qwen 2.5? Понятное дело, что, мол, нужен либо огромный серверный шкаф с парой прожорливых видеокарт, либо Mac Studio в максимальной комплектации за полмиллиона+ рублей. Но это не совсем так. Итак, у нас на руках сумма порядка 250-350 тысяч рублей. Что дальше?

Рынок компактного железа в этой ценовой категории сейчас напоминает минное поле. За одни и те же деньги можно купить как очень даже рабочий инструмент, так и совершенно бесполезную коробку, которая на бумаге хвастается памятью, а на деле выдаёт полтора токена в секунду.

Я сел, пересчитал все актуальные конфигурации на нашем рынке с учётом таможни, доставки и скрытых расходов, сопоставил физику шины памяти и делюсь раскладом.

Важный дисклеймер. Этот пост - не реклама магазинов/моделей, не подборка, не рейтинг и не рекомендация. А, собственно, личное мнение человека, который сам сейчас в процессе выбора замены своему старому десктопу. И, возможно, будет кому-то полезно. Буду очень рад =)

Почему гигабайты ничего не значат без шины

Прежде чем лезть в кошелёк, нужно уяснить одну базовую вещь.

Для языковых моделей сам по себе объём оперативной памяти не решает ничего. Скорость генерации текста упирается исключительно в пропускную способность памяти (ПСП). Чтобы выдать один токен, процессор или графический чип обязан прокачать через себя весь файл весов модели целиком.

Считаем на пальцах. Полезная ПСП в гигабайтах в секунду делится на вес модели в памяти. Если модель Llama 3 70B в 4-битном кванте (Q4_K_M) весит около 41 ГБ, то на обычной двухканальной памяти DDR5-5600 со 128-битной шиной реальная ПСП составляет около 70 ГБ/с. Делим 70 на 41 и получаем жалкие 1.5 токена в секунду. Вы будете ждать один короткий абзац текста полторы минуты.

На 256-битной шине LPDDR5X-8000 в чипах Strix Halo реальная ПСП держится около 210-220 ГБ/с. Это даёт 5.5-7.5 токенов в секунду, что уже соответствует скорости нормального беглого чтения. На 1024-битной шине Mac Studio Ultra скорость улетает до 16-18 токенов в секунду. Физику тут не обмануть.

Монолиты на AMD Strix Halo - FEVM FAEX1 и GMKtec EVO-X2

Процессор Ryzen AI Max+ 395 объединяет 16 ядер Zen 5, встроенную графику Radeon 8060S на 40 блоков RDNA 3.5 и 128 ГБ распаянной памяти LPDDR5X-8000 на 256-битной шине.

Под Linux через драйвер amdgpu и настройку пула TTM/GTT видеоядру под буфер весов отдаётся до 110-112 ГБ. Этого с запасом хватает, чтобы загрузить любую 70B модель или MoE-сетку вроде Qwen3-235B-A22B.

Сам мини-ПК на Ozon Global или у китайских поставщиков в конфигурации 128 ГБ RAM и 2 ТБ SSD стоит от 225 000 до 245 000 рублей. К этому обязательно прибавляем таможенную пошлину РФ. Беспошлинный лимит составляет 200 евро, а с суммы превышения начисляются 15% плюс 500 рублей сбора. Набегает ещё около 32 000 - 35 000 рублей. Итоговая сумма под ключ выходит в районе 260 000 - 280 000 рублей.

FEVM FAEX1 упакован в плоский алюминиевый корпус объёмом ровно в 1 литр и имеет прямой порт OCuLink. GMKtec EVO-X2 крупнее (1.8 литра), в нём массивнее радиатор, но OCuLink нет. Под длительной нагрузкой в 140 Вт обе коробки крутят турбины на 46-48 дБ и греются до 92-95 градусов. Шумно. Но в одном монолитном корпусе вы получаете больше сотни гигабайт быстрой видеопамяти.

Mac mini M4 Pro против Mac Studio со вторички

Экосистема Apple подкупает фреймворком MLX и тем, что эти компьютеры не жрут электричество и не воют турбинами под столом. Но ценовая политика на память в РФ - это, увы, отдельная боль.

Новый Mac Studio M4 Max со 128 ГБ памяти сейчас стоит под полмиллиона рублей и в наш бюджет не влезает. Поэтому тут есть две альтернативы.

Первая - взять новый Mac mini M4 Pro на 64 ГБ Unified RAM. На сером рынке за версию с 14 ядрами CPU, 20 ядрами GPU, 64 ГБ оперативной памяти и 512 ГБ SSD просят около 240 000 - 260 000 рублей. Ещё 18 000 рублей уйдёт на внешний скоростной накопитель Thunderbolt 4 на 2 ТБ под модели. Итого получается около 260 000 - 278 000 рублей. ПСП тут отличная (273 ГБ/с), но из 64 ГБ система отдаст под графику максимум 48-52 ГБ. Сетка Llama 3 70B в Q4 занимает 41 ГБ и влезет только с коротким контекстом в пару тысяч токенов. На длинных диалогах память кончится.

Вторая альтернатива - искать Mac Studio M2 Ultra на 128 ГБ на вторичном рынке или у проверенных поставщиков б/у техники. Такой аппарат обойдётся как раз в 310 000 - 345 000 рублей. За счёт шины 1024 бит и ПСП 800 ГБ/с он выдаёт на 70B моделях 16-18 токенов в секунду в полной тишине. Главная плата за скорость - покупка дорогого подержанного устройства без заводской гарантии.

Ммини-ПК по OCuLink и настольная RTX 4080 Super

Если ваша работа завязана на чистую CUDA, дообучение сеток через LoRA, фреймворки вроде Unsloth, vLLM или генерацию картинок в ComfyUI, видеокарты AMD и Apple вам не помогут. Нужна NVIDIA.

В компактный корпус полноразмерную видеокарту не засунуть, поэтому собирается модульный бутерброд. Базовый неттоп с нативным портом OCuLink (Minisforum MS-A1 на Ryzen 7 8700G или Minisforum MS-01 на Core i9) с 64 ГБ памяти и 1 ТБ SSD обойдётся в 80 000 - 90 000 рублей. Внешняя док-станция OCuLink вроде Minisforum DEG1 стоит 8 500 рублей. Блок питания Gold на 750-850 Вт под карту заберёт 11 000 рублей. Сама видеокарта NVIDIA GeForce RTX 4080 Super на 16 ГБ стоит 120 000 - 128 000 рублей.

Суммарно набегает около 220 000 - 238 000 рублей.

Вы получаете нативную CUDA, пропускную способность видеопамяти 736 ГБ/с и моментальный отклик. Сетки на 8B летают со скоростью 100 токенов в секунду, модели на 14B выдают 50 токенов в секунду. Но у вас всего 16 ГБ VRAM. Сетки на 70B на этой связке не запустятся в принципе. Либо экосистема CUDA и скорость на небольших сетках, либо объём под тяжелые модели.

Ловушка для экономных или 96 ГБ медленной памяти

Я часто вижу, как мои знакомые пытаются сэкономить. Например, берут обычный неттоп на Ryzen 7 8845HS за 45 тысяч рублей и ставят туда две планки Crucial SODIMM DDR5-5600 по 48 ГБ ещё за 35 тысяч рублей.

По деньгам выходит меньше 100 тысяч рублей за 96 ГБ оперативной памяти. И, понятное дело, на бумаге выглядит красиво.

Но обычная 128-битная шина выдаёт в реальности около 70-75 ГБ/с. Модель 70B в память загрузится, но генерировать текст будет со скоростью 1.5 токена в секунду. Работать в таком темпе невозможно. Это пустая трата бюджета.

Сравнение расходов и скоростей

Универсального идеала в бюджете до 350 тысяч рублей не существует. Выбор сводится к тому, с каким именно неудобством вы готовы мириться каждый день.

Коробки на AMD Strix Halo дают честные 112 ГБ быстрой видеопамяти из коробки с гарантией, но заставят терпеть шум турбин на 48 дБ и повозиться с настройкой ROCm под Linux. Подержанный Mac Studio M2 Ultra на 128 ГБ выдаст максимальные 18 токенов в секунду в полной тишине, но оставит вас наедине с рисками вторичного рынка. Связка с OCuLink и настольной RTX 4080 Super откроет нативный стек CUDA и максимальную скорость, но навсегда ограничит вас планкой в 16 ГБ видеопамяти.

Экономить же и покупать обычный неттоп с медленной памятью DDR5 на 96 ГБ не стоит вовсе. Чудес плотности памяти, увы, не бывает - без широкой шины даже самый большой объём ОЗУ остаётся бесполезным грузом.

Показать полностью 4
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества