Когда встаёт задача запускать нейросети локально, а не в облаке, всё упирается в железо. «Сервер для ИИ» звучит внушительно, но по сути это компьютер, главная ценность которого — видеокарты с большим объёмом быстрой памяти. Разберём без лишней теории, из чего он состоит и на что реально смотреть при выборе.
Видеокарты — сердце сервера. От суммарного объёма их памяти зависит, какие модели вообще поместятся, а от скорости памяти — как быстро они будут отвечать. Именно видеопамять, а не число вычислительных ядер, определяет скорость генерации токенов на инференсе. Процессор, оперативная память и диск для запуска готовых моделей вторичны: достаточно адекватной базы, чтобы «кормить» карты данными.
Сколько нужно видеопамяти. Модель целиком грузится в VRAM. Ориентиры для 4-битного квантования: 7–8B требует около 5 ГБ, 32–35B — порядка 20 ГБ, 70B — около 40 ГБ, а гигантские 120B — примерно 65 ГБ, плюс запас под контекст. Одна игровая карта на 24 ГБ упирается уже на моделях среднего размера, поэтому под серьёзные задачи собирают многокарточные системы. Четыре карты по 32 ГБ дают общий пул 128 ГБ — этого хватает на всё вплоть до 120B.

Охлаждение и питание — часто недооценивают. Мощные карты сильно греются. Без грамотного отвода тепла (особенно жидкостного охлаждения на плотных сборках) они уходят в троттлинг и теряют скорость прямо под нагрузкой. Плюс серверным ускорителям нужно стабильное питание с запасом. Поэтому решение, собранное «на коленке» из отдельных карт, нередко работает нестабильно — перегрев и просадки съедают всю выгоду от дорогого железа.
Связь между картами. На инференсе (когда модель просто отвечает) карты обмениваются малым объёмом данных, поэтому тип соединения — NVLink или обычный PCIe — влияет слабо; решает скорость памяти. NVLink важнее для обучения с постоянной синхронизацией. Так что переплачивать за топовую межкарточную топологию под запуск готовых моделей смысла мало.
Собирать самому или взять готовое. Серверные карты вроде Tesla V100 SXM2 — это не «вставить в обычный ПК»: им нужна специальная хост-плата, продуманное питание и охлаждение. Купив отдельные компоненты, легко получить несовместимый или перегревающийся набор. Поэтому для серьёзных задач берут готовую протестированную сборку с гарантией, а не собирают совместимые детали наугад. Хороший ориентир по конфигурациям, реальным замерам скорости и ценам — готовые серверы NextGen-PC на базе серверных карт NVIDIA: там расписано, что входит в комплект и сколько это стоит.
Итог: в сервере для ИИ смотрите прежде всего на видеокарты — объём и скорость их памяти, — а также на охлаждение и питание. Остальное вторично. И если нет опыта и времени возиться со сборкой, готовое протестированное решение почти всегда надёжнее.









