Энтузиаст компьютерного железа переоборудовал шумный и почти списанный корпоративный ускоритель Nvidia для локального запуска больших языковых моделей (LLM) и в результате получил систему с удвоенным объёмом видеопамяти — 32 ГБ — всего за 266 долларов (около 200 фунтов). На фоне постоянно растущих цен на видеокарты такой результат выглядит выгодным решением.

Ускоритель Nvidia Tesla V100 SXM2 для локального запуска LLMИсточник изображения — tomshardware.com

Из чего собрана система

Автор проекта, известный как Оскар Мольнар, рассказал, что для расширения видеопамяти под тяжёлые локальные LLM он приобрёл серверный ускоритель Tesla V100 SXM2 с 16 ГБ памяти HBM2. Сейчас такие карты продаются на eBay по цене около 140 долларов за штуку — правда, часть предложений отправляется из Китая.

Просто вставить SXM2-ускоритель в обычный ПК нельзя: формфактор рассчитан на серверные платформы с проприетарным разъёмом, а не на привычный слот PCIe. Поэтому Мольнару потребовался переходник SXM2-to-PCIe, который обошёлся ещё в 66 долларов. В сумме сама видеокарта с переходником вышла примерно в 206 долларов.

реклама кормит Уточку 🦆

Главная проблема — шум

Основной сложностью оказался не сам монтаж, а штатная система охлаждения Tesla V100. Родной вентилятор выдавал около 82 дБ — по описанию автора, нечто среднее между измельчителем мусора и газонокосилкой. Чтобы избавиться от этого шума, провода вентилятора перепаяли и подключили к разъёму PWM на материнской плате; для этого подошёл обычный переходной кабель с разъёмами 2.54 мм на PH2.0. После доработки вентилятор работает на уровне около 10% мощности — этого достаточно, чтобы удерживать температуру карты ниже 50 °C под полной нагрузкой.

Логотип и чип Nvidia Tesla V100Источник изображения — tomshardware.com

реклама кормит Уточку 🦆

32 ГБ видеопамяти на двоих

В итоге в системе Мольнара оказались сразу две видеокарты разных поколений: игровая RTX 4080 (16 ГБ, архитектура Ada Lovelace) и серверная Tesla V100 (16 ГБ, архитектура Volta). Суммарно это даёт 32 ГБ видеопамяти — столько же, сколько у одиночной Tesla V100 в старшей комплектации, которая стоит вдвое дороже.

Заставить обе карты работать вместе для инференса LLM оказалось не так сложно, как можно было ожидать. Мольнар использовал дистрибутив NixOS с устаревшей версией драйвера Nvidia, которая всё ещё поддерживает одновременно и Volta, и Ada Lovelace — более новые драйверы такие связки уже не покрывают.

реклама кормит Уточку 🦆

Как это работает на практике

В тестах связка запустила локальную модель на 27 миллиардов параметров со скоростью 32 токена в секунду. По словам автора, этого достаточно для комфортной интерактивной работы — и быстрее, чем у большинства облачных API с оплатой за токены.

Стоит учитывать, что решение остаётся нишевым: Tesla V100 не поддерживает современные наборы инструкций, а её энергоэффективность заметно ниже, чем у актуальных карт, к тому же связка требует ручной настройки драйверов и охлаждения. Тем не менее для энтузиастов, которым нужен большой объём VRAM для локальных LLM при ограниченном бюджете, такой способ расширения видеопамяти может быть разумным компромиссом между стоимостью и доступным объёмом памяти.