← Все новости
Инференс LLM на кластере старых ноутбуков

Инференс LLM на кластере старых ноутбуков

Когда я взялся за этот небольшой эксперимент, мной двигало исключительно любопытство и желание ответить на вопрос — а что, если взять три моих старых ноутбука, объединить их вычислительные ресурсы и использовать их под инференс LLM? Идея запуска на них чего-то более-менее тяжелого выглядела заманчиво: три процессора, 52 ГБ оперативной памяти — в теории должно получиться быстрее, чем на любом из них по отдельности.Спойлер: почти никогда не быстрее. Однако выяснение причины оказалось интереснее потенциальной истории успеха. Вылезли разные неочевидные вещи: старый процессор был не самым медленным, третий узел не особо помогал, а обработка промпта вела себя противоположно генерации токенов.Сразу же оговорюсь — любой GPU средней ценовой категории сделает ту же самую работу в десятки раз быстрее. Но моя задача была увидеть узкие места в «естественной среде обитания». Приятного чтения. Читать далее