![[Перевод] Запускаем LLM локально на Windows: WSL2, Docker, CUDA и vLLM](https://habrastorage.org/getpro/habr/upload_files/09d/d3e/2dc/09dd3e2dc11319089edcfacc2b6780cd.webp)
[Перевод] Запускаем LLM локально на Windows: WSL2, Docker, CUDA и vLLM
Большинство инструкций по локальному запуску LLM сводятся к одной-двум командам: вставьте их в терминал, дождитесь загрузки модели и готово. Такой подход работает ровно до первой ошибки. После этого становится непонятно, на каком из нескольких уровней возникла проблема: в Windows, WSL2, драйвере NVIDIA, Docker, CUDA или самом inference-сервере.В этой статье развернем Qwen3-0.6B на обычной NVIDIA-видеокарте под Windows 11 с использованием WSL2, Docker, NVIDIA Container Toolkit и vLLM. Читать далее