← Все новости
LLM работает не на одной видеокарте: анатомия AI-инфраструктуры 2026

LLM работает не на одной видеокарте: анатомия AI-инфраструктуры 2026

Почему 70B-модель может поместиться в память и всё равно тормозить под нагрузкой? Разбираем AI-инфраструктуру 2026 года по слоям: HBM и KV-кеш, prefill и decode, NVLink и InfiniBand, tensor/pipeline parallelism, MoE, CPU, RAM и NVMe и смотрим, где на практике заканчивается производительность GPU-кластера. Читать далее