← Все новости
RPS одинаковый, но p95 по TTFT хуже в 2,7 раза: что round-robin делает с KV-cache

RPS одинаковый, но p95 по TTFT хуже в 2,7 раза: что round-robin делает с KV-cache

В замере Red Hat два балансировщика распределяли один и тот же чат-трафик между четырьмя GPU NVIDIA L4. По числу обработанных запросов в секунду результаты почти совпали: 0,52 у обычного round-robin и 0,49 у маршрутизации с учётом префиксов. Но p95 времени до первого токена различался в 2,7 раза: 745 мс у round-robin против 272 мс у prefix-aware routing.GPU, модель и нагрузка в обоих прогонах были одинаковыми, менялся только способ выбора реплики. Счётчик RPS этого не показывает: он учитывает обращения, но не работу, которую под выполняет для конкретного запроса. Если нужный префикс уже лежит в KV-cache, модель начинает генерацию быстрее. Если запрос попадает в соседнюю реплику без этого состояния, ей приходится заново считать всю голову запроса.Этот разбор посвящён выбору реплики для self-hosted LLM-инференса в Kubernetes. Он пригодится инженерам, которые запускают модели на нескольких GPU, и владельцам платформ, оценивающим нагрузку по загрузке карт и числу запросов. Для контуров с одной репликой вопрос маршрутизации не возникает; порог применимости разобран отдельно.Все примеры основаны на публичных замерах разных команд. Я рассматриваю задачу со стороны инфраструктуры: как маршрутизация влияет на использование GPU, задержки и требования к Kubernetes-контуру. VK Tech предоставляет GPU-ноды и vGPU для развёртывания таких систем. Читать далее