![[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс](https://habrastorage.org/getpro/habr/upload_files/b6a/2f1/8e4/b6a2f18e45e896a98a3c0f21f86eeb07.png)
[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс
← Предыдущая главаНу а теперь рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки, потому что теперь приходится учитывать еще один фактор — задержку. Так что давайте разбираться, как устроен инференс LLM и как его правильно масштабировать. Читать далее