← Все новости
Как выбрать и проверить LLM для рабочих задач: Claude, GPT, Gemini и другие модели

Как выбрать и проверить LLM для рабочих задач: Claude, GPT, Gemini и другие модели

Новая LLM обошла конкурентов в работе с кодом. Но справится ли она с ошибкой в вашем репозитории? А модель, которая хорошо анализирует документы, — с таблицами, где возвраты лежат в отдельном файле, а правила расчёта выручки менялись три раза?Опубликованные тесты помогают выбрать несколько моделей для сравнения. Дальше нужны собственная задача и понятные условия приёмки: что должно получиться, как проверить результат и сколько ручной работы допустимо.Привет, Хабр! Я Игорь Зуриев, руководитель проектов по автоматизации бизнеса и внедрению систем на базе ИИ. Больше десяти лет управляю ИТ-проектами, в том числе для заказчиков из нефтегазовой отрасли и строительства — «Лукойла», аэропорта Шереметьево, «Трансгаза». Автор и преподаватель программ по ИТ-проектам и цифровым продуктам, в том числе в Университете Иннополис. В школе Karpov.Courses преподаю применение ИИ для анализа данных. Веду в ТГ канал «Нейросетка». Сам использую ИИ для работы с кодом, документами и прототипами. Fable 5.1 понравилась мне тем, что код получался практически без ошибок с первого раза. В Stitch я описывал изменения интерфейса словами и сравнивал варианты экранов. А один из запусков Sonnet 5 закончился исчерпанием лимита без готового результата. Поэтому меня интересует и качество ответа, и то, сколько работы после него остаётся человеку. Читать далее