← Все новости
Какую LLM выбрать: собираем свой бенчмарк

Какую LLM выбрать: собираем свой бенчмарк

Обычно, когда выбирают LLM, сначала смотрят рейтинги. Проблема рейтингов в том, что по ним не узнать, как модель справится с вашими задачами и сколько это будет стоить.В нашей лаборатории мы пользуемся электронным лабораторным — базой, куда записываются данные всех эксперименотов и измерений, а ИИ ассистент отвечает на вопросы по ней. Разумеется, возник вопрос, какая модель должна этим ассистентом рулить. Публичные рейтинги ответа не давали, так что мы собрали свой бенчмарк: двадцать четыре вопроса по нашей работе, которые гоняются по живому журналу через mcp на моделях DeepSeek, ChatGPT и Claude.Дальше я покажу, как мы собирали эти двадцать четыре вопроса, что на них показали девятнадцать сочетаний модели и уровня усилий при рассуждении (reasoning effort) примерно в 450 прогонах — и как сделать такой же тест под свою задачу. Читать далее