
Reasoning-модели нужно измерять по-новому. Представляем публичный лидерборд MERA Reason
За последний год в мире больших языковых моделей произошел заметный сдвиг. Если раньше основным предметом соревнования были знания модели — насколько хорошо она отвечает на вопросы (общие или специальные), знает факты или пишет код, — то со временем фокус сместился на способность рассуждать.Практически каждый крупный релиз последних месяцев позиционируется как reasoning-модель. Производители говорят уже не столько о знаниях, сколько о способности строить длинные цепочки рассуждений, решать сложные задачи и принимать решения в условиях неопределенности.Но вместе с этим возникает закономерный вопрос: а как объективно измерять reasoning? Читать далее