← Все новости
Одна модель, разные результаты: как инфраструктура меняет бенчмарки ИИ-агентов

Одна модель, разные результаты: как инфраструктура меняет бенчмарки ИИ-агентов

В этом году Anthropic опубликовала исследование инфраструктурного шума в бенчмарках для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов. Это больше, чем типичный разрыв между соседними позициями в верхней части рейтинга. Работа интересна не только конкретными цифрами, она показывает более фундаментальную проблему: бенчмарки измеряют не модель в вакууме, а всю систему, в которой эта модель действует. Читать далее