OpenAI забраковала ИИ-бенчмарк, который сама же продвигала: ~30% задач SWE-Bench Pro сломаны
OpenAI опубликовала аудит SWE-Bench Pro — одного из главных бенчмарков для оценки кодинг-способностей моделей — и пришла к выводу, что около 30% его задач сломаны.
Компания официально отозвала свою рекомендацию использовать этот бенчмарк и посоветовала разработчикам моделей внимательно перепроверять результаты на нем.Ирония в том, что ранее SWE-Bench Pro продвигала сама OpenAI.
Новая модель Meta* обходит Opus 4.8 и GPT-5.5 в агентских задачах — и стоит $1.25 за миллион токенов
habr.com