OpenAI выявила проблемы в бенчмарке SWE-Bench Pro для оценки ИИ-моделей

Компания OpenAI опубликовала анализ, посвященный оценке качества кода, создаваемого искусственным интеллектом. Исследование сосредоточено на популярном бенчмарке SWE-Bench Pro, который используется для сравнения возможностей различных ИИ-моделей в задачах программирования.

По данным OpenAI, SWE-Bench Pro содержит значительный уровень шума, что затрудняет получение объективных результатов. Аналитики компании отметили, что существующие метрики не всегда позволяют отделить реальные достижения моделей от случайных совпадений, что ставит под сомнение надежность оценок.

В рамках работы специалисты OpenAI предложили методы для повышения достоверности тестирования. Эти подходы направлены на фильтрацию помех и более точное измерение способностей ИИ в написании кода.

SWE-Bench Pro является одним из наиболее распространенных тестов в области AI-разработки. Он включает широкий спектр задач по программированию, однако результаты анализа показывают необходимость его модернизации.

Проблемы, выявленные OpenAI, могут иметь значение для всей индустрии. Точность оценки моделей напрямую влияет на их дальнейшее развитие и внедрение в реальные проекты. Компания подчеркивает важность создания более совершенных бенчмарков.

Данное исследование продолжает серию работ OpenAI, направленных на улучшение методов измерения производительности ИИ. Ранее компания уже предлагала решения для повышения прозрачности тестирования.