ИИ-модель уменьшили вдвое, а она стала умнее: новый метод от Multiverse Computing

Исследователи из компании Multiverse Computing представили технику Quantization-Aware Healing, которая позволяет уменьшить размер нейросети без потери качества, а в ряде случаев даже улучшить её. Результаты опубликованы в блоге Hugging Face 25 августа.
В рамках эксперимента специалисты сократили открытую модель OpenAI GPT-OSS со 120 миллиардов параметров до 60 миллиардов. Память модели также была сжата до 4-битного формата, что существенно снижает требования к вычислительным ресурсам.
Обычно уменьшение модели ведёт к ухудшению точности, однако новая методика позволила обойти это ограничение. Ключевая особенность заключается в том, что обучение усечённой версии проводилось на основе оригинальной полноценной модели, а не на промежуточной ослабленной копии, как это делается при стандартной квантизации.
В ходе тестирования уменьшенная модель показала более высокие результаты, чем полная версия, в семи из девяти контрольных испытаний. Это нетипичный случай, который может указывать на эффективность предложенного подхода.
Практическая ценность разработки заключается в том, что компактные модели проще запускать на мобильных устройствах и встраивать в повседневные сервисы. Это потенциально расширяет сферу применения ИИ без необходимости в мощных серверах.
Метод опубликован в открытом доступе, поэтому другие разработчики могут воспроизвести эксперимент и проверить его на собственных архитектурах. Специалисты не делают прогнозов по коммерческому внедрению, однако отмечают, что подобные техники способны изменить подход к оптимизации нейросетей.
.






ФинБи