
Недавнее семейство OpenAI gpt-oss (в частности, версии gpt-oss-20B и gpt-oss-120B) чётко ориентировано на два разных класса развёртываний: лёгкий локальный вывод (потребитель/периферия) и вывод в крупных центрах обработки данных. Этот выпуск, а также поток инструментов сообщества, связанных с квантизацией, низкоранговыми адаптерами и шаблонами проектирования разреженных/смешанных экспертов (MoE), заставляют задаться вопросом: сколько вычислительных ресурсов вам действительно нужно для запуска, настройки и обслуживания этих моделей в рабочей среде?

GPT-OSS необычайно хорошо спроектирован для обеспечения доступности: вариант gpt-oss-20B предназначен для работы на одном потребительском графическом процессоре (~16 ГБ видеопамяти) или на современных высокопроизводительных графических процессорах

Компания OpenAI объявила о выпуске GPT-OSS, семейства из двух моделей открытого языка — gpt-oss-120b и gpt-oss-20b — под разрешительной лицензией Apache 2.0.

gpt-oss-20b — это портативная модель рассуждений с открытыми весами, обеспечивающая производительность уровня o3-mini, удобное использование инструментов агентами и полную поддержку цепочки мыслей в рамках разрешительной лицензии. Хотя она не так мощна, как её аналог на 120 байт, она идеально подходит для локальных развёртываний с низкой задержкой и конфиденциальностью. Разработчикам следует учитывать её известные композиционные ограничения, особенно при выполнении задач, требующих больших знаний, и соответствующим образом адаптировать меры безопасности.