
La reciente familia gpt-oss de OpenAI (en particular, las versiones gpt-oss-20B y gpt-oss-120B) se centra explรญcitamente en dos tipos de implementaciรณn: inferencia local ligera (consumidor/edge) e inferencia de centros de datos a gran escala. Esta versiรณn, junto con la avalancha de herramientas de la comunidad en torno a la cuantificaciรณn, los adaptadores de bajo rango y los patrones de diseรฑo dispersos/mixtos de expertos (MoE), hace que valga la pena preguntarse: ยฟcuรกnta computaciรณn se necesita realmente para ejecutar, ajustar y servir estos modelos en producciรณn?

GPT-OSS estรก excepcionalmente bien diseรฑado para la accesibilidad: la variante gpt-oss-20B estรก diseรฑada para ejecutarse en una sola GPU de consumo (~16 GB VRAM) o en una GPU de gama alta reciente.

OpenAI ha anunciado el lanzamiento de GPT-OSS, una familia de dos modelos de lenguaje de peso abierto (gpt-oss-120b y gpt-oss-20b) bajo la licencia permisiva Apache 2.0.

gpt-oss-20b es un modelo de razonamiento portรกtil y de peso abierto que ofrece rendimiento a nivel de o3-mini, un uso de herramientas intuitivo para agentes y compatibilidad total con cadenas de pensamiento bajo una licencia permisiva. Si bien no es tan potente como su contraparte de 120 B, es ideal para implementaciones en dispositivos, de baja latencia y con privacidad sensible. Los desarrolladores deben considerar sus conocidas limitaciones de composiciรณn, especialmente en tareas que requieren un alto nivel de conocimiento, y adaptar las medidas de seguridad en consecuencia.