OpenAI presentó GPT-OSS, una familia de modelos de “open weights” bajo licencia Apache 2.0: gpt-oss-120b y gpt-oss-20b. Están pensados para razonamiento, uso de herramientas y workflows agenticos, con buen desempeño/costo y ejecución eficiente en hardware accesible (hasta 80 GB de VRAM para 120b y 16 GB de VRAM para 20b gracias a una cuantización nativa). Además, permiten ajustar el “esfuerzo de razonamiento” según la tarea.
Los modelos gpt-oss representan una oportunidad única al combinar alto rendimiento en razonamiento y agentes con la flexibilidad de operar en entornos controlados, gracias a que sus pesos son abiertos y licenciados bajo Apache 2.0. Esto abre la posibilidad de crear asistentes, agentes y sistemas de RAG adaptados a diferentes necesidades, siempre bajo el control de la propia organización.
Para más información técnica refierase al "model card": https://openai.com/index/gpt-oss-model-card y anuncio oficial: https://openai.com/index/gpt-oss-model-card
Utilización
Estos módelos pueden ser utilizados localmente mediante ollama (https://ollama.com) y lmstudio (https://lmstudio.ai).
Asegura tener el hardware necesario (GPUs) y considera el modelo GPT-OSS de 20B.
Ollama y LMstudio ambos tienen chat interfaces y exponen un API que puedes utilizar para integrar.
Si fueras a utilizar este modelo en vscode puedes configurar continuedev plugin para ejecución local contra ollama o lmstudio. También puedes optar por configurar Github Copilot para que utilice ollama en el chat interface. Si eres usuario de JetBrains IDE y tienes el JetBrains AI entonces puedes configurar offline mode para que utilice Ollama.
Notas adicionales
-Si tu GPU es uno integrado y digamos que tienes un Ryzen AI 350 cuyo iGPU es AMD Radeon 860M , entonces LMstudio es la solución recomendada ya que tiene mejor support para ese tipo de tarjeta. En general LMstudio tiene más support para AMD GPUs.
En caso de no tener el hardware necesario, la ejecución de estos modelos mediante servicios externos es costo efectivo considerando el costo por token. Puedes usar estos modelos de manera externa mediante API integration con OpenRouter, Groq, Azure, AWS, Google, entre otros.
El costo usual de correr el modelo GPT-OSS 120B en Groq es de $0.15 por 1 millón de token input y $0.75 por 1 millon de token output. El costo usual del GPT-OSS 20B en Groq es de $0.10 por 1 millon de token input y $0.50 por 1 millon token output. Estos costos pueden variar por proveedor de servicio. En OpenRouter hay otros proveedores que incluso tienen un precio menor.
Conclusión
El lanzamiento de gpt-oss representa un punto de inflexión en la forma en que los desarrolladores y organizaciones pueden acceder a modelos de gran escala. A diferencia de los modelos cerrados, esta familia de open-weights bajo licencia Apache 2.0 ofrece la libertad de descargar, inspeccionar, afinar y desplegar en infraestructuras locales o en la nube, sin quedar atados a un solo proveedor.
Por un lado, el 20B se convierte en una opción práctica para proyectos de prueba, despliegues on-premise y pilotos con hardware accesible (16 GB de VRAM), mientras que el 120B se posiciona como un modelo robusto para razonamiento complejo y agentes que aún puede ejecutarse en una sola GPU de 80 GB. Esto lo hace atractivo tanto para startups como para industrias sensibles (salud, finanzas, sector público), donde la auditoría y el control de datos son críticos.
