
OpenAI'nin son gpt-oss ailesi (özellikle gpt-oss-20B ve gpt-oss-120B sürümleri), iki farklı dağıtım sınıfını açıkça hedef alıyor: hafif yerel çıkarım (tüketici/uç) ve büyük ölçekli veri merkezi çıkarımı. Bu sürüm ve niceleme, düşük seviyeli adaptörler ve seyrek/Uzman Karışımı (MoE) tasarım kalıpları etrafında gelişen topluluk araçları, şu soruyu sormaya değer kılıyor: Bu modelleri üretimde çalıştırmak, ince ayar yapmak ve sunmak için aslında ne kadar işlem gücüne ihtiyacınız var?

GPT-OSS, erişilebilirlik açısından alışılmadık derecede iyi tasarlanmıştır: gpt-oss-20B çeşidi, tek bir tüketici GPU'sunda (~16 GB VRAM) veya son zamanlardaki üst düzey

OpenAI, izin verici Apache 120 lisansı altında iki açık ağırlıklı dil modeli ailesi olan gpt-oss-20b ve gpt-oss-2.0b'nin yayınlandığını duyurdu.

gpt-oss-20b, o3 mini seviyesinde performans, ajan dostu araç kullanımı ve izin verici bir lisans altında tam düşünce zinciri desteği sunan taşınabilir, açık ağırlıklı bir akıl yürütme modelidir. 120 B muadili kadar güçlü olmasa da, cihaz içi, düşük gecikmeli ve gizliliğe duyarlı dağıtımlar için benzersiz bir şekilde uygundur. Geliştiriciler, özellikle bilgi yoğun görevlerde bilinen bileşimsel sınırlamalarını göz önünde bulundurmalı ve güvenlik önlemlerini buna göre ayarlamalıdır.