
Keluarga gpt-oss OpenAI baru-baru ini (terutamanya keluaran gpt-oss-20B dan gpt-oss-120B) secara eksplisit menyasarkan dua kelas penggunaan yang berbeza: inferens tempatan ringan (pengguna/tepi) dan inferens pusat data berskala besar. Keluaran itu โ dan kesibukan peralatan komuniti di sekitar pengkuantitian, penyesuai peringkat rendah dan corak reka bentuk jarang/Campuran Pakar (MoE) โ menjadikannya wajar untuk ditanya: berapa banyak pengiraan yang anda perlukan untuk menjalankan, memperhalusi dan menyediakan model ini dalam pengeluaran?

GPT-OSS direka bentuk dengan baik untuk kebolehaksesan: varian gpt-oss-20B direka bentuk untuk dijalankan pada GPU pengguna tunggal (~16 GB VRAM) atau mewah terkini

OpenAI telah mengumumkan keluaran GPT-OSS, keluarga dua model bahasa berat terbukaโgpt-oss-120b dan gpt-oss-20bโdi bawah lesen Apache 2.0 yang permisif,

gpt-oss-20b ialah model penaakulan berat terbuka mudah alih yang menawarkan prestasi o3โminiโperingkat, penggunaan alat mesra ejen dan sokongan rantaian pemikiran penuh di bawah lesen permisif. Walaupun ia tidak sekuat rakan sejawatnya 120 B, ia sangat sesuai untuk penempatan pada peranti, kependaman rendah dan sensitif privasi. Pembangun harus mempertimbangkan batasan komposisi yang diketahui, terutamanya pada tugas berat pengetahuan, dan menyesuaikan langkah berjaga-jaga keselamatan dengan sewajarnya.