„OpenAI“ netikėtai sukrėtė dirbtinio intelekto aplinką, pristatydama GPT -OSS – pirmąjį didelį atvirojo kodo modelį per daugiau nei penkerius metus. Šis pokytis žymi nukrypimą nuo ankstesnės bendrovės strategijos, kuri daugiausia dėmesio skyrė patentuotiems modeliams ir uždaroms paslaugoms. Su GPT-OSS „OpenAI“ grįžta prie savo ištakų, atverdama duris visiems ar bet kuriai organizacijai pasiekti, paleisti ir pritaikyti galingą kalbos modelį, nepasikliaujant debesijos platforma ar interneto ryšiu.
Naujasis modelis siūlomas dviejų versijų: viena su 120.000 milijardų parametrų ir lengvesnė su 20.000 milijardų . Galingesnė versija gali veikti su vienu profesionaliu GPU su bent 80 GB atminties, o mažesnė versija skirta įprastiems stacionariems ir nešiojamiesiems kompiuteriams su 16 GB RAM, todėl gerokai padidėja prieiga prie pažangių dirbtinio intelekto galimybių . Abi versijas galima nemokamai atsisiųsti iš tokių platformų kaip „Hugging Face“ ir diegti populiariose paslaugose, tokiose kaip „Azure“ ar AWS.
Techninės charakteristikos ir naudojama technologija
„OpenAI“ pristatė du GPT-OSS modelius, sukurtus naudojant „Transformer“ pagrindu sukurtą architektūrą ir ekspertų mišinį (MoE) . Tai optimizuoja atminties naudojimą ir delsą, aktyvuojant tik pasirinktą ekspertų dalį kiekvienam įvesties žetonui, taip padidinant efektyvumą neprarandant galios. 120B leidimas naudoja 36 blokus ir aktyvuoja 5.100 milijardo parametrų vienam žetonui, o 20B leidimas naudoja 24 blokus ir aktyvuoja 3.600 milijardo, todėl tinka pigesnei techninei įrangai.
Abu modeliai buvo apmokyti daugiausia naudojant anglų kalbos duomenis iš STEM sričių, programavimo ir bendrųjų žinių , įskaitant papildomą prižiūrimo derinimo ir sustiprinimo etapą, siekiant pagerinti jų suderinamumą su žmogaus instrukcijomis . Jų galimybės apima mąstymo grandinės samprotavimą , gebėjimą suskirstyti tarpinius veiksmus prieš pateikiant atsakymą ir išorinių įrankių, tokių kaip naršymas internete ir Python kodo vykdymas, naudojimą.
Prieinamumas, licencijavimas ir integravimo parinktys
Vienas iš pagrindinių GPT-OSS privalumų yra „Apache 2.0“ licencija , kuri panaikina daugelį įprastų kitų patentuotų modelių apribojimų: ji leidžia komercinį naudojimą, platinimą ir integravimą į visų tipų projektus – nuo mažų startuolių iki didelių viešųjų organizacijų ar mokslinių tyrimų ir plėtros iniciatyvų. Modelio svoriai pateikiami MXFP4 formatu ir apima etaloninius įgyvendinimus „PyTorch“ ir „Apple Metal“, taip pat yra visiškai suderinami su tokiais įrankiais kaip „Ollama“, „llama.cpp“, „LM Studio“ ir „vLLM“ , todėl ją galima naudoti tiek profesionalioje, tiek namų aplinkoje.
GPT-OSS-20B diegimas ir parengimas yra ypač paprastas dėl tokių programų kaip „LM Studio“, kuri leidžia vartotojams, neturintiems programavimo patirties, atsisiųsti ir išbandyti modelį vietoje naudojant grafinę sąsają. Be to, „OpenAI“ paskelbė rekomendacijas ir išsamią dokumentaciją, kaip tiksliai suderinti ir pritaikyti modelius, taip pat paruoštas integracijas debesijos ir vietinėse platformose.
Saugumas, testavimas ir atsakingas požiūris
Paleidžiant GPT-OSS, daugiausia dėmesio skirta ne tik atvirumui, bet ir saugumui bei atsakingam modelių naudojimui. „OpenAI“ įdiegė naujus peržiūros ir patvirtinimo mechanizmus, kad būtų išvengta su netinkamu naudojimu susijusios rizikos, ypač tokiose jautriose srityse kaip kibernetinis saugumas ir kenkėjiškų agentų kūrimas. Šiuo tikslu buvo įdiegta prieštaringo testavimo metodika („red teaming“), atliekant išorines nepriklausomų ekspertų peržiūras, ir protokolai, skirti imituoti ekstremalius išnaudojimo scenarijus.
Kartu su modelių išleidimu „OpenAI“ pradėjo tinklo komandinio darbo konkursą, kuriame bus skiriamas finansinis atlygis tiems, kurie nustato pažeidžiamumus ar probleminį elgesį, siekdama aktyvaus pasaulinės bendruomenės bendradarbiavimo rizikos nustatymo srityje. Be to, GPT-OSS atskleidžia savo samprotavimo grandinę , palengvindama atsakymų auditą ir stebėseną, siekiant išvengti šališkumo ar kritinių klaidų.
Našumas ir palyginimas su kitais atvirais modeliais
Akademiniuose lyginamuosiuose testuose ir mąstymo testuose GPT-OSS-120B rezultatai prilygsta ir kai kuriose srityse netgi lenkia naujausius patentuotus „OpenAI“ modelius, tokius kaip „o4-mini“, ir tam tikruose kontekstuose lenkia kitus, tokius kaip „DeepSeek R1“ ar „Llama“ seriją. 20B versija, optimizuota namų įrenginiams, išlaiko puikų efektyvumo ir našumo balansą , pasiekdama labai konkurencingus rezultatus matematikos, programavimo ir sveikatos užduotyse.
„OpenAI“ įspėja, kad šie atviri modeliai, palyginti su debesijos pagrindu veikiančiais analogais, gali būti labiau linkę į „haliucinacijas“ (fakto klaidas), atsižvelgiant į mokymo ir stebėjimo skirtumus. Tačiau dabar vartotojai gali naudoti aukšto lygio modelius, nereikalaudami internetinių paslaugų.