GPT (Generative Pre-trained Transformer) este o arhitectură de model de limbaj bazată pe transformer, proiectată special pentru generarea de text, dezvoltată inițial de OpenAI și devenită ulterior fundamentul unei întregi familii de modele de inteligență artificială conversațională, inclusiv seria de modele care alimentează ChatGPT.
Arhitectura GPT funcționează unidirecțional (de la stânga la dreapta), prezicând la fiecare pas cel mai probabil cuvânt (sau token) următor, pe baza întregii secvențe de text generate până în acel moment — un proces numit „generare autoregresivă”. Deși simplu conceptual, acest mecanism, aplicat la scară masivă (miliarde sau trilioane de parametri, antrenați pe cantități enorme de text), produce capacități surprinzătoare de raționament, scriere creativă, generare de cod și conversație naturală.
Denumirea reflectă cele trei elemente cheie ale abordării: generativ (creează text nou, nu doar clasifică text existent), pre-antrenat (învață tipare generale de limbaj dintr-un corpus masiv, înainte de orice specializare), și transformer (arhitectura de rețea neuronală care stă la baza modelului, bazată pe mecanismul de atenție, capabil să proceseze eficient relații complexe între cuvinte, indiferent de distanța dintre ele în text).
Succesul arhitecturii GPT a demonstrat, empiric, fenomenul de „scalare”: pe măsură ce modelele au crescut în dimensiune (numărul de parametri) și au fost antrenate pe seturi de date din ce în ce mai mari, capacitățile lor au crescut adesea în mod surprinzător de rapid și au apărut abilități complet noi, neanticipate explicit de proiectanții modelului — un fenomen numit „capacități emergente”.
