Pre-formarea (pretraining) este prima și cea mai costisitoare etapă din antrenarea unui model mare de inteligență artificială, în care modelul învață tipare generale — de limbaj, de vizualizare sau de alt tip de date — dintr-un set masiv și divers de informații, fără a fi orientat încă spre o sarcină specifică.
Pentru modelele de limbaj, de exemplu, pre-formarea constă în expunerea modelului la cantități enorme de text (miliarde până la trilioane de cuvinte, provenite din cărți, articole, site-uri web și alte surse), antrenând modelul să prezică următorul cuvânt dintr-o secvență, un proces autosupervizat care nu necesită etichetare manuală a datelor. Prin acest proces simplu, dar aplicat la scară masivă, modelul învață implicit gramatică, fapte despre lume, raționament logic de bază și tipare stilistice, fără ca nimeni să-i „predea” explicit aceste concepte.
Odată finalizată, pre-formarea produce un model de bază (foundation model) cu capacități generale largi, care poate fi apoi adaptat mult mai eficient prin reglare fină (fine-tuning) pentru sarcini specifice — răspunsuri conversaționale, generare de cod, sumarizare de documente — folosind cantități mult mai mici de date specializate.
Costul computațional al pre-formării este imens — antrenarea celor mai mari modele de limbaj poate necesita mii de GPU-uri specializate rulând continuu timp de săptămâni sau luni, cu costuri de zeci de milioane de dolari — motiv pentru care doar un număr restrâns de companii cu resurse masive de infrastructură pot antrena modele de la zero, majoritatea utilizatorilor și companiilor bazându-se pe modele pre-antrenate, adaptate ulterior prin fine-tuning.
