Fereastra de context (context window) este cantitatea maximă de text pe care un model de limbaj o poate „vedea” și procesa simultan într-o singură interacțiune, măsurată de obicei în tokenuri (unități mai mici decât cuvinte întregi, rezultate din procesul de tokenizare).
Tot ce se află în fereastra de context — instrucțiunile utilizatorului, documentele atașate, istoricul conversației anterioare, exemplele oferite — influențează direct răspunsul generat de model. Odată ce lungimea totală a conversației depășește dimensiunea ferestrei de context, informația cea mai veche este de regulă eliminată sau trebuie rezumată, iar modelul „uită” efectiv conținutul respectiv, indiferent cât de important a fost la momentul respectiv al conversației.
Dimensiunea ferestrelor de context a crescut dramatic în ultimii ani — de la câteva mii de tokenuri în primele generații de modele mari de limbaj, la sute de mii sau chiar peste un milion de tokenuri în modelele moderne, permițând procesarea unor documente extrem de lungi (cărți întregi, coduri sursă complexe, transcrieri lungi de întâlniri) într-o singură cerere, fără a fi nevoie de împărțirea artificială a conținutului în bucăți mai mici.
O fereastră de context mai mare vine, în general, cu costuri computaționale mai mari (procesarea unui text mai lung necesită mai multă putere de calcul) și, în unele cazuri, cu o ușoară degradare a preciziei atunci când informația relevantă este „îngropată” în mijlocul unui context foarte lung — un fenomen studiat sub numele de „lost in the middle”, care influențează modul în care se structurează optim prompturile complexe pentru rezultate maxime.
