LoRA (Low-Rank Adaptation) este o tehnică eficientă de reglare fină (fine-tuning) a modelelor mari de inteligență artificială, care permite adaptarea unui model preantrenat la o sarcină sau un domeniu specific, actualizând doar o fracțiune mică din parametrii totali ai modelului, în loc să reantreneze întreaga rețea — reducând dramatic costurile computaționale și de memorie necesare.
Principiul tehnic din spatele LoRA se bazează pe observația că modificările necesare pentru a adapta un model mare la o sarcină nouă pot fi reprezentate eficient printr-o matrice de „rang scăzut” — o structură matematică mult mai simplă și mai compactă decât matricea completă de parametri ai modelului original. În loc să modifice direct milioane sau miliarde de parametri ai modelului de bază, LoRA introduce mici matrice suplimentare, mult mai mici, care sunt antrenate separat pe sarcina specifică dorită, în timp ce parametrii originali ai modelului rămân complet neschimbați, „înghețați”.
Acest design aduce avantaje practice semnificative: procesul de antrenament necesită mult mai puțină memorie GPU (uneori suficientă pentru a rula pe hardware de consum, nu doar pe infrastructura masivă necesară pentru fine-tuning complet), fișierele rezultate (numite „adaptoare LoRA”) sunt de dimensiuni foarte mici comparativ cu modelul complet, permițând stocarea și distribuirea eficientă a multiple versiuni specializate ale aceluiași model de bază, și un singur model de bază poate fi combinat rapid cu diferite adaptoare LoRA pentru a comuta instant între specializări diferite, fără a păstra multiple copii complete ale modelului.
Datorită acestor avantaje, LoRA a devenit tehnica standard pentru personalizarea eficientă a modelelor mari de limbaj și de generare de imagini de către utilizatori și companii cu resurse computaționale limitate, democratizând accesul la personalizarea AI avansată.
