Un model de difuzie latentă (Latent Diffusion Model) este o arhitectură de inteligență artificială generativă folosită pentru crearea de imagini de înaltă calitate, care operează procesul de generare într-un spațiu „latent” comprimat, mult mai mic decât spațiul complet al pixelilor unei imagini, reducând semnificativ costurile computaționale comparativ cu modelele de difuzie clasice.
Procesul de difuzie, în general, funcționează în două etape conceptuale: mai întâi, în timpul antrenamentului, modelul învață cum se degradează progresiv o imagine reală prin adăugarea repetată de zgomot aleatoriu, până când devine zgomot pur; apoi, modelul învață procesul invers — pornind de la zgomot pur complet aleatoriu, elimină treptat zgomotul, pas cu pas, ghidat adesea de o descriere text (prompt), până produce o imagine coerentă, nouă, care corespunde descrierii date.
Inovația centrală a difuziei latente este că acest proces complex de eliminare treptată a zgomotului nu se desfășoară direct asupra pixelilor imaginii finale (care ar necesita resurse de calcul enorme pentru imagini de rezoluție mare), ci într-un spațiu comprimat, latent, unde informația vizuală esențială este reprezentată mult mai compact. Abia la final, o rețea separată decodifică reprezentarea latentă finală înapoi într-o imagine completă, cu pixeli reali.
Această optimizare tehnică a făcut posibilă generarea de imagini de calitate remarcabilă pe hardware mult mai accesibil decât ar necesita difuzia clasică la nivel de pixeli, stând la baza popularității explozive a instrumentelor de generare de imagini prin text, care permit oricui să creeze imagini complexe și detaliate doar descriindu-le în limbaj natural.
