Cuantizarea modelelor AI (model quantization) este o tehnică de optimizare care reduce precizia numerică a parametrilor unui model de inteligență artificială — de regulă de la numere cu precizie ridicată (32 de biți) la reprezentări mult mai compacte (16, 8 sau chiar 4 biți) — micșorând semnificativ dimensiunea modelului și accelerând viteza de procesare, cu o pierdere de precizie de regulă minimă și acceptabilă pentru majoritatea aplicațiilor practice.
Ideea centrală se bazează pe observația că, deși modelele sunt antrenate inițial folosind numere cu precizie ridicată pentru stabilitate matematică maximă, majoritatea aplicațiilor practice nu necesită această precizie extremă pentru a produce rezultate utile și corecte — similar modului în care rotunjirea unui preț de 19,997 lei la 20 de lei nu schimbă semnificativ înțelegerea practică a valorii, dar simplifică reprezentarea.
Beneficiile practice ale cuantizării sunt substanțiale: un model cuantizat la 8 biți ocupă aproximativ un sfert din spațiul de stocare al versiunii originale cu precizie de 32 de biți, rulează semnificativ mai rapid (mai puține date de procesat per operație), și consumă mai puțină memorie și energie — factori esențiali pentru rularea modelelor de AI pe dispozitive cu resurse limitate, precum telefoane mobile, dispozitive embedded sau hardware de consum, unde infrastructura masivă necesară pentru modelele complete, necuantizate, nu este disponibilă.
Tehnicile moderne de cuantizare aplică adesea niveluri diferite de precizie pentru diferite părți ale modelului, păstrând precizie mai mare acolo unde este cu adevărat critică pentru performanță, și reducând agresiv precizia acolo unde impactul asupra rezultatului final este neglijabil — permițând un echilibru fin ajustat între dimensiunea modelului, viteza de procesare și acuratețea rezultatelor generate.
