O curbă de învățare (learning curve), în contextul învățării automate, este o reprezentare grafică a modului în care performanța unui model — de regulă eroarea sau acuratețea sa — evoluează pe măsură ce este expus la o cantitate crescândă de date de antrenament sau pe măsură ce trec mai multe iterații (epoci) de antrenament, oferind informații valoroase pentru diagnosticarea și îmbunătățirea procesului de dezvoltare a modelului.
Analiza curbei de învățare ajută practicienii să diagnosticheze probleme comune: dacă atât eroarea pe datele de antrenament, cât și cea pe datele de validare rămân ridicate și converg spre o valoare mare, similară, modelul suferă probabil de underfitting (este prea simplu pentru a captura tiparele din date, necesitând o arhitectură mai complexă sau caracteristici suplimentare); dacă eroarea pe antrenament scade constant la valori foarte mici, dar eroarea pe validare rămâne ridicată sau chiar crește, modelul suferă de overfitting (a memorat particularitățile specifice ale datelor de antrenament, în loc să învețe tipare generalizabile, necesitând tehnici de regularizare sau mai multe date).
Curba de învățare este utilă și pentru a estima dacă adăugarea de date suplimentare de antrenament ar îmbunătăți semnificativ performanța modelului: dacă eroarea de validare continuă să scadă vizibil pe măsură ce se adaugă mai multe date, colectarea de date suplimentare este probabil o investiție valoroasă; dacă eroarea de validare s-a stabilizat deja, indiferent de volumul suplimentar de date, problema se află probabil în altă parte — arhitectura modelului, calitatea caracteristicilor sau natura intrinsecă dificilă a problemei — nu în lipsa de date.
Practicienii experimentați folosesc rutinar analiza curbelor de învățare ca prim pas de diagnostic atunci când performanța unui model nu îndeplinește așteptările, înainte de a investi timp în modificări mai costisitoare ale arhitecturii sau colectării de date suplimentare.
