K-Means este unul dintre cei mai populari algoritmi de clusterizare (clustering) — o tehnică de învățare automată nesupravegheată care grupează automat punctele de date similare în categorii (numite clustere), fără a avea nevoie de etichete predefinite ale categoriilor corecte.
Algoritmul funcționează printr-un proces iterativ simplu: mai întâi, se alege un număr de clustere dorite, notat K; algoritmul plasează aleatoriu K „centre” inițiale în spațiul datelor; fiecare punct de date este atribuit celui mai apropiat centru; centrele sunt recalculate ca media (centroid) tuturor punctelor atribuite lor; procesul de atribuire și recalculare se repetă până când centrele nu se mai mișcă semnificativ, semn că algoritmul a convergent la o soluție stabilă.
O provocare centrală a K-Means este alegerea numărului optim de clustere K, care trebuie specificat înainte de rulare, deoarece algoritmul nu îl determină automat din date. Tehnici precum „metoda cotului” (elbow method) ajută la identificarea unui K rezonabil, analizând cum scade eroarea totală de clusterizare pe măsură ce numărul de clustere crește.
K-Means este folosit pe scară largă pentru segmentarea clienților în marketing (gruparea clienților cu comportamente de cumpărare similare pentru campanii personalizate), compresia imaginilor (reducerea numărului de culori distincte), detectarea anomaliilor (punctele care nu se potrivesc bine în niciun cluster pot indica valori aberante) și organizarea automată a documentelor sau articolelor pe teme similare, fără intervenție manuală de categorisire.
