Segmentarea de instanțe (instance segmentation) este o tehnică avansată de viziune computerizată care combină detectarea obiectelor cu segmentarea la nivel de pixel, identificând nu doar categoria fiecărui obiect dintr-o imagine, ci și delimitând precis fiecare instanță individuală a acelui obiect, chiar și atunci când mai multe obiecte de aceeași categorie se suprapun parțial.
Diferența cheie față de segmentarea semantică (care atribuie doar o etichetă de categorie fiecărui pixel, fără a distinge între obiecte individuale — toate mașinile dintr-o imagine primesc aceeași etichetă „mașină”) este că segmentarea de instanțe generează o mască separată pentru fiecare obiect individual: mașina 1 primește o mască distinctă de mașina 2, chiar dacă ambele sunt din aceeași categorie și se ating vizual în imagine.
Arhitectura de referință pentru această sarcină este Mask R-CNN, care extinde un detector de obiecte standard cu o rețea suplimentară dedicată generării unei măști de pixeli precise pentru fiecare obiect detectat, combinând astfel avantajele localizării precise (cutii de încadrare) cu delimitarea exactă a formei fiecărui obiect.
Aplicațiile practice ale segmentării de instanțe sunt numeroase în domenii unde contarea și delimitarea precisă a obiectelor individuale contează: numărarea automată a plantelor sau fructelor în agricultura de precizie (fiecare fruct trebuie identificat separat, chiar dacă se ating pe ramură), analiza automată a imaginilor medicale (delimitarea separată a fiecărei celule sau tumori individuale dintr-o probă), robotica de tip pick-and-place din depozite (identificarea și localizarea precisă a fiecărui obiect individual dintr-o grămadă pentru manipulare robotică) și editarea foto avansată, care permite selectarea și manipularea independentă a fiecărui obiect dintr-o imagine.
