Visione del Cibo · La foto in due secondi
FoodSAM: segmentazione universale di immagini alimentari con Segment Anything Model
Immaginate di puntare una fotocamera su un piatto di pasta al pesto con gamberi: FoodSAM è in grado di identificare ogni gambero come un individuo distinto, etichettare il basilico, il parmigiano e i pinoli separatamente, riconoscere il piatto e la forchetta accanto, e rispondere se indicate con il dito un ingrediente specifico. Lo fa senza essere mai stato addestrato su quel piatto: combina la precisione spaziale di SAM — il modello di segmentazione universale di Meta AI, addestrato su un miliardo di maschere — con la conoscenza delle categorie di un classificatore alimentare convenzionale.
La trovata chiave è trattare ogni ingrediente come un individuo autonomo, proprio come avviene in cucina quando si taglia e si dispone la materia prima. Il risultato è il primo sistema unificato che risponde a tutte le domande visive su un'immagine di cibo: cos'è, quante porzioni ci sono, cosa c'è intorno, e cosa indica l'utente.
Cosa dice, in breve
- FoodSAM è un framework zero-shot che integra il Segment Anything Model (SAM) di Meta AI con un segmentatore semantico convenzionale e un rilevatore di oggetti, ottenendo segmentazione semantica, a istanze, panoptica e guidata da prompt su immagini di cibo — il primo lavoro a realizzare tutte e quattro le modalità nel dominio alimentare.
- Il nucleo del sistema è il mask-category match: per ciascuna maschera binaria category-agnostic prodotta da SAM, un'operazione di voto assegna l'etichetta semantica più frequente proveniente dal segmentatore; le maschere ambigue vengono filtrate tramite la soglia di confused degree τ.
- La strategia di merge dispone le maschere sulla mappa semantica in ordine decrescente di area (grande → piccola), risolvendo i conflitti di sovrapposizione; k = 80 maschere SAM è il punto ottimale.
- L'assunzione «ingrediente-come-individuo» — gli ingredienti sono tagliati e disposti in modo casuale in cottura — consente di convertire direttamente le maschere semantiche in foreground in maschere di istanza senza riaddestramento.
- La segmentazione panoptica aggiunge un rilevatore UniDet per etichettare gli oggetti di sfondo non alimentari (piatti, posate, bicchieri) tramite corrispondenza IoU con le maschere SAM residue.
- Su FoodSeg103 FoodSAM raggiunge 46,42 mIoU (baseline SETR: 45,1; miglior metodo zero-shot: 29,06).
- Su UECFoodPix Complete FoodSAM raggiunge 66,14 mIoU (baseline DeepLabV3+: 65,61).
Provenienza
- Fonte
- FoodSAM: Any Food Segmentation— Lan 2023
- DOI
- arXiv:2308.05938
- Licenza
- unknown
- Nel Kosmos
- 3 voci · 111 fatti atomici · tier MAIOR
↯ Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.