Visione del Cibo · La foto in due secondi

FoodSAM: segmentazione universale di immagini alimentari con Segment Anything Model

Studio citabile · un singolo studio con fonte verificabile

Immaginate di puntare una fotocamera su un piatto di pasta al pesto con gamberi: FoodSAM è in grado di identificare ogni gambero come un individuo distinto, etichettare il basilico, il parmigiano e i pinoli separatamente, riconoscere il piatto e la forchetta accanto, e rispondere se indicate con il dito un ingrediente specifico. Lo fa senza essere mai stato addestrato su quel piatto: combina la precisione spaziale di SAM — il modello di segmentazione universale di Meta AI, addestrato su un miliardo di maschere — con la conoscenza delle categorie di un classificatore alimentare convenzionale.

La trovata chiave è trattare ogni ingrediente come un individuo autonomo, proprio come avviene in cucina quando si taglia e si dispone la materia prima. Il risultato è il primo sistema unificato che risponde a tutte le domande visive su un'immagine di cibo: cos'è, quante porzioni ci sono, cosa c'è intorno, e cosa indica l'utente.

Cosa dice, in breve

  • FoodSAM è un framework zero-shot che integra il Segment Anything Model (SAM) di Meta AI con un segmentatore semantico convenzionale e un rilevatore di oggetti, ottenendo segmentazione semantica, a istanze, panoptica e guidata da prompt su immagini di cibo — il primo lavoro a realizzare tutte e quattro le modalità nel dominio alimentare.
  • Il nucleo del sistema è il mask-category match: per ciascuna maschera binaria category-agnostic prodotta da SAM, un'operazione di voto assegna l'etichetta semantica più frequente proveniente dal segmentatore; le maschere ambigue vengono filtrate tramite la soglia di confused degree τ.
  • La strategia di merge dispone le maschere sulla mappa semantica in ordine decrescente di area (grande → piccola), risolvendo i conflitti di sovrapposizione; k = 80 maschere SAM è il punto ottimale.
  • L'assunzione «ingrediente-come-individuo» — gli ingredienti sono tagliati e disposti in modo casuale in cottura — consente di convertire direttamente le maschere semantiche in foreground in maschere di istanza senza riaddestramento.
  • La segmentazione panoptica aggiunge un rilevatore UniDet per etichettare gli oggetti di sfondo non alimentari (piatti, posate, bicchieri) tramite corrispondenza IoU con le maschere SAM residue.
  • Su FoodSeg103 FoodSAM raggiunge 46,42 mIoU (baseline SETR: 45,1; miglior metodo zero-shot: 29,06).
  • Su UECFoodPix Complete FoodSAM raggiunge 66,14 mIoU (baseline DeepLabV3+: 65,61).

Provenienza

Fonte
FoodSAM: Any Food Segmentation— Lan 2023
Licenza
unknown
Nel Kosmos
3 voci · 111 fatti atomici · tier MAIOR

Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.

Ancora su Visione del Cibo