Visione del Cibo · La foto in due secondi
IngredSAM: Segmentazione Open-World degli Ingredienti Alimentari tramite Prompt a Singola Immagine (Chen 2024)
Insegnare a un computer a riconoscere il parmigiano, gli spinaci e i pinoli in una fotografia di un piatto di pasta è sorprendentemente difficile: lo stesso ingrediente può sembrare completamente diverso a seconda di come è cucinato, della luce o di come è disposto nel piatto. I metodi tradizionali risolvono il problema mostrando al computer migliaia di esempi etichettati durante l'addestramento, ma funzionano soltanto per ingredienti già visti.
IngredSAM adotta un approccio diverso: basta fornirgli una singola fotografia pulita dell'ingrediente cercato, e il sistema lo trova ovunque in qualsiasi immagine reale, senza alcun addestramento. Per farlo, chiede a quattro diversi sistemi di visione artificiale di descrivere l'ingrediente contemporaneamente — ognuno specializzato in un aspetto diverso della comprensione visiva — e poi usa la descrizione combinata per cercare nell'immagine target pixel per pixel.
Un passaggio di filtraggio finale rimuove lo sfondo, mantenendo la ricerca concentrata sull'oggetto. Il risultato supera i sistemi supervisionati affermati su entrambi i principali benchmark di ricerca, aprendo la strada a un riconoscimento universale degli ingredienti per app nutrizionali, dispositivi da cucina intelligenti e monitoraggio dietetico personalizzato.
Cosa dice, in breve
- IngredSAM è un framework one-shot senza addestramento che estende il Segment Anything Model (SAM) per la segmentazione semantica open-world degli ingredienti alimentari usando una singola immagine pulita come prompt categoriale.
- L'aggregazione delle feature fonde quattro encoder di visual foundation model — DINOv2 (feature discriminative), MAE (feature dense a grana fine), CLIP (conoscenza semantica ampia) e I-JEPA (ragionamento a livello di scena) — tramite concatenazione lungo la dimensione dei canali.
- Il filtraggio del background con TSDN (metodo non supervisionato basato su distillazione della salienza e allineamento delle texture ai bordi) isola le feature dell'oggetto in primo piano prima del confronto per similarità.
- La generazione dei prompt a punti calcola la similarità coseno pixel per pixel tra il vettore feature del prompt e la mappa spaziale dell'immagine target; la selezione TopK (K=32) seguita da clustering K-means (c=4 centri) produce prompt positivi e negativi passati a SAM.
- Gli studi di ablazione confermano il contributo additivo di tutti e quattro gli encoder: solo DINOv2 raggiunge il 46,31% di mIoU su FoodSeg103; DINOv2+MAE il 47,96%; la combinazione completa il 48,78%.
- Il filtraggio TSDN è dimostrato necessario: senza di esso, i prompt positivi si concentrano erroneamente sui bordi dei contenitori (ad esempio il bordo di una ciotola trasparente nell'esperimento con le carote).
- La robustezza ai prompt è verificata su tre diverse impostazioni di immagine-prompt (103 immagini per impostazione), con variazioni di performance minime.
Provenienza
- Fonte
- IngredSAM: Open-World Food Ingredient Segmentation via a Single Image Prompt— Chen 2024
- Licenza
- CC BY 4.0
- Nel Kosmos
- 2 voci · 75 fatti atomici · tier MAIOR
↯ Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.