Visione del Cibo · La foto in due secondi

IngredSAM: Segmentazione Open-World degli Ingredienti Alimentari tramite Prompt a Singola Immagine (Chen 2024)

Studio citabile · un singolo studio con fonte verificabile

Insegnare a un computer a riconoscere il parmigiano, gli spinaci e i pinoli in una fotografia di un piatto di pasta è sorprendentemente difficile: lo stesso ingrediente può sembrare completamente diverso a seconda di come è cucinato, della luce o di come è disposto nel piatto. I metodi tradizionali risolvono il problema mostrando al computer migliaia di esempi etichettati durante l'addestramento, ma funzionano soltanto per ingredienti già visti.

IngredSAM adotta un approccio diverso: basta fornirgli una singola fotografia pulita dell'ingrediente cercato, e il sistema lo trova ovunque in qualsiasi immagine reale, senza alcun addestramento. Per farlo, chiede a quattro diversi sistemi di visione artificiale di descrivere l'ingrediente contemporaneamente — ognuno specializzato in un aspetto diverso della comprensione visiva — e poi usa la descrizione combinata per cercare nell'immagine target pixel per pixel.

Un passaggio di filtraggio finale rimuove lo sfondo, mantenendo la ricerca concentrata sull'oggetto. Il risultato supera i sistemi supervisionati affermati su entrambi i principali benchmark di ricerca, aprendo la strada a un riconoscimento universale degli ingredienti per app nutrizionali, dispositivi da cucina intelligenti e monitoraggio dietetico personalizzato.

Cosa dice, in breve

  • IngredSAM è un framework one-shot senza addestramento che estende il Segment Anything Model (SAM) per la segmentazione semantica open-world degli ingredienti alimentari usando una singola immagine pulita come prompt categoriale.
  • L'aggregazione delle feature fonde quattro encoder di visual foundation model — DINOv2 (feature discriminative), MAE (feature dense a grana fine), CLIP (conoscenza semantica ampia) e I-JEPA (ragionamento a livello di scena) — tramite concatenazione lungo la dimensione dei canali.
  • Il filtraggio del background con TSDN (metodo non supervisionato basato su distillazione della salienza e allineamento delle texture ai bordi) isola le feature dell'oggetto in primo piano prima del confronto per similarità.
  • La generazione dei prompt a punti calcola la similarità coseno pixel per pixel tra il vettore feature del prompt e la mappa spaziale dell'immagine target; la selezione TopK (K=32) seguita da clustering K-means (c=4 centri) produce prompt positivi e negativi passati a SAM.
  • Gli studi di ablazione confermano il contributo additivo di tutti e quattro gli encoder: solo DINOv2 raggiunge il 46,31% di mIoU su FoodSeg103; DINOv2+MAE il 47,96%; la combinazione completa il 48,78%.
  • Il filtraggio TSDN è dimostrato necessario: senza di esso, i prompt positivi si concentrano erroneamente sui bordi dei contenitori (ad esempio il bordo di una ciotola trasparente nell'esperimento con le carote).
  • La robustezza ai prompt è verificata su tre diverse impostazioni di immagine-prompt (103 immagini per impostazione), con variazioni di performance minime.

Provenienza

Fonte
IngredSAM: Open-World Food Ingredient Segmentation via a Single Image Prompt— Chen 2024
Licenza
CC BY 4.0
Nel Kosmos
2 voci · 75 fatti atomici · tier MAIOR

Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.

Ancora su Visione del Cibo