Visione del Cibo · La foto in due secondi

Recupero cross-modale di ricette con Transformer gerarchici e self-supervised learning — Salvador et al. 2021

Studio citabile · un singolo studio con fonte verificabile

Immaginate di fotografare un piatto al ristorante e voler trovare la ricetta. Per riuscirci, un computer deve imparare a comprendere sia il mondo visivo delle immagini di cibo sia quello testuale delle ricette di cucina — due linguaggi molto diversi.

Salvador e colleghi di Amazon hanno risolto il problema progettando un modello che legge le ricette come le pensano i cuochi: comprende prima ogni singola riga di ingredienti e ogni passo delle istruzioni, poi li combina in un significato unitario. Hanno anche insegnato al modello che il titolo, la lista degli ingredienti e le istruzioni di qualsiasi ricetta parlano tutte dello stesso piatto — così anche quando riceve una ricetta senza foto, il modello può comunque imparare.

Il risultato: un motore di ricerca in grado di trovare la ricetta giusta da una foto, o la foto giusta da una ricetta, meglio di qualsiasi sistema precedente.

Cosa dice, in breve

  • Salvador et al. (2021) propongono un framework end-to-end semplificato per il recupero cross-modale di ricette, sostituendo i precedenti encoder LSTM con encoder basati su Transformer e ottenendo risultati allo stato dell'arte su Recipe1M.
  • L'encoder delle ricette phi_rec utilizza tre sotto-encoder specializzati: un Transformer piatto (TR) per il titolo e un Transformer gerarchico a due livelli (HTR) sia per gli ingredienti sia per le istruzioni; gli output vengono concatenati e proiettati in uno spazio condiviso a 1024 dimensioni.
  • Una funzione di perdita auto-supervisionata intra-ricetta (Lrec) viene calcolata su tutte e sei le coppie ordinate dei tre embedding di componente, ciascuna collegata tramite una proiezione lineare apprendibile g(.); questo consente di addestrare il modello sui campioni text-only (il 66% di Recipe1M).
  • Gli studi di ablazione mostrano che H-Transformer guadagna +4,2 R@1 rispetto a H-LSTM e +4,6 R@1 rispetto a Transformer+media sul validation set di Recipe1M (ranking 10k).
  • Con ViT-B/16 come encoder visivo, il modello raggiunge medR 3,0 e R@1 33,5 sul test set (ranking 10k), superando il precedente SOTA (DaC, medR 5,0 / R@1 26,5) rispettivamente di 2,0 e 7,0 punti.
  • La funzione Lrec consente anche di allucinare componenti mancanti al momento del test, recuperando le prestazioni in tutti i sei scenari di componente singolo mancante e nei tre scenari di due componenti mancanti.
  • Codice e modelli pre-addestrati sono disponibili pubblicamente su GitHub (amzn/image-to-recipe-transformers).

Provenienza

Fonte
Revamping Cross-Modal Recipe Retrieval with Hierarchical Transformers and Self-supervised Learning— Salvador 2021
Licenza
unknown
Nel Kosmos
3 voci · 103 fatti atomici · tier MAIOR

Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.

Ancora su Visione del Cibo