Visione del Cibo · La foto in due secondi
Recupero cross-modale di ricette con Transformer gerarchici e self-supervised learning — Salvador et al. 2021
Immaginate di fotografare un piatto al ristorante e voler trovare la ricetta. Per riuscirci, un computer deve imparare a comprendere sia il mondo visivo delle immagini di cibo sia quello testuale delle ricette di cucina — due linguaggi molto diversi.
Salvador e colleghi di Amazon hanno risolto il problema progettando un modello che legge le ricette come le pensano i cuochi: comprende prima ogni singola riga di ingredienti e ogni passo delle istruzioni, poi li combina in un significato unitario. Hanno anche insegnato al modello che il titolo, la lista degli ingredienti e le istruzioni di qualsiasi ricetta parlano tutte dello stesso piatto — così anche quando riceve una ricetta senza foto, il modello può comunque imparare.
Il risultato: un motore di ricerca in grado di trovare la ricetta giusta da una foto, o la foto giusta da una ricetta, meglio di qualsiasi sistema precedente.
Cosa dice, in breve
- Salvador et al. (2021) propongono un framework end-to-end semplificato per il recupero cross-modale di ricette, sostituendo i precedenti encoder LSTM con encoder basati su Transformer e ottenendo risultati allo stato dell'arte su Recipe1M.
- L'encoder delle ricette phi_rec utilizza tre sotto-encoder specializzati: un Transformer piatto (TR) per il titolo e un Transformer gerarchico a due livelli (HTR) sia per gli ingredienti sia per le istruzioni; gli output vengono concatenati e proiettati in uno spazio condiviso a 1024 dimensioni.
- Una funzione di perdita auto-supervisionata intra-ricetta (Lrec) viene calcolata su tutte e sei le coppie ordinate dei tre embedding di componente, ciascuna collegata tramite una proiezione lineare apprendibile g(.); questo consente di addestrare il modello sui campioni text-only (il 66% di Recipe1M).
- Gli studi di ablazione mostrano che H-Transformer guadagna +4,2 R@1 rispetto a H-LSTM e +4,6 R@1 rispetto a Transformer+media sul validation set di Recipe1M (ranking 10k).
- Con ViT-B/16 come encoder visivo, il modello raggiunge medR 3,0 e R@1 33,5 sul test set (ranking 10k), superando il precedente SOTA (DaC, medR 5,0 / R@1 26,5) rispettivamente di 2,0 e 7,0 punti.
- La funzione Lrec consente anche di allucinare componenti mancanti al momento del test, recuperando le prestazioni in tutti i sei scenari di componente singolo mancante e nei tre scenari di due componenti mancanti.
- Codice e modelli pre-addestrati sono disponibili pubblicamente su GitHub (amzn/image-to-recipe-transformers).
Provenienza
- Fonte
- Revamping Cross-Modal Recipe Retrieval with Hierarchical Transformers and Self-supervised Learning— Salvador 2021
- DOI
- arXiv:2103.13061
- Licenza
- unknown
- Nel Kosmos
- 3 voci · 103 fatti atomici · tier MAIOR
↯ Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.