Visione del Cibo · La foto in due secondi
Salvador 2017 — im2recipe: embedding cross-modali per ricette e immagini di cibo (CVPR 2017)
Immaginate di mostrare a una macchina la fotografia di un piatto e chiederle non solo il nome del piatto, ma la lista degli ingredienti e i passi per prepararlo. È esattamente il problema che Salvador e colleghi hanno affrontato nel 2017.
Hanno raccolto un milione di ricette da decine di siti di cucina, le hanno abbinate alle fotografie del piatto finito e hanno addestrato una rete neurale ad associare i pixel di un'immagine alle parole di una ricetta. Il trucco sta nel far condividere alla rete, sia per le immagini sia per i testi, le stesse 1.047 categorie alimentari — in modo che 'torta al cioccolato' significhi la stessa cosa sia guardando una foto sia leggendo una ricetta.
Il risultato supera la performance media degli annotatori umani in un compito di abbinamento standardizzato.
Cosa dice, in breve
- Recipe1M è un corpus strutturato di 1.029.720 ricette e 887.706 immagini estratte da oltre due dozzine di siti di cucina, suddiviso in training (70%), validazione e test; è il più grande dataset multi-modale per ricette disponibile al momento della pubblicazione, con il doppio delle ricette e otto volte le immagini rispetto al predecessore più grande.
- im2recipe è un modello di embedding neurale congiunto che apprende uno spazio semantico condiviso per immagini di cibo e ricette, abilitando il recupero bidirezionale (immagine-a-ricetta e ricetta-a-immagine) tramite similarità coseno.
- Il codificatore di ricette combina due rami: (i) LSTM bidirezionale su embedding word2vec degli ingredienti estratti con accuratezza del 99,5%; (ii) LSTM a due stadi su vettori skip-instructions (un adattamento dominio-specifico di skip-thoughts addestrato sul testo di ricette).
- La regolarizzazione semantica tramite 1.047 pesi di classificazione condivisi tra i due modelli riduce il rango mediano da 7,2 a 5,2 su un pool di test da 1K per il task immagine-a-ricetta.
- Su un benchmark umano Amazon Mechanical Turk (scelta multipla tra 10 ricette), il modello migliore supera le prestazioni medie degli annotatori umani di 3,2 punti percentuali (84,8% vs 81,6%).
- Lo spazio di embedding apprende proprietà aritmetiche semantiche, supportando operazioni come: v('pizza di pollo') − v('pizza') + v('insalata') = v('insalata di pollo') sia in modalità unimodale che cross-modale.
Provenienza
- Fonte
- Learning Cross-modal Embeddings for Cooking Recipes and Food Images— Salvador 2017
- Licenza
- IEEE copyright (All rights reserved)
- Nel Kosmos
- 3 voci · 113 fatti atomici · tier MAIOR
↯ Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.