Visione del Cibo · La foto in due secondi

Recipe1M+: Dataset per l'Apprendimento di Embedding Cross-Modali per Ricette e Immagini Alimentari (Marín 2019)

Studio citabile · un singolo studio con fonte verificabile

Immaginate una biblioteca in cui ogni ricetta — dalla pasta al sushi, dal curry al brownie — viene accompagnata da tredici fotografie del piatto finito, con la lista degli ingredienti suddivisa per quantità e unità di misura, le istruzioni passo per passo e, dove possibile, i valori nutrizionali. È questo Recipe1M+: un milione di ricette e tredici milioni di immagini, assemblati rastrellando siti di cucina e poi chiedendo a Google di inviare altre fotografie per ogni titolo di ricetta presente nella raccolta.

I ricercatori hanno poi addestrato una rete neurale a navigare tra i due mondi: mostrategli la foto di un piatto di pasta e recupera la ricetta; dategli la ricetta e trova la foto. Il sistema sa fare qualcosa di quasi magico: togliere la tortilla dal taco, aggiungere lattuga, e ottieni un involucro di lattuga.

Questo suggerisce che il modello ha imparato qualcosa di logica culinaria, non soltanto di pixel.

Cosa dice, in breve

  • Recipe1M+ è un corpus multimodale strutturato di 1.029.720 ricette di cucina e 13.735.679 immagini alimentari — il più grande dataset di ricette pubblicamente disponibile all'epoca della pubblicazione — raccolto da oltre 24 siti di cucina (Fase 1: Recipe1M con 887.706 immagini) e tramite ricerca di immagini su Google (Fase 2: +12,8 milioni di immagini dopo deduplicazione).
  • La pipeline di raccolta include scraping strutturato delle ricette con analisi NLP degli ingredienti in triplette quantità/unità/ingrediente, rimozione di duplicati esatti e quasi-duplicati tramite distanze euclidee di feature ResNet-18, rilevamento e rimozione di volti, e isolamento dei quasi-duplicati tra partizioni.
  • Una pipeline di annotazione nutrizionale abbina 50.637 ricette al database USDA NNDSR Release 27, fornendo energia, proteine, zuccheri, grassi, acidi grassi saturi e sale per ricetta, con etichette semaforo FSA; il corpus copre 2.057 nomi di ingredienti unici provenienti da almeno 16 origini culturali.
  • Il modello di embedding congiunto im2recipe codifica gli ingredienti con una bi-LSTM su word2vec e le istruzioni di cottura con un encoder skip-instructions a due stadi (LSTM), mappa le immagini alimentari con ResNet-50 (senza strato softmax finale), e si addestra con perdita di similarità coseno (margine alpha=0,1) e regolarizzazione semantica (lambda=0,02) su 1.047 categorie alimentari.
  • Sul benchmark Recipe1M a 1K campioni, l'embedding congiunto con regolarizzazione semantica raggiunge MedR 5,2 im2recipe rispetto alle baseline CCA (MedR 15,7–25,2); l'accuratezza del modello (84,8%) supera o pareggia l'accuratezza umana AMT (81,6%).
  • L'addestramento su Recipe1M+ migliora la generalizzazione a Food-101 (MedR im2recipe 10,15 vs. 17,35 con Recipe1M) e produce embedding con proprietà aritmetiche vettoriali semanticamente più ricche.
  • Il dataset è suddiviso 70/15/15 (addestramento/validazione/test); la ricetta media contiene 9 ingredienti e 10 istruzioni; dopo la Fase 2, solo ~2% delle ricette sono prive di immagini associate.

Provenienza

Fonte
Recipe1M+: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images— Marín 2019
Licenza
All rights reserved (IEEE TPAMI)
Nel Kosmos
5 voci · 181 fatti atomici · tier MAIOR

Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.

Ancora su Visione del Cibo