Visione del Cibo · La foto in due secondi

Min 2021 — Food2K: il più grande dataset di riconoscimento alimentare visivo (2.000 categorie, 1M+ immagini) e PRENet

Senza link diretto · studio reale, ma senza DOI verificato da collegare

Immaginate di chiedere a un computer di guardare la foto di un piatto e nominar lo. Per la pizza o gli spaghetti è un problema già risolto.

Ma il cibo è una delle produzioni più diverse dell'umanità: in Cina si mangiano quotidianamente oltre duemila piatti distinti, ciascuno variabile per regione, cuoco e stagione. Fino al 2021, il più grande archivio fotografico alimentare pubblicamente disponibile conteneva solo cinquecento categorie.

Questo lavoro ha introdotto Food2K — un milione di fotografie in duemila categorie — costruito dalla stessa piattaforma che consegna i pasti a milioni di città cinesi. Ha inoltre introdotto un nuovo tipo di rete neurale addestrata a guardare progressivamente più da vicino le diverse parti di un piatto, dagli ingredienti principali ai dettagli più fini, imparando a distinguere piatti quasi identici che differiscono per componenti sottili.

Il risultato: i computer possono ora riconoscere il cibo con la stessa affidabilità con cui riconoscono gli oggetti nelle fotografie generiche.

Cosa dice, in breve

  • Food2K è il più grande dataset di riconoscimento alimentare al momento della pubblicazione: 2.000 categorie e 1.036.564 immagini ottenute dalla piattaforma cinese di catering Meituan, superando i predecessori (es. ETH Food-101 con 101/101K) di circa un ordine di grandezza in entrambe le dimensioni.
  • Il dataset è costruito con un pipeline in tre fasi: (1) costruzione bottom-up del vocabolario da ~70 milioni di immagini Meituan tramite insiemi di sinonimi; (2) raccolta immagini con recupero visivo basato su Inception-ResNet-V2 e campionamento a soglia adattiva per la diversità; (3) annotazione professionale iterativa a doppio gruppo con tasso di qualificazione target del 99%.
  • La Progressive Region Enhancement Network (PRENet) combina un ramo globale (GAP sull'output del backbone), un ramo locale progressivo (GMP sugli ultimi U=3 layer con perdita di divergenza KL per la diversità) e un modulo di miglioramento basato su self-attention; all'inferenza somma i punteggi di tutti gli stadi con pesi uguali.
  • Su Food2K, PRENet (ResNet101) raggiunge Top-1=83,75% / Top-5=97,33%, superando tutti i 20+ baseline; su ETH Food-101, PRENet (SENet154 + pre-addestramento Food2K) raggiunge Top-1=91,13%, il risultato più alto riportato nel lavoro.
  • Il pre-addestramento su Food2K supera costantemente quello su ETH Food-101 in cinque famiglie di task: riconoscimento alimentare (guadagno medio Top-1 +1,68% / +3,51% / +3,41% su Food-101, Vireo-172, ISIA-500), recupero immagini, recupero ricette cross-modale su Recipe1M, rilevamento su UNIMIB2016/Oktoberfest e segmentazione su UEC-FoodPix Complete.

Provenienza

Fonte
Large Scale Visual Food Recognition (Food2K)— Min 2021
Licenza
unknown
Nel Kosmos
5 voci · 162 fatti atomici · tier MAIOR

Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.

Ancora su Visione del Cibo