Visione del Cibo · La foto in due secondi

ChineseFoodNet: il dataset cinese per il riconoscimento visivo dei piatti — Chen 2017

Studio citabile · un singolo studio con fonte verificabile

Immaginate un sistema informatico che deve riconoscere 208 piatti cinesi diversi semplicemente da una fotografia. Chen e colleghi di Midea hanno raccolto oltre 185.000 fotografie di cibo—un mix di scatti da ricettari e foto casalinghe in condizioni di luce variabile—le hanno ripulite automaticamente e le hanno etichettate con un processo che combina algoritmi e revisori umani.

Hanno poi testato nove reti neurali, dalle più snelle alle più profonde, scoprendo che i modelli più grandi e strutturalmente diversi riconoscono il cibo meglio. Il loro metodo migliore, TastyNet, fa votare cinque reti insieme e supera l'81% di accuratezza: una soglia che rende praticabile il conteggio automatico delle calorie e il monitoraggio dietetico su smartphone per la cucina cinese.

Cosa dice, in breve

  • ChineseFoodNet (185.628 immagini, 208 categorie, 19,4 GB) è il più grande dataset pubblicamente disponibile per il riconoscimento visivo della cucina cinese al momento della pubblicazione (ottobre 2017), costruito a partire dalla rete sociale culinaria Douguo e da fotografie raccolte sul campo.
  • Una pipeline di etichettatura semi-supervisionata—filtraggio per entropia, eliminazione dei quasi-duplicati tramite feature AlexNet a 1.024 dimensioni e distanza euclidea, pre-etichettatura con una CNN leggera addestrata su un database separato, validazione manuale—ha ridotto il costo di annotazione su scala industriale.
  • Nove modelli CNN di quattro famiglie architetturali (SqueezeNet v1.1, VGG19-BN, ResNet-18/34/50/152, DenseNet-121/169/201) sono stati messi a confronto con condizioni identiche: il peggiore è SqueezeNet (58,24% top-1 sul test), il migliore come singolo modello è VGG19-BN (79,22%).
  • TastyNet, un ensemble a voto di ResNet152 + DenseNet121/169/201 + VGG19-BN, raggiunge l'81,55% top-1 sul test, superando il miglior singolo modello di 2,33 punti percentuali.
  • La combinazione di famiglie architetturali diverse produce guadagni di ensemble maggiori rispetto alla combinazione di varianti della stessa famiglia, suggerendo che la diversità delle rappresentazioni latenti conta quanto la profondità del singolo modello.
  • Il dataset e i modelli preaddestrati sono stati resi pubblicamente disponibili per la ricerca; il lavoro futuro prevede l'estensione a oltre 500 categorie.

Provenienza

Fonte
ChineseFoodNet: A Large-scale Image Dataset for Chinese Food Recognition— Chen 2017
Licenza
unknown
Nel Kosmos
2 voci · 74 fatti atomici · tier MAIOR

Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.

Ancora su Visione del Cibo