Visione del Cibo · La foto in due secondi

FoodLMM (Yin 2024) — Il primo modello multi-modale unificato per l'intelligenza alimentare

Senza link diretto · studio reale, ma senza DOI verificato da collegare

Immaginate un assistente AI che guardando la foto del vostro pranzo sappia dirvi al tempo stesso il nome del piatto, elencare ogni ingrediente, stimare calorie e macronutrienti per ciascun componente, generare la ricetta passo per passo e disegnare un contorno preciso attorno a ogni ingrediente che gli indicate — rifiutando educatamente di segmentare ingredienti assenti dall'immagine anziché allucinare una risposta. FoodLMM fa tutto questo con un unico modello, addestrato su milioni di immagini alimentari etichettate e perfezionato attraverso migliaia di conversazioni di esperti generate da GPT-4.

Cosa dice, in breve

  • FoodLMM è il primo modello multi-modale unificato (LMM) per il dominio alimentare, capace di svolgere sei compiti — classificazione del cibo, riconoscimento degli ingredienti, generazione di ricette, stima nutrizionale, segmentazione di riferimento e segmentazione per ragionamento — in un unico modello basato sull'architettura LISA (LLaVA + SAM).
  • L'architettura introduce dieci token nutrizionali speciali (<mass>, <cal>, <carb>, <fat>, <pro> più le rispettive versioni per il totale del piatto) e token di segmentazione indicizzati (<seg_i>), i cui stati nascosti vengono proiettati tramite MLP verso teste di regressione o verso il decoder SAM.
  • La strategia di addestramento è a due stadi: lo Stadio 1 utilizza cinque dataset pubblici per l'apprendimento multi-task; lo Stadio 2 affina il modello su due nuovi dataset generati da GPT-4 — FoodDialogues (~9.500 immagini, ~30k coppie Q&A su nutrizione, dieta, allergie) e FoodReasonSeg (~5.500 immagini, ~19k coppie Q&A con maschere di segmentazione per ragionamento complesso).
  • FoodLMM supera lo stato dell'arte su tutti i benchmark: Food-101 93,93% (vs 91,13%), VIREO Food-172 F1 68,97% (vs 65,71%), Recipe1M Rouge-L 36,96% (vs 21,29%), Nutrition5k MAE medio 24,38 (−4,5% vs SOTA), FoodSeg103 cIoU 0,80 (vs 0,65 LISA), FoodReasonSeg gIoU 0,71 (vs 0,19 LISA).
  • L'analisi ablazione rivela che l'apprendimento multi-task avvantaggia i compiti di riconoscimento, mentre l'apprendimento mono-task beneficia i compiti generativi complessi (es. generazione di ricette) a causa del conflitto di gradienti — problema aperto.

Provenienza

Fonte
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model— Yin 2024
Licenza
unknown
Nel Kosmos
10 voci · 314 fatti atomici · tier MAIOR

Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.

Ancora su Visione del Cibo