Visione del Cibo · La foto in due secondi
FoodLMM (Yin 2024) — Il primo modello multi-modale unificato per l'intelligenza alimentare
Immaginate un assistente AI che guardando la foto del vostro pranzo sappia dirvi al tempo stesso il nome del piatto, elencare ogni ingrediente, stimare calorie e macronutrienti per ciascun componente, generare la ricetta passo per passo e disegnare un contorno preciso attorno a ogni ingrediente che gli indicate — rifiutando educatamente di segmentare ingredienti assenti dall'immagine anziché allucinare una risposta. FoodLMM fa tutto questo con un unico modello, addestrato su milioni di immagini alimentari etichettate e perfezionato attraverso migliaia di conversazioni di esperti generate da GPT-4.
Cosa dice, in breve
- FoodLMM è il primo modello multi-modale unificato (LMM) per il dominio alimentare, capace di svolgere sei compiti — classificazione del cibo, riconoscimento degli ingredienti, generazione di ricette, stima nutrizionale, segmentazione di riferimento e segmentazione per ragionamento — in un unico modello basato sull'architettura LISA (LLaVA + SAM).
- L'architettura introduce dieci token nutrizionali speciali (<mass>, <cal>, <carb>, <fat>, <pro> più le rispettive versioni per il totale del piatto) e token di segmentazione indicizzati (<seg_i>), i cui stati nascosti vengono proiettati tramite MLP verso teste di regressione o verso il decoder SAM.
- La strategia di addestramento è a due stadi: lo Stadio 1 utilizza cinque dataset pubblici per l'apprendimento multi-task; lo Stadio 2 affina il modello su due nuovi dataset generati da GPT-4 — FoodDialogues (~9.500 immagini, ~30k coppie Q&A su nutrizione, dieta, allergie) e FoodReasonSeg (~5.500 immagini, ~19k coppie Q&A con maschere di segmentazione per ragionamento complesso).
- FoodLMM supera lo stato dell'arte su tutti i benchmark: Food-101 93,93% (vs 91,13%), VIREO Food-172 F1 68,97% (vs 65,71%), Recipe1M Rouge-L 36,96% (vs 21,29%), Nutrition5k MAE medio 24,38 (−4,5% vs SOTA), FoodSeg103 cIoU 0,80 (vs 0,65 LISA), FoodReasonSeg gIoU 0,71 (vs 0,19 LISA).
- L'analisi ablazione rivela che l'apprendimento multi-task avvantaggia i compiti di riconoscimento, mentre l'apprendimento mono-task beneficia i compiti generativi complessi (es. generazione di ricette) a causa del conflitto di gradienti — problema aperto.
Provenienza
- Fonte
- FoodLMM: A Versatile Food Assistant using Large Multi-modal Model— Yin 2024
- Licenza
- unknown
- Nel Kosmos
- 10 voci · 314 fatti atomici · tier MAIOR
↯ Questa è una voce vera del nostro Knowledge Graph, ancorata alla sua fonte — non un testo generato da un modello. Il colore riflette il tipo reale di studio, mai gonfiato.