NVIDIA och Hugging Face förenklar träning av bild- och videomodeller i stor skala
NVIDIA NeMo Automodel integreras nu med Hugging Face Diffusers, vilket gör det enklare att finjustera (anpassa en färdigtränad AI-modell på ny data) bild- och videomodeller i stor skala. Det intressanta här är att tröskeln sänks rejält – den här typen av träning har tidigare krävt betydande teknisk expertis och egna infrastrukturlösningar.
Djupdykning
NVIDIA och Hugging Face har gått samman för att göra det betydligt enklare att finjustera – alltså anpassa ett redan tränat AI-modell på din egen data – stora bild- och videomodeller. Det handlar om NeMo Automodel, NVIDIAs ramverk för att hantera träning i industriell skala, ihopkopplat med Hugging Face Diffusers, det bibliotek som i praktiken blivit standardverktyget för alla som jobbar med bildgenererande AI. Vad det löser är ett konkret infrastrukturproblem: att träna de här modellerna kräver att man koordinerar tusentals GPU:er utan att allt imploderar, och det är just det NeMo är byggt för att hantera. Det de flesta missar i nyheter som den här är att de egentliga vinnarna inte är de stora techbolagen – de hade redan verktygen. Det är medelstora företag och välfinansierade startups som nu plötsligt kan finjustera videomodeller på sin egna data utan att bygga hela träningsinfrastrukturen från grunden. En modemärke som vill ha en modell som genererar videoannonser i just deras estetik, eller ett spelbolag som vill ha konsistent karaktärsdesign – det är de som faktiskt förändrar sitt arbetsflöde av det här. När finjustering av videomodeller blir lika tillgängligt som att träna en enklare bildklassificerare förändras vad som räknas som en rimlig förväntning på AI-leverantörer.