Nytt testramverk kan minska testning av AI-modeller med upp till 80%
Forskare har utvecklat TestifAI, ett ramverk för att testa hur stabila AI-modeller är när de utsätts för kombinationer av störningar – till exempel suddig bild, hög ljusstyrka och zoom samtidigt. Tricket är att träna en hjälpmodell på tester med färre störningskombinationer och sedan förutsäga hur modellen beter sig vid fler, vilket minskar antalet nödvändiga testkörningar med 60–80% med ett felmarginal under 7%. Det är praktiskt relevant för säkerhetskritiska system som självkörande bilar, där uttömmande testning annars skulle kräva exponentiellt många körningar.
Djupdykning
Att testa AI-modeller för säkerhetskritiska system är ett av de mer underskattade problemen inom modern mjukvaruutveckling – inte för att ingen bryr sig, utan för att skalproblemet är genuint brutalt. Om du har tre störningsfaktorer (suddighetö, ljusstyrka, zoom) med tre svårighetsgrader vardera får du 27 kombinationer, men med fyra faktorer och fler nivåer exploderar antalet exponentiellt, och varje kombination kräver tusentals körningar för att ge statistiskt meningsfulla resultat. TestifAI löser detta med något de kallar "partial model tomography" – ungefär som medicinsk tomografi fast istället för att rekonstruera en kropp från 2D-röntgenbilder rekonstruerar de modellbeteende i ett högdimensionellt störningsrum från lågdimensionella mätningar. Konkret tränar de en hjälpmodell på testresultat från max två samtidiga störningar, och låter den sedan förutsäga vad som händer vid tre eller fyra – med under 7% fel och 60–80% färre körningar. Det de flesta missar när de läser sånt här är att problemet inte primärt handlar om att hitta buggar, utan om att kunna *certifiera* att ett system beter sig acceptabelt under realistiska driftförhållanden, vilket är ett juridiskt och regulatoriskt krav som kommer bli allt tyngre i takt med att EU AI Act slår in på allvar.