Litet testverktyg för att utvärdera AI-modeller och promptar
Simon Willison har publicerat 'smevals', ett minimalistiskt testpaket (eval suite) för att mäta hur väl AI-modeller, promptar och körningsramverk presterar. Tanken är enkel: istället för stora, tunga benchmarks får utvecklare ett lättviktigt verktyg att snabbt testa sina egna uppsättningar. Det är den sortens praktiskt, no-nonsense-verktyg som faktiskt används i vardagen.
Djupdykning
Bakom den oansenliga titeln "smevals" döljer sig något som faktiskt saknas i AI-ekosystemet just nu: ett lättviktigt sätt att testa om din modell, dina promptar och din infrastruktur faktiskt gör vad du tror att de gör. Evals (förkortning för evaluations) är i grunden automatiserade tester för AI-system – ungefär som enhetstester i vanlig mjukvaruutveckling, fast för beteende som är svårare att mäta än "returnerar funktionen rätt värde". Problemet med de stora eval-ramverken som HELM eller MMLU är att de är byggda för att benchmarka modeller mot varandra, inte för att en utvecklare snabbt ska kunna kolla om en prompts-ändring förstörde något i produktionen. Det de flesta missar när de läser om evals är att den verkliga utmaningen inte är att bygga dem – det är att faktiskt köra dem regelbundet, och där har komplexitet alltid vunnit mot disciplin. Ett minimalt eval-verktyg som går att stoppa in i ett CI-flöde utan tre dagars konfiguration kan paradoxalt nog ha större praktisk påverkan än de akademiskt imponerande alternativen.