DeepMinds nya AI-modell översätter teckenspråk till text
Google DeepMind lanserar SL2T (sign-language-to-text), en AI-modell som översätter teckenspråk till skriven text i realtid – direkt i användarnas händer via nya funktioner för döva och hörselskadade. Det är ett ovanligt exempel på AI-forskning som riktar sig mot en specifik tillgänglighetsgrupp snarare än den breda massan.
Djupdykning
Googles nya SL2T-modell (sign-language-to-text) gör något som låter enkelt men tekniskt är extremt svårt: att i realtid tolka handrörelser, ansiktsuttryck och kroppsspråk till skriven text. Det knepiga med teckenspråk är att det inte är en direkt översättning av talat språk – grammatiken fungerar helt annorlunda, och modellen måste förstå hela den visuella kontexten, inte bara isolerade handgester. Det som ofta missas i rapporteringen är att teckenspråk inte är universellt: ASL (amerikanskt teckenspråk) och BSL (brittiskt teckenspråk) är till exempel mer olika varandra än engelska och tyska, vilket gör träningsdata till en rejäl huvudvärk. De flesta AI-framsteg för tillgänglighet har historiskt handlat om att omvandla tal till text, vilket redan gynnar hörande användare som råkar ha händerna fulla – döva och hörselskadade har hamnat i väntläget. Att sätta den här tekniken direkt i användarnas händer, bokstavligen via kameran på deras egna enheter, är en annan sak än att bygga en specialanpassad kiosk på ett sjukhus.