Juridisk AI klarar inte av ofullständiga frågor – inget av tio testade modeller presterar tillräckligt
arXiv cs.AI
När forskare testade tio stora AI-modeller på juridiska frågor med ofullständig information klarade ingen av dem uppgiften – bästa resultat var F2-poäng på 0,46 (där 1,0 är perfekt) och medianåterkallelsen låg på 0,44. Problemet är att modellerna antingen svarar ändå genom att tysta uppfinna fakta som saknades, eller hedgar (svarar försiktigt och undvikande) på allt utan urskillning. Det är en påminnelse om att AI-juridikverktyg kan ge direkt vilseledande råd just när frågan är otydlig – vilket är precis när en människa som ber om hjälp är som mest sårbar.