AI-agenter testar hårdvarudesign – med blandade resultat
arXiv cs.AI
Forskare har byggt ett testramverk för att se om lokalt körda AI-agenter kan automatisera hårdvarudesign-arbetsflöden – ett område där molntjänster ofta är uteslutna av sekretessskäl. Sju öppna modeller utvärderades och de starkaste klarade nästan alla uppgifter, men tillförlitligheten varierade kraftigt beroende på hur agenten var konfigurerad. Särskilt intressant: detaljrika verktygsbeskrivningar hjälpte konsekvent, medan så kallad few-shot-prompting (att ge modellen exempel att följa) faktiskt försämrade prestandan för vissa modeller.