Claude får röst och hjärna på samma gång

Röstlägen i AI-produkter har hittills haft ett gemensamt problem: de är snabba men dumma. Anthropic byggde Claudes röstläge på Haiku, sin lättaste modell, med motivet att låg latens är viktigare än djup analys när folk pratar. Det antagandet visade sig fel.
Användarna använde röstläget för att faktiskt tänka igenom affärsproblem, inte för att kolla öppettider. Anthropic har nu dragit slutsatsen och öppnat upp för Opus och Sonnet i röstläge, alltså de modeller som faktiskt kan resonera. Röstläget expanderar också till tredjepartsappar: Gmail, Slack och Canva är de första ut.
Det intressanta är inte att det blev bättre, utan varför det tog tid. Röst och tunga modeller är en dyr kombination, både latens- och kostnadsmässigt. Haiku är billig att köra i realtid. Opus är inte det. Att Anthropic ändå gör bytet signalerar att de sett tillräckligt med engagemang för komplexa användningsfall för att motivera marginalkostnaden.
Integrationen i produktivitetsappar är den mer strategiskt intressanta biten. Att köra Claude via röst direkt i Slack eller Gmail är ett annat värdeförslag än att öppna en separat chattapp. Det är skillnaden mellan ett verktyg du väljer och ett verktyg som är där du redan jobbar.
För den som bygger röstgränssnitt ovanpå AI-APIer är lektionen tydlig: optimera inte för latens på bekostnad av kapabilitet om dina användare faktiskt vill lösa problem. De gör det.


