OpenAI byggde realtidsröst-AI på sex månader
OpenAI har utvecklat GPT-Live, ett system för röstsamtal med AI i realtid, byggt på under ett halvår. Systemet använder en ny typ av talmodell utan fasta turtagningsmönster (dvs. AI:n behöver inte vänta på att du slutat prata innan den svarar) och en arkitektur med mycket låg fördröjning. Resultatet är att samtal med AI ska kännas mer som ett riktigt samtal – vilket är enklare sagt än gjort.
Djupdykning
GPT-Live är Openais satsning på röstbaserad AI som faktiskt känns som ett samtal – inte som att prata med en telefonsvarare från 2003. Kärnan är vad de kallar en "turnless speech model", vilket betyder att systemet inte väntar på att du ska bli klar innan det börjar processa – precis som en människa som lyssnar aktivt istället för att bara sitta och vänta på sin tur. Den låga latensen, alltså fördröjningen från att du pratar till att AI:n svarar, är det tekniska problemet som alla röstassistenter har kämpat med i åratal och som gjort upplevelsen stel och onaturlig. Sex månader är anmärkningsvärt kort tid för den här typen av infrastrukturbygge, vilket antyder att de antingen hade mer färdigt internt än vad som var publikt känt, eller att de verkligen sprang. Det de flesta missar här är att det egentliga genombrottet inte är att AI:n pratar snabbare – det är att konversationsdynamiken förändras fundamentalt. När du tar bort turen som grundläggande enhet för dialog öppnar du upp för interruptions, överlappande tal och de tusen små sociala signalerna som faktiskt gör mänsklig kommunikation meningsfull. Det förflyttar AI-assistenter från "verktyg du frågar saker" till något som är strukturellt mycket närmare en faktisk samtalspartner.