Ny metod hittar inte bara var AI-modeller misslyckas – utan varför Forskare har utvecklat CRAFT, en metod som analyserar varför en språkmodell presterar dåligt – inte bara var – genom att gruppera bedömningskriterier i ett hierarkiskt träd av förmågor och peka ut de svagaste grenarna. I tester på fyra öppna modeller inom finans och juridik presterade CRAFT bättre än befintliga metoder på 13 separata riktmärken, och den data som genererades utifrån diagnosen gav mätbart bättre modeller efter finjustering (fine-tuning). Det intressanta är egentligen enkelt: utvärdering har länge sagt 'modellen är dålig på juridik', men aldrig 'specifikt för att den missar detta kriterium' – CRAFT försöker täppa igen det gapet.
Så lär sig AI-modeller att anpassa hur mycket de tänker Stora språkmodeller (LLMs) kan tränas att växla mellan olika nivåer av tankeansträngning – lite, lagom eller mycket – beroende på hur svår en uppgift är. Det är smart av en enkel anledning: att alltid köra på högvarv är dyrt och långsamt, så en modell som vet när den kan ta det lugnt sparar både tid och resurser. Tekniken handlar om att styra hur länge modellen 'resonerar' innan den svarar, snarare än att alltid maximera beräkningskraften.
ToolVerse tränar AI-agenter på 4 500 verktyg från verkligheten Forskare har byggt ToolVerse, ett träningsramverk där AI-agenter lär sig använda nästan 4 500 verktyg hämtade från 400 riktiga Model Context Protocols – det vill säga standardiserade gränssnitt som låter AI-modeller koppla upp sig mot externa tjänster. Utmaningen de tacklar är att nuvarande språkmodeller presterar bra i avgränsade testmiljöer men tappar greppet när uppgifterna blir långa och komplexa med många steg. Resultaten visar märkbara förbättringar på flera agentbenchmarks, vilket är intressant eftersom det antyder att träningsdatans bredd och variation spelar minst lika stor roll som modellarkitekturen.
Google försenar sin mest avancerade AI-modell med flera månader Google har skjutit upp lanseringen av Gemini 3.5 Pro med flera månader – modellen väntades visas upp redan på utvecklarkonferensen i maj. Förseningen beror på att prestandan, särskilt inom programmering, inte nådde upp till interna förväntningar, och enligt Bloomberg skapar det frustration bland anställda som oroar sig för att Google tappar sitt tekniska försprång. Bolaget uppger att modellen fortfarande testas med partners och att man för dialog med den amerikanska regeringen om säkerhetsstandarder.
Kinesisk AI-modell skrämmer Wall Street igen Fredagens börsoro i AI-aktier väcker minnen från januari när Deepseek fick Nvidia att rasa 17 procent – nu är det kinesiska Moonshots nya språkmodell som oroar marknaden. Förvaltaren Leonid Mironov kallar den 'den bästa kinesiska modellen någonsin', och den uppges kosta hälften så mycket att köra som amerikanska konkurrenter.
OpenAIs finanschef vill mäta AI:ns verkliga värde Sarah Friar, CFO på OpenAI, presenterar ett praktiskt ramverk för hur företag bör mäta avkastning på AI-investeringar – inte med fluffiga mått, utan med konkreta siffror som kostnad per slutförd uppgift, tillförlitlighet och avkastning per beräkningsenhet (det vill säga hur mycket nytta man får ut av datorkraften). Det är ett intressant skifte: i stället för att fråga 'använder vi AI?' frågar man 'vad gör AI:n faktiskt för oss?'
Meta förhandlar om att sälja datorkraft till Anthropic för 100 miljarder kronor Meta är i tidiga förhandlingar med AI-bolaget Anthropic om ett avtal värt 10 miljarder dollar över två år, där Meta skulle leverera datorkapacitet till Anthropics AI-verksamhet. Det intressanta här är att Meta – som bygger egna AI-modeller – alltså samtidigt kan bli infrastrukturleverantör åt en direkt konkurrent.
NVIDIAs nya Vera Rubin-chip siktar på lägre kostnad per AI-token NVIDIA presenterar sin Vera Rubin-arkitektur med fokus på att sänka kostnaden per token – alltså priset för varje textenhet som en AI-modell bearbetar – vilket är centralt när företag bygger agentbaserade AI-system som kör tunga arbetsbelastningar efter träningsfasen. Det intressanta här är skiftet i vad branschen optimerar för: inte längre råprestanda utan hur mycket intelligens man får per spenderad dollar.
NVIDIA och Hugging Face förenklar träning av bild- och videomodeller i stor skala NVIDIA NeMo Automodel integreras nu med Hugging Face Diffusers, vilket gör det enklare att finjustera (anpassa en färdigtränad AI-modell på ny data) bild- och videomodeller i stor skala. Det intressanta här är att tröskeln sänks rejält – den här typen av träning har tidigare krävt betydande teknisk expertis och egna infrastrukturlösningar.
Kinas Moonshot AI lanserar ny Kimi-modell Kinesiska Moonshot AI har släppt en ny version av sin AI-modell Kimi, vilket väckt oro i vissa kretsar om vad som kallas 'full AI-kommunism' – ett begrepp som cirkulerar bland kritiker som ifrågasätter kinesiska AI-modellers koppling till staten. Det är värt att notera att retoriken kring hotet verkar vara minst lika stor nyhet som modellen själv.
Ideell organisation vill bygga ett öppet AI-internet för alla kulturer Current AI, en ideell organisation, arbetar för att skapa ett öppet AI-ekosystem – tänk ett slags World Wide Web för AI – som ska vara tillgängligt för alla oavsett kulturell bakgrund. De uppger att de gjort framsteg inom allt från AI-chat till stöd för olika enheter. Intressant här är ambitionen att motverka den kulturella snedvridning som ofta präglar stora AI-modeller byggda i Silicon Valley.
Kinesiska AI-tjänster hotar app-systemet Kinesiska mobiltillverkare lanserar nya modeller med inbyggda AI-tjänster som kan ersätta traditionella appar – en utveckling som beskrivs som 'allas dröm' inom branschen. Tanken är att AI-assistenter tar över det appar gör idag, vilket skulle rubba hela ekosystemet kring app-butiker som Google Play och App Store.
Netflix: 300 titlar har använt generativ AI Netflix avslöjar i sin kvartalsrapport att omkring 300 titlar har använt generativ AI, främst i efterproduktionen för att skapa folkmassor, historiska strider och miljöer. Bland produktionerna finns Glory och Brasil 70, och tekniken motiveras med snabbare leverans till lägre kostnad. Netflix har också köpt Ben Afflecks AI-startup och använder en AI-genererad version av Gene Wilders röst – satsningarna eskalerar alltså snabbt.
Moonshot siktar på Hongkongbörs inom sex månader Det kinesiska AI-bolaget Moonshot, känt för sin uppmärksammade AI-modell, planerar en börsnotering i Hongkong inom ett halvår. Bolaget vill kapitalisera på det momentum som den senaste modellen skapat i branschen.
AI-hypen underminerar globalt beslutsfattande Simon Willison lyfter en oro som förtjänar mer uppmärksamhet: att AI-manin börjar skada kvaliteten på beslut som fattas globalt, när organisationer och ledare låter teknikentusiasm styra snarare än kritiskt tänkande. Det intressanta här är att kritiken kommer från en välkänd AI-förespråkare – det är inte bakåtsträvare som varnar, utan någon som följer fältet noga.
Verktyg markerar uttjatade fraser i AI-genererad text Simon Willison har byggt ett litet verktyg som markerar de vanligaste klichéerna som LLM:er (stora språkmodeller) tenderar att upprepa – sådana fraser som 'det är värt att notera' eller 'i en värld där'. Det är ett enkelt men träffsäkert sätt att se hur igenkännbar AI-text faktiskt är.
Patreon blockerar AI-botar som skrapar kreatörers innehåll Patreon har gått från att politely be AI-botar att hålla sig borta – via robots.txt-filen som botarna ändå ofta ignorerar – till att aktivt blockera dem via Cloudflares infrastruktur. Det handlar om att stoppa botar som hämtar kreatörers innehåll för att träna AI-modeller utan tillstånd. Intressant nog är det här ett tecken på att hela branschen börjar inse att robots.txt-hederssystemet inte fungerar i praktiken.
Roblox öppnar AI-verktyg för alla användare Roblox rullar nu ut sin AI-verktygslåda brett så att vanliga användare kan bygga spel med hjälp av AI – inte bara erfarna utvecklare. Det är ett intressant skifte: plattformen som redan lever på användargenererat innehåll satsar nu på att AI ska sänka tröskeln ytterligare för vem som kan skapa.