20 juli 2026

Stämningar, gigantiska modeller och osäkra agenter

Kina har precis lanserat en AI-modell med 2,8 biljoner parametrar – ett antal så stort att det nästan slutar betyda något. Men storleken är inte det intressanta; det intressanta är vad som händer när man faktiskt försöker använda dessa system i verkligheten, där verktygen förändras och modellerna börjar famla i blindo. Idag handlar det om klyftan mellan imponerande benchmarks och vad AI faktiskt klarar av när världen inte uppför sig som förväntat.

Kinas öppna AI-jätte: 2,8 biljoner parametrar och ingen NDA

Det kinesiska AI-bolaget Moonshot har gjort något som varken OpenAI eller Anthropic har gjort: släppt en modell i Claude- och GPT-5-klass med helt öppna vikter. Kimi K3 har 2,8 biljoner parametrar, ett kontextfönster på upp till en miljon tokens, och är byggd för resonemang, kodning och kunskapsintensivt arbete.

Benchmarks är alltid selektiva, och Moonshot väljer förstås sina bästa siffror. Men riktningen är tydlig: de hävdar prestanda i nivå med Claude och bättre än GPT-4.5 på flera tester. Oavsett exakt rankning är storleksklassen ovanlig för en öppen modell.

Det intressanta är inte nödvändigtvis parametersiffran i sig, utan vad det innebär att modellen är öppen. Du kan finjustera den på din egen data, köra den på din egna infrastruktur och slippa skicka känsliga promptar till en tredjepartsAPI. För builders som bygger produkt på LLM-grund är det skillnaden mellan att hyra och att äga.

Det kinesiska AI-racet har länge levererats med öppna modeller, DeepSeek är det tydligaste exemplet, och Kimi K3 fortsätter det mönstret. Medan de amerikanska jättarna håller sina starkaste modeller bakom API-gränser och enterprise-avtal väljer de kinesiska bolagen en annan distributionsstrategi. Skälen till det är sannolikt fler än filantropin, men resultatet för ekosystemet är detsamma: fler riktigt kapabla modeller att bygga med.

En brasklapp: att ladda ner en 2,8-biljonersmodell och köra den i produktion är inte precis ett helgprojekt. Infrastrukturkostnaden är reell. Men för team med rätt hårdvara eller molnbudget är det nu ett faktiskt alternativ.

Parallellt, och lite dåligt tajmat för AI-agent-optimister, visar ny forskning att agenter bygger på bräckligare grund än det ser ut. Studien MCPEvol-Bench testade tolv ledande modeller, inklusive GPT-4.5 och Claude Sonnet 4, på hur de hanterar förändringar i MCP-servrar, den infrastruktur som kopplar ihop modeller med externa verktyg. Resultatet: 13-14 procents prestandatapp när verktygets gränssnitt uppdaterades, med fler fel i just planering och resonemang. Agenter är i grunden tränade på stabila miljöer. Uppdaterar du ett API:s beteende kan du förstöra en hel workflow utan att modellen ger dig en varning.

Apple stämmer OpenAI – och tajmingen är inte en slump

"Över 400 tidigare Apple-anställda jobbar nu på OpenAI, inklusive bolagets chefsansvarige för hårdvara."

Över 400 tidigare Apple-anställda jobbar nu på OpenAI, inklusive bolagets chefsansvarige för hårdvara. Det är ett faktum som Apple uppenbarligen har katalogiserat noga, och förra fredagen förvandlade man den listan till en stämningsansökan.

Ytan är en tvist om företagshemligheter. Men tajmingen är för besvärlig för att vara en slump. OpenAI förbereder en börsnotering, försöker ta sig in i hårdvarumarknaden och är mitt i en identitetskris om vad bolaget egentligen är: välgörenhetsorganisation, startup eller publikt techbolag. En utdragen rättsprocess med Apple som motpart ger potentiella IPO-investerare ännu en rad att stressa på i riskkolumnen.

Juridiska experter verkar skeptiska till om anklagelserna faktiskt håller. Anställda byter jobb. De tar med sig kunskap i huvudet. Det är, som en analytiker uttrycker det, ungefär så här saker fungerar. Frågan är inte om Apple vinner, utan vad de faktiskt är ute efter.

Ett scenario: Apple är genuint oroade. OpenAI har rekryterat hårdvarufolk i en takt som antyder att de menar allvar med att bygga egna devices, och det är Apples kärnterritorium. Stämningen som förhandstaktik.

Ett annat scenario: Apple ser en fiende i ett svagt läge och sparkar. OpenAI har ett turbulent halvår bakom sig, ett osäkert bolagsstruktursskifte framför sig och behöver verkligen inte juridisk exponering just nu. Och medan allt detta händer lanserar Apple offentliga betor av sin nya Siri-AI, kanske med ett intresse av att hålla OpenAI-narrativet i defensivt läge.

Båda scenarierna är troliga. De utesluter inte varandra.

För OpenAI är problemet inte nödvändigtvis att de förlorar målet. Det är att varje deposition, varje intern e-post som potentiellt dyker upp i discovery, och varje rubrik om stulna hemligheter gör IPO-processen mer komplicerad. Investerare gillar inte juridisk osäkerhet i S-1-fasen. Det vet Apple.

Jensen Huang lämnar Tokyo med avtal – och 9,3 miljoner för en jacka

Jensen Huang hade en produktiv vecka. I Tokyo signerade han avtal med aktörer som spänner över hela det japanska tekniklandskapet, detaljer fortfarande vagt formulerade men riktningen tydlig: Nvidia fortsätter att positionera sig som ryggraden i varje lands AI-ambitioner, och Japan är ett av de få ställen som faktiskt försöker bygga inhemsk kapacitet snarare än att bara köpa in molntjänster.

Japan är ett intressant fall. Landet har aktivt drivit på för inhemsk AI-infrastruktur, med statliga pengar och industriella partnerskap, och Nvidia har identifierat det som en nyckelmarknad. Avtal med japanska aktörer handlar inte bara om att sälja GPU:er, det handlar om att bli en del av den nationella teknikstrategin. Det är en annan typ av relation än att sälja till ett startup.

Men den verkliga nyheten från veckan är vad som hände med en av hans skinnjackor.

En svart läderjacka, buret av Huang, såldes på auktion i New York för 960 000 dollar. Det är ungefär 9,3 miljoner kronor, och det är väsentligt mer än vad auktionshuset förväntat sig. För att sätta det i perspektiv: en genomsnittlig Nvidia H100 kostar runt 30 000 dollar. Jackan hade alltså köpt 32 stycken.

Det finns en seriös poäng gömd i det absurda: Jensen Huang är en av de få tech-vd:ar som uppnått en typ av kultstatus som går bortom produkterna. Steve Jobs hade det. Elon Musk har en version av det, fast med annat förtecken. Huang är en mer ovanlig variant, en ingenjör med genuint tekniskt djup som också blivit ett kulturellt fenomen.

Kultstatus är inte oviktigt i affärssammanhang. Det påverkar rekrytering, partnerskap och hur motparter sitter vid förhandlingsbordet. Om Japan vill ha en bilateral relation med Nvidia snarare än att bara beställa hårdvara, är en del av det Huang personligen.

Jackan är ett extremt datapunkt. Men den mäter någonting verkligt.

SpaceX vill sälja datacenterkapacitet till Pentagon

SpaceX diskuterar att sälja datacenterkapacitet till Pentagon, enligt källor till Wall Street Journal. Det är inte ett AI-genombrott eller en raketnyhet, men det är ett tydligt steg i en pågående rörelse: bolag med nära band till den nuvarande Washington-administrationen expanderar sina försvarskontrakt i snabb takt.

SpaceX har redan Starlink-avtal med militären och en lång historia av samarbeten kring satellitbaserad kommunikation. Datacenter är nästa lager. Logiken är enkel, Pentagon behöver kapacitet, SpaceX har det, och ingen i administrationen verkar se intressekonflikter som ett bekymmer just nu.

Det intressanta är inte att det händer, utan att marknaden reagerar dubbelt. Parallellt med försvarssamtalen ökar blankarnas positioner i SpaceX kraftigt. Det signalerar att en del av investerarkollektivet tror att bolaget är övervärderat, trots att det knappast saknar affärer. Värderingen på ett privatbolag är alltid svår att nagla fast, och SpaceX handlas inte publikt, men det finns uppenbarligen investerare som är villiga att ta position mot narrativet.

Det är en ovanlig kombination: ett bolag som simultaneously förhandlar nya statliga kontrakt och ser ökande skepsis från de som tror att priset redan sprungit iväg. Båda kan ha rätt. Kontrakten kan vara verkliga och ändå inte motivera en värdering byggd på optimistiska antaganden om Starship, Mars och allt däremellan.

För den som bygger infrastruktur och funderar på molnleverantörer är det värt att notera att statliga kontrakt ger SpaceX en stabilare intäktsbas och potentiellt bättre prissättning på sikt. Om Pentagon-samarbetet leder till en bredare kommersiell datacentersatsning, finns det en ny aktör att hålla ögonen på i ett segment som länge dominerats av AWS, Azure och Google Cloud.

Dagens siffra

2,8 biljoner

Antalet parametrar i Kimi K3 – världens största öppna AI-modell, lanserad av kinesiska Moonshot. Det är en storleksklass som de amerikanska jättarna ännu inte matchat publikt.

Snabbkollen

Ny metod hittar inte bara var AI-modeller misslyckas – utan varför

Forskare har utvecklat CRAFT, en metod som analyserar varför en språkmodell presterar dåligt – inte bara var – genom att gruppera bedömningskriterier i ett hierarkiskt träd av förmågor och peka ut de svagaste grenarna. I tester på fyra öppna modeller inom finans och juridik presterade CRAFT bättre än befintliga metoder på 13 separata riktmärken, och den data som genererades utifrån diagnosen gav mätbart bättre modeller efter finjustering (fine-tuning). Det intressanta är egentligen enkelt: utvärdering har länge sagt 'modellen är dålig på juridik', men aldrig 'specifikt för att den missar detta kriterium' – CRAFT försöker täppa igen det gapet.

Källor: arXiv cs.AI
Så lär sig AI-modeller att anpassa hur mycket de tänker

Stora språkmodeller (LLMs) kan tränas att växla mellan olika nivåer av tankeansträngning – lite, lagom eller mycket – beroende på hur svår en uppgift är. Det är smart av en enkel anledning: att alltid köra på högvarv är dyrt och långsamt, så en modell som vet när den kan ta det lugnt sparar både tid och resurser. Tekniken handlar om att styra hur länge modellen 'resonerar' innan den svarar, snarare än att alltid maximera beräkningskraften.

Källor: Ahead of AI
ToolVerse tränar AI-agenter på 4 500 verktyg från verkligheten

Forskare har byggt ToolVerse, ett träningsramverk där AI-agenter lär sig använda nästan 4 500 verktyg hämtade från 400 riktiga Model Context Protocols – det vill säga standardiserade gränssnitt som låter AI-modeller koppla upp sig mot externa tjänster. Utmaningen de tacklar är att nuvarande språkmodeller presterar bra i avgränsade testmiljöer men tappar greppet när uppgifterna blir långa och komplexa med många steg. Resultaten visar märkbara förbättringar på flera agentbenchmarks, vilket är intressant eftersom det antyder att träningsdatans bredd och variation spelar minst lika stor roll som modellarkitekturen.

Källor: arXiv cs.AI
Google försenar sin mest avancerade AI-modell med flera månader

Google har skjutit upp lanseringen av Gemini 3.5 Pro med flera månader – modellen väntades visas upp redan på utvecklarkonferensen i maj. Förseningen beror på att prestandan, särskilt inom programmering, inte nådde upp till interna förväntningar, och enligt Bloomberg skapar det frustration bland anställda som oroar sig för att Google tappar sitt tekniska försprång. Bolaget uppger att modellen fortfarande testas med partners och att man för dialog med den amerikanska regeringen om säkerhetsstandarder.

Kinesisk AI-modell skrämmer Wall Street igen

Fredagens börsoro i AI-aktier väcker minnen från januari när Deepseek fick Nvidia att rasa 17 procent – nu är det kinesiska Moonshots nya språkmodell som oroar marknaden. Förvaltaren Leonid Mironov kallar den 'den bästa kinesiska modellen någonsin', och den uppges kosta hälften så mycket att köra som amerikanska konkurrenter.

OpenAIs finanschef vill mäta AI:ns verkliga värde

Sarah Friar, CFO på OpenAI, presenterar ett praktiskt ramverk för hur företag bör mäta avkastning på AI-investeringar – inte med fluffiga mått, utan med konkreta siffror som kostnad per slutförd uppgift, tillförlitlighet och avkastning per beräkningsenhet (det vill säga hur mycket nytta man får ut av datorkraften). Det är ett intressant skifte: i stället för att fråga 'använder vi AI?' frågar man 'vad gör AI:n faktiskt för oss?'

Källor: OpenAI Blog
Meta förhandlar om att sälja datorkraft till Anthropic för 100 miljarder kronor

Meta är i tidiga förhandlingar med AI-bolaget Anthropic om ett avtal värt 10 miljarder dollar över två år, där Meta skulle leverera datorkapacitet till Anthropics AI-verksamhet. Det intressanta här är att Meta – som bygger egna AI-modeller – alltså samtidigt kan bli infrastrukturleverantör åt en direkt konkurrent.

NVIDIAs nya Vera Rubin-chip siktar på lägre kostnad per AI-token

NVIDIA presenterar sin Vera Rubin-arkitektur med fokus på att sänka kostnaden per token – alltså priset för varje textenhet som en AI-modell bearbetar – vilket är centralt när företag bygger agentbaserade AI-system som kör tunga arbetsbelastningar efter träningsfasen. Det intressanta här är skiftet i vad branschen optimerar för: inte längre råprestanda utan hur mycket intelligens man får per spenderad dollar.

NVIDIA och Hugging Face förenklar träning av bild- och videomodeller i stor skala

NVIDIA NeMo Automodel integreras nu med Hugging Face Diffusers, vilket gör det enklare att finjustera (anpassa en färdigtränad AI-modell på ny data) bild- och videomodeller i stor skala. Det intressanta här är att tröskeln sänks rejält – den här typen av träning har tidigare krävt betydande teknisk expertis och egna infrastrukturlösningar.

Kinas Moonshot AI lanserar ny Kimi-modell

Kinesiska Moonshot AI har släppt en ny version av sin AI-modell Kimi, vilket väckt oro i vissa kretsar om vad som kallas 'full AI-kommunism' – ett begrepp som cirkulerar bland kritiker som ifrågasätter kinesiska AI-modellers koppling till staten. Det är värt att notera att retoriken kring hotet verkar vara minst lika stor nyhet som modellen själv.

Ideell organisation vill bygga ett öppet AI-internet för alla kulturer

Current AI, en ideell organisation, arbetar för att skapa ett öppet AI-ekosystem – tänk ett slags World Wide Web för AI – som ska vara tillgängligt för alla oavsett kulturell bakgrund. De uppger att de gjort framsteg inom allt från AI-chat till stöd för olika enheter. Intressant här är ambitionen att motverka den kulturella snedvridning som ofta präglar stora AI-modeller byggda i Silicon Valley.

Kinesiska AI-tjänster hotar app-systemet

Kinesiska mobiltillverkare lanserar nya modeller med inbyggda AI-tjänster som kan ersätta traditionella appar – en utveckling som beskrivs som 'allas dröm' inom branschen. Tanken är att AI-assistenter tar över det appar gör idag, vilket skulle rubba hela ekosystemet kring app-butiker som Google Play och App Store.

Källor: Di Digital
Netflix: 300 titlar har använt generativ AI

Netflix avslöjar i sin kvartalsrapport att omkring 300 titlar har använt generativ AI, främst i efterproduktionen för att skapa folkmassor, historiska strider och miljöer. Bland produktionerna finns Glory och Brasil 70, och tekniken motiveras med snabbare leverans till lägre kostnad. Netflix har också köpt Ben Afflecks AI-startup och använder en AI-genererad version av Gene Wilders röst – satsningarna eskalerar alltså snabbt.

Moonshot siktar på Hongkongbörs inom sex månader

Det kinesiska AI-bolaget Moonshot, känt för sin uppmärksammade AI-modell, planerar en börsnotering i Hongkong inom ett halvår. Bolaget vill kapitalisera på det momentum som den senaste modellen skapat i branschen.

Källor: Di Digital
AI-hypen underminerar globalt beslutsfattande

Simon Willison lyfter en oro som förtjänar mer uppmärksamhet: att AI-manin börjar skada kvaliteten på beslut som fattas globalt, när organisationer och ledare låter teknikentusiasm styra snarare än kritiskt tänkande. Det intressanta här är att kritiken kommer från en välkänd AI-förespråkare – det är inte bakåtsträvare som varnar, utan någon som följer fältet noga.

Verktyg markerar uttjatade fraser i AI-genererad text

Simon Willison har byggt ett litet verktyg som markerar de vanligaste klichéerna som LLM:er (stora språkmodeller) tenderar att upprepa – sådana fraser som 'det är värt att notera' eller 'i en värld där'. Det är ett enkelt men träffsäkert sätt att se hur igenkännbar AI-text faktiskt är.

Patreon blockerar AI-botar som skrapar kreatörers innehåll

Patreon har gått från att politely be AI-botar att hålla sig borta – via robots.txt-filen som botarna ändå ofta ignorerar – till att aktivt blockera dem via Cloudflares infrastruktur. Det handlar om att stoppa botar som hämtar kreatörers innehåll för att träna AI-modeller utan tillstånd. Intressant nog är det här ett tecken på att hela branschen börjar inse att robots.txt-hederssystemet inte fungerar i praktiken.

Roblox öppnar AI-verktyg för alla användare

Roblox rullar nu ut sin AI-verktygslåda brett så att vanliga användare kan bygga spel med hjälp av AI – inte bara erfarna utvecklare. Det är ett intressant skifte: plattformen som redan lever på användargenererat innehåll satsar nu på att AI ska sänka tröskeln ytterligare för vem som kan skapa.

Källor: Breakit

Färskbryggt AI varje morgon

15 minuter och en kopp kaffe, allt du behöver.