torsdag 30 juli 2026Oberoende populärvetenskap
    MagasinetMarknadsanalysNyhetsbrevOm oss
    V
    Vetenskap för alla
    Prenumerera
    Knepet som stängde av en AI, för alla utom amerikaner
    AI

    Knepet som stängde av en AI, för alla utom amerikaner

    Ett enda påstått knep fick den amerikanska regeringen att släcka en av världens kraftfullaste AI-modeller, för alla utom amerikaner. Knepet kallas jailbreak. Men vad är det egentligen, och varför är det så svårt att stoppa?

    Peter Bergvall14 juni 2026

    Den inbyggda konflikten

    En modern AI-modell är tränad att göra två saker samtidigt. Den ska vara så hjälpsam den bara kan. Och den ska vägra det som är farligt. En jailbreak är konsten att spela ut den första egenskapen mot den andra.

    Tänk på modellen som en mycket kunnig och mycket tillmötesgående tjänsteperson. Den vill svara på din fråga. Spärrarna ligger ovanpå, ungefär som en lista över ämnen den inte får ta upp. En jailbreak hittar en formulering där viljan att hjälpa väger tyngre än listan.

    Det förklarar varför problemet inte är en vanlig bugg. En bugg går att rätta. Det här är en konflikt mellan två saker vi faktiskt vill ha: en AI som är användbar, och en AI som är säker.

    Varför det går att lura en modell

    Modellen läser inte bara vad du frågar. Den läser hur du frågar. Inramningen spelar roll.

    Samma fråga kan stoppas när du ställer den rakt, men slinka igenom förklädd. En förfrågan kan klä sig som fiktion, som ett rollspel eller som ren forskning. Den kan ställas som ett försvar, alltså "hur skyddar jag mig mot det här", i stället för rakt på sak. Tidiga modeller gick ofta på sådana omformuleringar.

    Ett annat sätt är att gå försiktigt fram. I stället för en enda förbjuden fråga ställer angriparen en rad små, harmlösa frågor som steg för steg närmar sig målet. Var och en känns ofarlig. Summan är det inte.

    Jag beskriver med flit bara principerna här, inte recepten. Poängen är att förstå varför metoderna biter. De utnyttjar att modellen försöker vara förstående och flexibel, precis det vi annars uppskattar mest hos den.

    Katten och råttan

    Varje gång ett labb täpper till ett hål hittar någon ett nytt. Det är en evig kapplöpning.

    Därför pratar AI-företagen om försvar i flera lager. Anthropic, som bygger Fable, beskriver sin strategi just så. Målet är inte ett perfekt skydd, för det verkar inte gå att bygga idag. Målet är att göra varje kringgång antingen smal eller dyr, och att övervaka i bakgrunden för att snabbt slå larm. Företaget sparar därför användarnas data i 30 dagar, en kostsam åtgärd som ska hjälpa dem att upptäcka och täppa till nya angrepp.

    Det man försöker förhindra

    Varför bryr sig en regering om ett knep i en chatt? Svaret heter uplift.

    Uplift betyder att en modell sänker tröskeln för något farligt. Inte att den gör jobbet, utan att den lyfter en lekman närmare en experts förmåga. Det som tidigare krävde år av utbildning och tillgång till ett labb skulle kanske kunna packas ihop till ett samtal.

    Det är där de verkligt allvarliga farhågorna finns. Cybervapen. Kemiska och biologiska hot. Det obehagliga är inte chattloggen i sig. Det är att glappet mellan att vilja göra skada och att veta hur har skyddat oss genom hela mänsklighetens historia. En olåst modell hotar att krympa det glappet.

    Modellen Mythos, som Fable bygger på, är just därför extra känslig. Fable har spärrar som stoppar de farligaste frågorna. Mythos har vissa av dem borttagna, och delas bara med en noggrant granskad krets.

    Hur farligt är det egentligen

    Här blir det intressant, för forskarna är inte överens.

    En stor studie från forskningsinstitutet RAND lät team spela onda aktörer som planerade ett biologiskt angrepp. Hälften hade tillgång till en AI, hälften bara till internet. Resultatet blev en lättnad: AI:n gjorde ingen mätbar skillnad. Slutsatsen var att dåtidens modeller inte lyfte en angripare förbi vad en vanlig sökmotor redan gav.

    Men bilden rör på sig. Nyare studier på kraftfullare modeller är mer oroande. I slutet av 2025 visade RAND-forskare att flera moderna modeller kunde vägleda en motiverad användare genom centrala steg som experter förr behövde kunna själva. Och AI-företagen, inklusive Anthropic, klassar numera sina egna toppmodeller som en medelhög biologisk risk.

    Båda sakerna kan vara sanna samtidigt. De modeller som testades 2024 gav ingen verklig hjälp. De som testas nu börjar göra det. Den springande punkten är skillnaden mellan att hjälpa en expert och att lyfta en nybörjare, och mellan ren kunskap och praktisk labbfärdighet. Just nu verkar det vara handens skicklighet, inte huvudets kunskap, som utgör den sista barriären.

    Det var också kärnan i bråket om Fable. Anthropic höll med om att det fanns en kringgång, men menade att den var smal, och att andra fritt tillgängliga modeller kan exakt samma sak. Regeringen drog ändå i nödbromsen.

    En tanke att bära med sig

    En jailbreak ser ut som en lek med ord. Den som lyckas har inte knäckt någon kod. Hen har hittat rätt mening.

    Men under leken ligger en obekväm sanning. Vi har byggt något som kan veta saker vi inte är överens om att alla borde få veta. Och gränsen mellan det hjälpsamma och det farliga går rakt genom samma fråga, beroende på hur den ställs. Det är därför ett brev kunde släcka en hel modell på en fredag.

    Källor

    Anthropic, "Statement on the US government directive to suspend access to Fable 5 and Mythos 5" (2026). RAND Corporation, "The Operational Risks of AI in Large-Scale Biological Attacks: Results of a Red-Team Study" (2024) och "Contemporary Foundation AI Models Increase Biological Weapons Risk" (2025). Säkerhetsutvärderingar (system cards) publicerade av OpenAI och Anthropic, 2024 till 2026. Rapportering om avstängningen av Fable 5 och Mythos 5 i Bloomberg, TechCrunch och Fortune (juni 2026).

    Vad tyckte du om artikeln?

    Tillbaka till AI
    Nyhetsbrev

    En vetenskapsartikel i veckan — ingen klickbete, inga annonser

    Gillade du den här? Få veckans bästa, förklarad utan jargong, direkt i inkorgen. Gratis, och du väljer själv vilka ämnen.

    Välj ämnen

    Alla ämnen

    Lämna allt omarkerat så får du veckans alla artiklar. Markera bara om du vill begränsa brevet till specifika ämnen.

    Vi delar aldrig din e-postadress och säljer den aldrig vidare. Du kan avregistrera dig när som helst med ett klick längst ner i varje brev.

    Veckans artiklar finns också samlade i Magasinet — läs på webben eller ladda ner som PDF.

    Har du frågor eller synpunkter?

    Läs vidare

    Fler i AI →
    Europa kan inte vinna AI-kapplöpningen men det är fel fråga
    AI

    Europa kan inte vinna AI-kapplöpningen men det är fel fråga

    Europa producerar 22 procent av världens AI-forskning men kontrollerar bara fem procent av datorkraften som behövs för att köra den. Det låter som ett förlorat lopp. Men frågan kanske inte är vem som bygger nästa AI-modell, utan vem som får drifta den — och till vilket pris.

    Fable 5: AI-modellen som var för bra

    Fable 5: AI-modellen som var för bra

    Den 9 juni 2026 släppte Anthropic sin kraftfullaste AI-modell någonsin för allmänheten. Tre dagar senare stängde den amerikanska regeringen ned den. Vad kunde Fable 5 egentligen göra, och varför räckte det för att utlösa ett historiskt ingripande?

    Hur långt efter ligger Europas AI egentligen?
    AI

    Hur långt efter ligger Europas AI egentligen?

    När USA nyligen stängde av sina kraftfullaste AI-modeller för alla utom amerikaner blev en fråga plötsligt brännande. Hur långt efter ligger Europas egna modeller? Svaret är nedslående och hoppfullt på samma gång.

    Singulariteten: det ögonblick som kan förändra allt
    AI

    Singulariteten: det ögonblick som kan förändra allt

    Tänk dig att du en morgon vaknar och läser att en maskin har blivit smartare än alla människor som någonsin levt, kombinerat. Inte bara på ett område, utan på alla. Det är singulariteten. Och en del forskare tror att det kan hända inom din livstid.

    Europa i teknikracet: bra forskning, dåliga affärer
    AI

    Europa i teknikracet: bra forskning, dåliga affärer

    Europa har världsledande forskare, strikta regelverk och ambitiösa strategier. Men när tekniken ska bli företag försvinner den ofta till USA. Varför händer det — och har Europa en chans att komma ikapp?

    Datorn som lärde sig tänka – och förändrade allt
    Artificiell intelligens

    Datorn som lärde sig tänka – och förändrade allt

    På fem dagar testade en miljon människor den. Inom två månader hade antalet exploderat till hundra miljoner. Ingen teknologi i historien har spridit sig snabbare – och ingen har väckt mer hopp, rädsla och förvirring om vad som händer härnäst.

    Bläddra i fler artiklar inom AI och Teknik och digitalt liv, eller gå till startsidan.