Den inbyggda konflikten
En modern AI-modell är tränad att göra två saker samtidigt. Den ska vara så hjälpsam den bara kan. Och den ska vägra det som är farligt. En jailbreak är konsten att spela ut den första egenskapen mot den andra.
Tänk på modellen som en mycket kunnig och mycket tillmötesgående tjänsteperson. Den vill svara på din fråga. Spärrarna ligger ovanpå, ungefär som en lista över ämnen den inte får ta upp. En jailbreak hittar en formulering där viljan att hjälpa väger tyngre än listan.
Det förklarar varför problemet inte är en vanlig bugg. En bugg går att rätta. Det här är en konflikt mellan två saker vi faktiskt vill ha: en AI som är användbar, och en AI som är säker.
Varför det går att lura en modell
Modellen läser inte bara vad du frågar. Den läser hur du frågar. Inramningen spelar roll.
Samma fråga kan stoppas när du ställer den rakt, men slinka igenom förklädd. En förfrågan kan klä sig som fiktion, som ett rollspel eller som ren forskning. Den kan ställas som ett försvar, alltså "hur skyddar jag mig mot det här", i stället för rakt på sak. Tidiga modeller gick ofta på sådana omformuleringar.
Ett annat sätt är att gå försiktigt fram. I stället för en enda förbjuden fråga ställer angriparen en rad små, harmlösa frågor som steg för steg närmar sig målet. Var och en känns ofarlig. Summan är det inte.
Jag beskriver med flit bara principerna här, inte recepten. Poängen är att förstå varför metoderna biter. De utnyttjar att modellen försöker vara förstående och flexibel, precis det vi annars uppskattar mest hos den.
Katten och råttan
Varje gång ett labb täpper till ett hål hittar någon ett nytt. Det är en evig kapplöpning.
Därför pratar AI-företagen om försvar i flera lager. Anthropic, som bygger Fable, beskriver sin strategi just så. Målet är inte ett perfekt skydd, för det verkar inte gå att bygga idag. Målet är att göra varje kringgång antingen smal eller dyr, och att övervaka i bakgrunden för att snabbt slå larm. Företaget sparar därför användarnas data i 30 dagar, en kostsam åtgärd som ska hjälpa dem att upptäcka och täppa till nya angrepp.
Det man försöker förhindra
Varför bryr sig en regering om ett knep i en chatt? Svaret heter uplift.
Uplift betyder att en modell sänker tröskeln för något farligt. Inte att den gör jobbet, utan att den lyfter en lekman närmare en experts förmåga. Det som tidigare krävde år av utbildning och tillgång till ett labb skulle kanske kunna packas ihop till ett samtal.
Det är där de verkligt allvarliga farhågorna finns. Cybervapen. Kemiska och biologiska hot. Det obehagliga är inte chattloggen i sig. Det är att glappet mellan att vilja göra skada och att veta hur har skyddat oss genom hela mänsklighetens historia. En olåst modell hotar att krympa det glappet.
Modellen Mythos, som Fable bygger på, är just därför extra känslig. Fable har spärrar som stoppar de farligaste frågorna. Mythos har vissa av dem borttagna, och delas bara med en noggrant granskad krets.
Hur farligt är det egentligen
Här blir det intressant, för forskarna är inte överens.
En stor studie från forskningsinstitutet RAND lät team spela onda aktörer som planerade ett biologiskt angrepp. Hälften hade tillgång till en AI, hälften bara till internet. Resultatet blev en lättnad: AI:n gjorde ingen mätbar skillnad. Slutsatsen var att dåtidens modeller inte lyfte en angripare förbi vad en vanlig sökmotor redan gav.
Men bilden rör på sig. Nyare studier på kraftfullare modeller är mer oroande. I slutet av 2025 visade RAND-forskare att flera moderna modeller kunde vägleda en motiverad användare genom centrala steg som experter förr behövde kunna själva. Och AI-företagen, inklusive Anthropic, klassar numera sina egna toppmodeller som en medelhög biologisk risk.
Båda sakerna kan vara sanna samtidigt. De modeller som testades 2024 gav ingen verklig hjälp. De som testas nu börjar göra det. Den springande punkten är skillnaden mellan att hjälpa en expert och att lyfta en nybörjare, och mellan ren kunskap och praktisk labbfärdighet. Just nu verkar det vara handens skicklighet, inte huvudets kunskap, som utgör den sista barriären.
Det var också kärnan i bråket om Fable. Anthropic höll med om att det fanns en kringgång, men menade att den var smal, och att andra fritt tillgängliga modeller kan exakt samma sak. Regeringen drog ändå i nödbromsen.
En tanke att bära med sig
En jailbreak ser ut som en lek med ord. Den som lyckas har inte knäckt någon kod. Hen har hittat rätt mening.
Men under leken ligger en obekväm sanning. Vi har byggt något som kan veta saker vi inte är överens om att alla borde få veta. Och gränsen mellan det hjälpsamma och det farliga går rakt genom samma fråga, beroende på hur den ställs. Det är därför ett brev kunde släcka en hel modell på en fredag.
Källor
Anthropic, "Statement on the US government directive to suspend access to Fable 5 and Mythos 5" (2026). RAND Corporation, "The Operational Risks of AI in Large-Scale Biological Attacks: Results of a Red-Team Study" (2024) och "Contemporary Foundation AI Models Increase Biological Weapons Risk" (2025). Säkerhetsutvärderingar (system cards) publicerade av OpenAI och Anthropic, 2024 till 2026. Rapportering om avstängningen av Fable 5 och Mythos 5 i Bloomberg, TechCrunch och Fortune (juni 2026).
Vad tyckte du om artikeln?






