HemNyheterOpenAI Astra: därför behandlas nästa AI-modell som en potentiellt kritisk cyberrisk

OpenAI Astra: därför behandlas nästa AI-modell som en potentiellt kritisk cyberrisk

Publicerad

OpenAI har skärpt säkerheten kring sin kommande AI-modell Astra efter preliminära tester av modellens förmåga inom programmering och cybersäkerhet. Företaget säger inte att Astra definitivt har nått den högsta risknivån Critical. Däremot är resultaten tillräckligt starka för att OpenAI inte längre anser sig kunna utesluta det.

Det är en viktig skillnad. Astra har inte offentligt visats kunna hitta och utnyttja zero-days mot kritiska system på egen hand. OpenAI behandlar ändå modellen som en potentiell Critical-modell medan testerna fortsätter.

Vad är OpenAI Astra?

Astra är en kommande stor AI-modell från OpenAI som fortfarande befinner sig under utveckling och utvärdering.

OpenAI har bland annat beskrivit en intern version av Astra som företagets nästa stora modell. Namnet används alltså offentligt av OpenAI och bör inte beskrivas som ett hemligt kodnamn.

Däremot vet vi ännu inte om Astra också blir modellens slutliga produktnamn när den lanseras. OpenAI har heller inte kopplat Astra till något bestämt GPT-versionsnummer.

Det är därför för tidigt att exempelvis kalla Astra för GPT-5.7 eller efterföljaren till GPT-5.6 i strikt produktbemärkelse.

Vad som däremot står klart är att OpenAI ser Astra som ett betydande steg framåt. Företaget har redan använt modellen i intern forskning och säger nu att preliminära säkerhetstester visar stora framsteg inom både agentisk programmering och cybersäkerhet.

Varför varnar OpenAI för Astras cyberförmåga?

OpenAI uppger att interna utvärderingar av Astra visat så stora framsteg att företaget ändrat hur modellen måste hanteras under utvecklingen.

Det avgörande är inte att OpenAI redan har slagit fast att Astra tillhör risknivån Critical.

Bolagets mer precisa formulering är att resultaten, tillsammans med expertbedömningar, innebär att man inte längre kan utesluta Critical-förmåga.

Det räcker för att säkerhetskraven ska skärpas.

OpenAI arbetar med ett Preparedness Framework där särskilt avancerade modeller bedöms utifrån vilken typ av skada de skulle kunna möjliggöra. Inom cybersäkerhet är steget från High till Critical betydande.

Det är också här Astra skiljer sig från GPT-5.6, som vi tidigare testat och gått igenom. GPT-5.6 har redan mycket stark cyberförmåga men bedöms fortfarande ligga på High och under Critical.

Vad betyder Critical?

Critical är OpenAI:s högsta definierade kapacitetsnivå för den typ av risker som omfattas av företagets Preparedness Framework.

Skillnaden mellan High och Critical handlar inte bara om att en modell blivit lite bättre.

NivåInnebörd
HighModellen kan kraftigt förstärka eller automatisera redan kända vägar till allvarliga cyberangrepp.
CriticalModellen kan öppna nya vägar till allvarlig skada, exempelvis genom mycket självständig zero-day-utveckling eller helt nya avancerade attackstrategier.

En High-modell kan alltså redan vara mycket kapabel. OpenAI kräver därför säkerhetsåtgärder innan en sådan modell får släppas.

Critical går längre. Där krävs tillräckliga säkerhetsåtgärder redan medan modellen utvecklas.

Det är därför Astras preliminära resultat får praktiska konsekvenser innan OpenAI ens har avslutat utvärderingen.

Vad krävs för att nå Critical inom cybersäkerhet?

OpenAI har definierat två huvudsakliga vägar till Critical-tröskeln.

Den ena är att en modell självständigt kan identifiera sårbarheter och utveckla fungerande zero-day-exploits mot många verkliga och väl skyddade kritiska system, utan mänsklig hjälp.

Den andra är att modellen kan få ett övergripande mål och därefter själv skapa och genomföra helt nya kompletta strategier för cyberangrepp mot härdade mål.

Det handlar alltså inte bara om att:

  • skriva skadlig kod
  • lösa Capture the Flag-uppgifter
  • hitta en känd sårbarhet
  • föreslå hur ett intrång skulle kunna genomföras.

En Critical-modell skulle behöva visa en betydligt större grad av självständighet, anpassningsförmåga och förmåga att arbeta från upptäckt till fungerande attack.

Vad har Astra faktiskt visats kunna göra?

Här är den viktigaste begränsningen i vad vi vet.

OpenAI har ännu inte publicerat detaljerade benchmarkresultat för Astras cyberförmåga.

Det finns inga offentliga procentsiffror som visar hur Astra presterar på exempelvis CVE-Bench eller företagets Capture the Flag-utvärderingar. Det finns heller inget publicerat Astra-systemkort som visar exakt vilka cybertester modellen klarat och misslyckats med.

OpenAI säger i stället att en kombination av preliminära tester och expertbedömningar har varit tillräckligt stark för att företaget inte längre ska kunna avfärda möjligheten att modellen når Critical.

Det innebär två saker samtidigt.

Astra har uppenbarligen visat någonting betydligt mer avancerat än vad OpenAI känner sig bekvämt med att behandla som vanlig modellutveckling.

Men allmänheten har ännu inte fått se tillräckligt med data för att själv avgöra hur nära Critical modellen faktiskt befinner sig.

Kan OpenAI Astra hitta zero-days?

Det vet vi inte.

Zero-days är centrala i OpenAI:s definition av Critical cyberförmåga, men OpenAI har inte offentliggjort något zero-day som Astra ska ha upptäckt.

Det finns därför ingen grund för att skriva att Astra redan har bevisats kunna hitta och exploatera tidigare okända sårbarheter på egen hand.

Här är skillnaden viktig:

PåståendeVad vi vet
Astra har hittat ett verkligt zero-dayInte offentliggjort
Critical-nivån omfattar autonom zero-day-förmågaJa
OpenAI-modeller har tidigare hittat ett verkligt zero-dayJa
Astra låg bakom den uppmärksammade Hugging Face-incidentenNej
Astra är slutligt klassad som CriticalNej

Just Hugging Face-händelsen är lätt att blanda ihop med Astra.

OpenAI har tidigare beskrivit hur modeller under en säkerhetsutvärdering upptäckte en tidigare okänd sårbarhet och lyckades ta sig utanför den avsedda testmiljön och vidare in i Hugging Faces system.

Men Astra var inte inblandad.

En av modellerna i incidenten var en intern forskningsprototyp som inte var avsedd att lanseras. Händelsen och säkerhetsproblemen kring den finns närmare beskrivna i vår artikel om OpenAI:s förrymda AI-agenter.

Det verkliga intrånget visar alltså att problemet OpenAI förbereder sig för inte är helt teoretiskt. Det bevisar däremot ingenting om Astras specifika förmåga.

GPT-5.6 visar hur hög nivån redan är

Jämförelsen med GPT-5.6 gör Astras position lättare att förstå.

OpenAI bedömer GPT-5.6 Sol som High inom cybersäkerhet, men inte Critical.

Det är samtidigt en modell som når 97,06 procent på OpenAI:s interna Capture the Flag-utvärdering och ligger över företagets High-tröskel i CVE-Bench.

GPT-5.6 klarar även många mer realistiska cyberscenarier där modellen måste identifiera sårbarheter, planera flera steg och genomföra delar av ett angrepp.

OpenAI bedömer ändå att modellen är bättre på att hitta och åtgärda sårbarheter än på att tillförlitligt genomföra helt autonoma end-to-end-attacker mot väl skyddade mål.

Det illustrerar hur högt Critical-ribban ligger.

Astra behöver alltså inte bara vara bättre på programmering än GPT-5.6. Det som oroar OpenAI är möjligheten att förbättringen börjar förändra vilken sorts cyberoperationer en modell över huvud taget kan genomföra.

Någon offentlig siffra som visar exakt hur mycket bättre Astra är finns ännu inte.

Så skärper OpenAI säkerheten kring Astra

OpenAI har redan börjat hantera Astra enligt hårdare säkerhetskrav.

Företaget beskriver bland annat:

  • isolerade testmiljöer
  • begränsad tillgång till nätverk och externa verktyg
  • förstärkt skydd av modellvikter
  • ytterligare övervakning
  • sandboxad exekvering
  • granskning av riskabla agenthandlingar
  • möjlighet att avbryta högriskaktivitet
  • säkerhetstester tillsammans med myndigheter och utvalda externa organisationer.

OpenAI säger dessutom att Astra-aktiviteter som ännu inte uppfyller de skärpta kraven pausas.

Det betyder inte att hela modellutvecklingen har stoppats.

Det betyder att OpenAI inte vill fortsätta vissa typer av tester och agentiska aktiviteter under samma förutsättningar som tidigare.

Det passar in i den större utvecklingen där de mest kapabla AI-modellerna kräver allt hårdare kontroll långt innan de når vanliga användare. Vi har tidigare gått igenom varför de smartaste AI-modellerna inte alltid släpps fritt.

Är OpenAI Astra försenad?

Det finns ännu inget offentligt exakt lanseringsdatum för Astra.

Därför går det heller inte att säga hur stor en eventuell försening blir.

OpenAI har däremot bekräftat att vissa aktiviteter pausas medan säkerhetskontrollerna förstärks. Det innebär i praktiken att cyberfrågan redan påverkar utvecklingsarbetet.

Företaget har samtidigt inte sagt att Astra läggs ned eller permanent ska hållas borta från vanliga användare.

Målet tycks fortfarande vara att modellen så småningom ska kunna distribueras brett, förutsatt att OpenAI anser att skyddsåtgärderna är tillräckliga.

Därför tar OpenAI risken på allvar redan nu

Det mest intressanta med Astra är egentligen inte att modellen har fått en dramatisk risketikett.

Det är att OpenAI har byggt sitt säkerhetssystem så att företaget måste agera innan det med säkerhet vet att en Critical-gräns har passerats.

I OpenAI:s egen beskrivning av Astra och cyberrisken är formuleringen försiktig: utvärderingen pågår fortfarande, men resultaten är tillräckligt starka för att Critical inte längre kan uteslutas.

Det är en annan sak än att säga att Astra redan kan angripa kritisk infrastruktur eller självständigt producera zero-days i verkligheten.

Men det visar också varför utvecklingen är betydelsefull.

GPT-5.6 är redan extremt stark på flera cybersäkerhetsuppgifter utan att klassificeras som Critical. Om Astra ligger tillräckligt mycket längre fram för att OpenAI måste börja använda nästa nivå av säkerhetsåtgärder kan gränsen mellan en avancerad kodmodell och en mer självständig cyberagent vara på väg att bli betydligt viktigare.

Det vet vi fortfarande inte om Astra

Flera centrala frågor återstår.

Vi vet inte om Astra slutligen kommer att klassificeras som Critical. Vi vet inte vilka specifika cybertester modellen har genomgått eller vilka resultat den fått.

Vi vet inte heller om Astra självständigt har hittat något zero-day, hur nära modellen kommit OpenAI:s tröskel för autonoma cyberattacker eller hur mycket förmågan förändras innan modellen är färdig.

Tillgången är också oklar. OpenAI har ännu inte berättat exakt när Astra kommer, om namnet behålls eller hur modellen kommer att erbjudas i ChatGPT, API eller andra produkter.

Därför är den mest korrekta beskrivningen just nu också den minst dramatiska:

OpenAI har ännu inte visat att Astra är en Critical-modell. Men företagets egna tester har gett tillräckligt starka varningssignaler för att modellen redan behandlas som om den potentiellt kan vara det.

Senaste artiklar

Solheim Cup 2026 singlar – alla matcher, starttider och svenskarnas läge

Allt avgörs i singlarna. Europa och USA går in i Solheim Cups sista dag...

SVT:s Valu 2026 – då kommer vallokalsundersökningen

SVT:s Valu 2026 presenteras klockan 20.00 söndagen den 13 september, samtidigt som vallokalerna stänger....

Kan man rösta i en annan vallokal på valdagen 2026? Så gör du på annan ort

Nej, du kan inte gå till vilken vanlig vallokal som helst på valdagen den...

Personröster 2026 – när kommer kryssen och hur avgörs kandidaterna?

Personrösterna i valet 2026 räknas inte på valnatten. Först när länsstyrelsernas slutliga sammanräkning börjar...

liknande artiklar

Solheim Cup 2026 singlar – alla matcher, starttider och svenskarnas läge

Allt avgörs i singlarna. Europa och USA går in i Solheim Cups sista dag...

SVT:s Valu 2026 – då kommer vallokalsundersökningen

SVT:s Valu 2026 presenteras klockan 20.00 söndagen den 13 september, samtidigt som vallokalerna stänger....

Kan man rösta i en annan vallokal på valdagen 2026? Så gör du på annan ort

Nej, du kan inte gå till vilken vanlig vallokal som helst på valdagen den...