OpenAI börjar märka berättigade texter från ChatGPT och Codex i EU med en osynlig statistisk vattenstämpel. Tekniken heter textGrain och kan göra det möjligt att upptäcka att en text har bearbetats av OpenAI. Men vattenstämpeln är inte ett säkert bevis på vem som har skrivit texten, och en negativ kontroll bevisar inte heller att texten är mänskligt skriven.
OpenAI meddelade den 5 oktober att textGrain ska börja införas för berättigade textutdata från ChatGPT och Codex i EU under de kommande veckorna.
Förändringen hänger samman med transparenskraven i EU:s AI-förordning. För svenska ChatGPT-användare är den viktigaste skillnaden att vissa texter framöver kan innehålla en maskinellt detekterbar signal även när texten ser helt vanlig ut.
Det betyder däremot inte att lärare, arbetsgivare eller andra får ett enkelt verktyg som säkert kan avslöja vem som använt ChatGPT.
Så fungerar ChatGPT:s osynliga vattenstämpel
textGrain fungerar inte genom att OpenAI lägger in ett dolt meddelande, metadata eller osynliga specialtecken i texten.
I stället påverkas modellens val mellan olika möjliga ord och delar av ord när texten genereras.
När ChatGPT skriver finns normalt flera möjliga fortsättningar som passar. textGrain förändrar sannolikheten för vissa av dessa val enligt ett mönster som styrs av en hemlig nyckel.
En vanlig läsare märker inget.
Över en tillräckligt lång text kan mönstret däremot bli statistiskt mätbart. En detektor som känner till systemet och har tillgång till rätt nyckel kan då bedöma om texten sannolikt innehåller OpenAI:s vattenstämpel.
Det skiljer tekniken från många påstådda AI-detektorer som försöker gissa om en text är AI-skriven genom att analysera exempelvis meningsbyggnad och ordval i efterhand.
Vattenstämpeln försvinner inte bara för att texten kopieras
Eftersom textGrain ligger i själva ordvalen hjälper det inte automatiskt att kopiera texten från ChatGPT till Word, Google Dokument eller ett publiceringssystem.
Det finns inga särskilda osynliga tecken som enkelt kan tas bort genom att rensa formatering.
En oförändrad text kan alltså bära samma statistiska signal även efter att den har kopierats och klistrats in någon annanstans.
Det betyder samtidigt inte att vattenstämpeln är omöjlig att försvaga.
Omskrivning kan göra vattenstämpeln mycket svårare att hitta
OpenAI:s egna tester visar att textGrain fungerar betydligt bättre på längre och relativt oförändrade texter än på material som har redigerats kraftigt.
I ett test av texter på omkring 400 tokens såg resultatet ut ungefär så här:
| Text | Andel där vattenstämpeln upptäcktes |
|---|---|
| Ursprunglig vattenmärkt text | cirka 92 procent |
| 10 procent av orden ersatta med synonymer | cirka 66 procent |
| 25 procent av orden ersatta | cirka 17 procent |
Testerna visar varför en vattenstämpel inte kan behandlas som ett digitalt fingeravtryck som alltid finns kvar.
Om en människa skriver om delar av texten, byter formuleringar eller låter texten bearbetas ytterligare kan signalen försvagas kraftigt.
Även översättning kan påverka den.
Kortare texter är svårare att kontrollera
Längden spelar stor roll.
I OpenAI:s tester kunde vattenstämpeln under vissa förhållanden upptäckas i ungefär 80 procent av texter på 200 tokens. Vid 400 tokens steg resultatet till omkring 95 procent.
Det är dock inte en generell träffsäkerhet som gäller varje ChatGPT-text.
Ämnet påverkar också resultatet.
En modell som skriver en öppen resonerande text har många möjliga sätt att formulera sig. Då finns större utrymme för textGrain att påverka ordvalen.
I exempelvis matematiska svar och andra hårt faktabundna texter finns färre rimliga formuleringar. Där blir det svårare att bädda in en stark signal utan att påverka själva svaret.
Resultaten gäller inte automatiskt svenska texter
OpenAI har testat tekniken på EU:s 24 officiella språk, men resultaten varierar mellan språken.
Det är därför missvisande att använda de högsta engelska testsiffrorna som om de beskrev hur säkert en svensk ChatGPT-text kan identifieras.
OpenAI uppger att styrkan på vattenstämpeln kan anpassas mellan olika språk.
För en svensk användare är slutsatsen därför enklare:
textGrain kan göra ChatGPT-text möjlig att upptäcka, men det finns ingen offentlig procentsiffra som betyder att en viss svensk text med samma säkerhet kan klassas som AI-genererad.
Vad bevisar en positiv träff?
Det här är den viktigaste begränsningen.
Om en behörig textGrain-detektor hittar signalen betyder det enligt OpenAI att ett OpenAI-system sannolikt har genererat eller bearbetat åtminstone delar av texten.
Det säger inte automatiskt:
- vem som använde ChatGPT
- vilket ChatGPT-konto som användes
- vilken prompt som skrevs
- vilken konversation texten kommer från
- hur stor del av texten som skapades med AI
- hur mycket en människa har redigerat
- om AI-användningen var tillåten
- om informationen i texten är korrekt
- om exempelvis en student har fuskat.
Det är skillnaden mellan spår av AI-bearbetning och bevis om vad en viss person har gjort.
Ingen vattenstämpel är inte heller bevis för mänsklig text
Samma försiktighet behövs åt andra hållet.
Om vattenstämpeln inte hittas betyder det inte att texten måste vara skriven helt av en människa.
Det kan exempelvis bero på att texten:
- är för kort
- har redigerats mycket
- har översatts
- skapades innan vattenstämpeln infördes
- kommer från ett OpenAI-flöde där märkningen inte används
- har genererats av en annan AI-tjänst.
En negativ kontroll kan därför inte användas som ett säkert äkthetsintyg för mänskligt skrivande.
Kan en lärare kontrollera om en elev har använt ChatGPT?
Inte genom en allmänt tillgänglig textGrain-kontroll.
OpenAI gör inte detektorn offentlig i samband med lanseringen. Tillgång ska inledningsvis ges till utvalda forskare och expert- eller forskningsorganisationer.
Det innebär att en svensk lärare inte bara kan klistra in en uppsats på OpenAI:s webbplats och få beskedet att texten är eller inte är skriven med ChatGPT.
Även om tillgången till tekniken skulle bli bredare senare återstår dessutom problemet med vad resultatet faktiskt bevisar.
En träff visar inte vem som använde AI eller om användningen bröt mot reglerna för den aktuella examinationen.
För universitet och skolor blir därför de egna reglerna för tillåten och otillåten AI-användning fortfarande centrala. Läs även vår guide om ChatGPT på universitetet och reglerna i Sverige.
Alla ChatGPT-svar behöver inte märkas
OpenAI beskriver utrullningen som att berättigade textutdata ska vattenmärkas.
Det är en viktig formulering.
EU:s regler innehåller undantag, bland annat för vissa system där AI endast hjälper till med vanlig redigering och inte väsentligt förändrar användarens text.
I den europeiska uppförandekoden finns även undantag kopplade till bland annat mycket korta texter och kod.
Det är därför för kategoriskt att säga att varje enskild mening som svenska användare får från ChatGPT framöver kommer att innehålla en fungerande och detekterbar vattenstämpel.
ChatGPT och OpenAI API behandlas olika
För företag finns ytterligare en viktig skillnad.
Vattenmärkningen införs för berättigade ChatGPT- och Codex-utdata inom EU.
I OpenAI API är textGrain däremot valfritt och avstängt som standard.
Företag och utvecklare kan aktivera vattenmärkningen för stödda modeller på projekt- eller organisationsnivå.
Ett svenskt företag kan alltså inte utgå från att all text som skapas med OpenAI:s modeller behandlas likadant bara för att företaget finns inom EU.
Varför inför OpenAI vattenstämpeln nu?
Bakgrunden är EU:s AI-förordning.
Artikel 50 innehåller transparensregler för AI-genererat eller manipulerat innehåll. Leverantörer av generativa AI-system ska göra sådant innehåll maskinläsbart och möjligt att identifiera som artificiellt genererat eller manipulerat när det är tekniskt möjligt.
Reglerna började gälla den 2 augusti 2026.
För system som redan fanns på marknaden före det datumet finns samtidigt en övergångsperiod för vissa märknings- och detektionskrav till den 2 december 2026.
Det är därför tekniken börjar dyka upp praktiskt först nu under hösten.
Vattenstämpel och synlig AI-märkning är inte samma sak
EU:s regler innehåller också skyldigheter som handlar om att människor i vissa situationer ska informeras om att innehåll är AI-genererat.
Det ska inte blandas ihop med textGrain.
En osynlig teknisk vattenstämpel är en maskinläsbar signal.
En synlig upplysning till läsaren är något annat.
För AI-genererade texter som publiceras för att informera allmänheten om frågor av allmänintresse finns dessutom ett undantag när texten har genomgått mänsklig granskning eller redaktionell kontroll och någon person eller organisation bär redaktionellt ansvar.
Att en text innehåller textGrain betyder alltså inte automatiskt att den måste märkas synligt som AI-genererad.
textGrain ska bli öppen källkod
OpenAI planerar att göra tekniken bakom textGrain öppen källkod.
Det betyder inte att vem som helst automatiskt får möjlighet att kontrollera varje text från ChatGPT.
Den tekniska metoden kan offentliggöras samtidigt som de hemliga nycklar som behövs för att identifiera OpenAI:s produktionssignaler förblir skyddade.
Det är ungefär samma skillnad som mellan att känna till hur ett låssystem fungerar och att faktiskt ha rätt nyckel.
Så ska ChatGPT-vattenstämpeln tolkas
Den enklaste sammanfattningen är att textGrain ger en ny typ av tekniskt spår i vissa ChatGPT-texter.
Spåret är betydligt mer specifikt än en vanlig AI-detektor eftersom OpenAI medvetet bygger in signalen när texten genereras.
Men den är fortfarande inte ett säkert svar på frågan om vem som skrev en text.
En positiv träff kan tala för att OpenAI har genererat eller bearbetat texten. Den kan inte ensam visa vem som använde tjänsten, hur stor del som skrevs av AI eller om användningen var otillåten.
Och om signalen saknas går det inte heller att dra slutsatsen att texten måste vara helt mänskligt skriven.
För den som vill förstå skillnaden mellan sådana inbyggda signaler och vanliga verktyg som försöker gissa AI-användning i efterhand finns också vår artikel om AI-detektion i svenska riksdagsmotioner.
Den verkliga förändringen är därför inte att AI-text plötsligt blir säkert avslöjbar. Det nya är att vissa texter från ChatGPT för första gången får ett avsiktligt, maskinläsbart spår direkt när modellen skriver dem.