Ja – på vissa mycket avgränsade medicinska uppgifter är AI redan lika bra som eller bättre än läkare. Den kan hitta mikroskopiska förändringar i vävnad, upptäcka mönster i miljontals EKG och sortera medicinska bilder med en precision som ibland överträffar människans. Men att tolka ett test är inte samma sak som att diagnostisera en patient. Och just där går fortfarande en av de viktigaste gränserna för AI i sjukvården.
Det finns en lockande enkel bild av framtidens sjukvård: en artificiell intelligens får patientens prover och bilder, upptäcker sjukdomen snabbare än läkaren och lämnar ett facit.
På vissa områden börjar verkligheten faktiskt likna den bilden.
AI-system kan redan hitta sjukdomstecken i EKG som människor inte kan se med blotta ögat. Inom mammografiscreening har svenska forskare visat att AI-stödd granskning kan hitta fler cancerfall än traditionell dubbelgranskning. Algoritmer kan söka efter små metastaser i digitaliserade vävnadsprover och analysera näthinnebilder för att avgöra vilka diabetespatienter som behöver träffa en ögonspecialist.
Problemet är bara att en riktig medicinsk diagnos nästan aldrig består av en enda sådan uppgift.
En läkare måste först förstå vad patientens problem kan vara, välja vilka undersökningar som behövs, väga samman symtom, sjukdomshistoria, läkemedel, blodprover och bilder och därefter avgöra hur säker diagnosen faktiskt är.
Det är därför två påståenden kan vara sanna samtidigt:
AI är redan bättre än människor på vissa diagnostiska uppgifter.
AI är fortfarande långt ifrån att generellt ersätta en läkare som diagnostiker.
AI kan se sådant människan inte ser i ett EKG
EKG är ett av de tydligaste exemplen på hur medicinsk AI förändrar vad en undersökning kan användas till.
Ett vanligt EKG mäter hjärtats elektriska aktivitet. En läkare eller kardiolog kan läsa av bland annat hjärtrytm, överledningsproblem och tecken på vissa hjärtsjukdomar.
Men ett EKG består också av stora mängder numerisk information som innehåller mönster betydligt mer subtila än de klassiska förändringar som människor har lärt sig att känna igen.
Här har AI en fundamental fördel.
En algoritm behöver inte veta hur ett EKG ”brukar se ut” för det mänskliga ögat. Den kan tränas på enorma mängder EKG tillsammans med information om vilka sjukdomar patienterna senare visade sig ha.
Därefter kan modellen leta efter statistiska samband som ingen människa tidigare har definierat.
En studie publicerad den 1 september 2026 analyserade omkring 3,57 miljoner enkanals-EKG från drygt 84 000 personer. AI användes för att leta efter supraventrikulär takykardi, SVT, en typ av hjärtrytmrubbning som kan vara svår att fånga eftersom den ofta kommer i attacker.
När de registreringar som AI bedömde som särskilt misstänkta därefter granskades av kardiologer kunde systemet kraftigt minska mängden data som specialisterna behövde gå igenom för att hitta verkliga fall.
Den nya studien i Communications Medicine visar därmed något som sannolikt blir centralt i framtidens sjukvård: AI behöver inte ersätta kardiologen för att förändra arbetet fullständigt.
Om miljontals registreringar kan sorteras innan en människa tittar på dem kan läkaren koncentrera sig på de patienter där risken faktiskt är störst.
Ännu mer fascinerande är AI-system som använder ett till synes normalt EKG för att förutsäga sjukdomar som ännu inte har diagnostiserats.
Sådana modeller har bland annat studerats för hjärtsvikt, förmaksflimmer, hjärtmuskelsjukdomar och flera andra tillstånd.
Det betyder inte att EKG ensamt bevisar att patienten har sjukdomen. Snarare fungerar AI som en extremt känslig signalspanare.
Den kan säga:
Här finns ett mönster som gör att den här patienten bör undersökas närmare.
Nästa steg kan sedan vara exempelvis ultraljud av hjärtat, långtids-EKG, blodprover eller andra undersökningar som faktiskt kan bekräfta eller avfärda misstanken.
Det är skillnad mellan att hitta ett mönster och att ställa en diagnos
Det här är den kanske viktigaste skillnaden för att förstå alla påståenden om att AI skulle vara ”bättre än läkare”.
Anta att en AI får en bild av en hudförändring och ska svara på en enda fråga:
Ser den här förändringen ut som melanom?
Det är ett klassificeringsproblem.
AI får en tydligt definierad informationstyp som indata och ska välja mellan ett litet antal möjliga svar.
En läkare som träffar en verklig patient börjar på ett helt annat ställe.
Patienten kanske söker för trötthet, yrsel och viktnedgång.
Är problemet blodbrist? Cancer? Diabetes? Depression? Infektion? Hjärtsjukdom? En läkemedelsbiverkan? Problem med sköldkörteln? Något helt annat?
Läkaren måste först bestämma vilka frågor som behöver ställas.
Sedan kommer nästa beslut:
Vilka prover behöver tas?
Behövs ett EKG?
Ska patienten röntgas?
Finns det något farligt tillstånd som måste uteslutas direkt?
Är ett avvikande testresultat själva sjukdomen, ett bifynd eller kanske ett falskt alarm?
Detta är inte en enda klassificering. Det är en lång kedja av beslut där ny information hela tiden förändrar sannolikheten för olika diagnoser.
Det är betydligt svårare än att avgöra vad som finns på en redan utvald bild.
Mammografi visar hur AI redan kan förbättra verklig sjukvård
Bröstcancerscreening är ett av de områden där evidensen för AI har blivit särskilt stark.
I Sverige används traditionellt två radiologer som oberoende av varandra granskar mammografibilder. Tanken är att minska risken att en misstänkt förändring missas.
Den stora svenska MASAI-studien har jämfört detta arbetssätt med AI-stödd screening hos mer än 100 000 kvinnor.
Resultaten är betydelsefulla.
Den AI-stödda screeningen hade en sensitivitet på omkring 80,5 procent, jämfört med 73,8 procent vid traditionell dubbelgranskning.
Specificiteten låg samtidigt på 98,5 procent i båda grupperna.
Dessutom kunde arbetsbelastningen för radiologerna minska.
Det är betydligt starkare evidens än en studie där en AI i efterhand får tävla mot läkare på ett färdigsorterat bildmaterial.
Här prövas tekniken i ett verkligt screeningsystem.
Men inte heller detta betyder att AI har ”ersatt radiologen”.
AI används för att bedöma risk och hjälpa till att avgöra vilka bilder som kräver mer mänsklig granskning.
Det är därför mer korrekt att säga att AI förändrar radiologens arbetsflöde än att AI tar över hela jobbet.
Ögonundersökningar ligger nära verkligt autonom diagnostik
Diabetes kan skada blodkärlen i näthinnan och orsaka diabetesretinopati. Tillståndet kan i värsta fall leda till synförlust, men behandling kan vara mycket effektiv om sjukdomen upptäcks i tid.
Det gör området perfekt för screening.
Patienten fotograferar näthinnan. Därefter ska någon avgöra om bilden visar tillräckliga förändringar för att patienten ska remitteras vidare.
Det finns redan AI-system som kan göra denna bedömning utan att en ögonläkare först behöver titta på varje bild.
En stor metaanalys publicerad 2026 fann en sammanvägd sensitivitet på omkring 96 procent för AI när systemen användes för att upptäcka diabetesretinopati som krävde vidare bedömning.
Här kommer AI alltså ovanligt nära något som faktiskt kan kallas autonom diagnostik.
Men även här är uppgiften mycket snävt definierad.
AI:n behöver inte avgöra varför patienten ser dåligt.
Den behöver inte skilja mellan alla möjliga ögonsjukdomar.
Den ska analysera en viss typ av bild hos en viss typ av patient och avgöra om ett visst sjukdomstillstånd sannolikt finns.
Det är en enorm skillnad.
Patologi är nästan byggt för AI
En patolog kan behöva leta igenom enorma digitaliserade vävnadsbilder efter mycket små områden med cancerceller.
Det är ett område där människor har en uppenbar begränsning: koncentrationen är inte perfekt och ett farligt fynd kan utgöra en försvinnande liten del av hela bilden.
Datorn blir däremot inte trött.
I den välkända CAMELYON-forskningen fick AI-system och patologer leta efter metastaser i lymfkörtlar.
De bästa algoritmerna slog patologerna när läkarna arbetade under tidsbegränsningar.
Skillnaden var särskilt stor för mycket små metastaser.
När en expertpatolog däremot fick obegränsat med tid kunde människans resultat komma upp ungefär till algoritmernas nivå.
Det är ett väldigt talande resultat.
AI:s fördel var inte någon mystisk medicinsk intelligens.
Den var framför allt förmågan att metodiskt söka igenom enorma mängder information utan att tappa uppmärksamheten.
I praktiken är det precis den typ av uppgift som är mest sannolik att automatiseras först.
På hudförändringar är kampen betydligt jämnare
Diagnostik av hudcancer har varit ett av de mest uppmärksammade områdena inom medicinsk AI.
Tidiga studier gav ibland spektakulära rubriker om algoritmer som slog dermatologer.
Men när tekniken testats under mer realistiska förhållanden har resultaten blivit mindre dramatiska.
En prospektiv metaanalys publicerad 2026 fann att dermatologer nådde ungefär 78,6 procents sensitivitet och 75,2 procents specificitet för melanom.
AI låg på cirka 80,9 procents sensitivitet och 75,6 procents specificitet.
Skillnaden var inte statistiskt säkerställd.
AI var alltså i praktiken ungefär lika bra som dermatologerna – inte bevisat bättre.
Det mest intressanta resultatet kan i stället vara kombinationen.
I en studie där dermatologer fick AI-stöd blev resultaten bättre än för både människor och AI på egen hand.
Det är ett mönster som återkommer på flera medicinska områden.
Framtidens stora konkurrent till läkaren kanske därför inte är AI.
Det kan vara läkaren som använder AI.
Vad betyder egentligen 95 procents träffsäkerhet?
Här blir medicinsk AI lätt missvisande.
En studie kan rapportera imponerande sensitivitet, specificitet eller ett högt AUC-värde.
Men för en patient är frågan enklare:
Om AI säger att jag är sjuk – hur sannolikt är det att jag faktiskt är sjuk?
Svaret kan vara betydligt sämre än man tror.
Sensitivitet
Sensitiviteten beskriver hur stor andel av alla verkligt sjuka personer som testet hittar.
Om 100 personer har cancer och systemet hittar 95 av dem är sensitiviteten 95 procent.
Specificitet
Specificiteten beskriver hur stor andel av de friska som korrekt klassificeras som friska.
Om 1 000 personer är friska och 950 får ett korrekt negativt resultat är specificiteten 95 procent.
Problemet uppstår framför allt när sjukdomen är ovanlig.
Tänk dig 10 000 människor där bara en procent faktiskt har sjukdomen.
Det betyder:
100 sjuka.
9 900 friska.
Anta sedan att AI-systemet har både 90 procents sensitivitet och 90 procents specificitet.
AI hittar 90 av de 100 sjuka.
Det låter bra.
Men tio procents fel bland de 9 900 friska innebär samtidigt 990 falskt positiva resultat.
Totalt får därmed 1 080 personer beskedet att något ser misstänkt ut.
Bara 90 av dem är faktiskt sjuka.
Det betyder att mindre än en av tio positiva markeringar motsvarar verklig sjukdom.
I ett screeningsystem kan detta innebära hundratals eller tusentals extra undersökningar, oro, återbesök och i vissa fall biopsier.
Det är därför en imponerande procentsiffra från en AI-studie aldrig räcker för att avgöra om systemet är bra sjukvård.
AI kan fungera på ett sjukhus och misslyckas på ett annat
Ett av de största problemen inom medicinsk AI är vad som händer när modellen lämnar den miljö där den utvecklades.
En algoritm kan exempelvis tränas på bilder från ett stort amerikanskt universitetssjukhus.
Den lär sig inte bara sjukdom.
Den påverkas av vilka patienter som finns där, vilken utrustning som används, hur bilder tas och vilka diagnoser som är vanliga.
Flytta sedan samma modell till ett mindre svenskt sjukhus med annan utrustning och en annan patientgrupp.
Plötsligt kan resultatet försämras.
En systematisk genomgång av radiologiska AI-system fann att omkring 81 procent av algoritmerna presterade sämre vid extern validering än på den egna interna testdatan.
Det är ett fundamentalt problem.
En medicinsk AI måste fungera på de patienter som faktiskt kommer genom dörren – inte bara på människor som liknar träningsmaterialet.
Träningsdata kan skapa medicinsk bias
Samma problem gäller vilka människor som finns representerade i träningsmaterialet.
Om en modell för hudsjukdomar huvudsakligen har sett bilder på ljus hud kan resultaten bli sämre på mörkare hud.
Detta är inte bara ett hypotetiskt problem.
Forskningsöversikter har återkommande funnit sämre prestanda för vissa dermatologiska AI-system på mörkare hudtoner.
Liknande problem kan uppstå för ålder, kön, etnicitet, socioekonomi och sjukdomar som är ovanliga i det material modellen tränats på.
AI skapar därför inte automatiskt mer objektiv medicin.
I vissa fall kan tekniken tvärtom industrialisera de skevheter som redan finns i datan.
En läkare kan göra ett misstag på en patient.
En dåligt validerad algoritm kan göra samma systematiska misstag på hundratusentals patienter.
Det finns också en risk att läkaren litar för mycket på datorn
Ett vanligt argument för medicinsk AI är att problemet försvinner om en läkare alltid granskar svaret.
Så enkelt är det inte.
Människor påverkas av automatiserade rekommendationer.
Om ett system som vanligtvis är mycket träffsäkert plötsligt markerar fel kan läkaren börja tvivla på sin egen bedömning.
Fenomenet brukar kallas automation bias.
I en stor studie fick 140 radiologer diagnostisera olika sjukdomar på lungröntgen med och utan AI-stöd.
När AI gav felaktiga rekommendationer försämrades också radiologernas resultat på flera av uppgifterna.
Det visade något viktigt:
AI plus människa blir inte automatiskt bättre än både AI och människan var för sig.
Om läkaren börjar fungera som en mänsklig stämpel på algoritmens besked försvinner mycket av poängen med den mänskliga kontrollen.
Det framtida vårdsystemet behöver därför inte bara bättre algoritmer.
Läkare behöver också lära sig när algoritmen inte ska följas.
Generell diagnostik är mycket svårare än medicinska test
Den tydligaste bilden av AI:s nuvarande begränsning kommer när systemen får göra mer allmänna medicinska bedömningar.
Generativa AI-modeller kan prestera imponerande på medicinska kunskapsprov och avancerade diagnosfall.
Det betyder inte att de fungerar lika bra när verkliga patienter kommer in genom dörren.
I en stor metaanalys av 83 studier låg den sammanvägda diagnostiska träffsäkerheten för generativ AI runt 52 procent.
AI skilde sig totalt sett inte tydligt från läkare som grupp eller andra medicinska bedömare.
Men när AI jämfördes direkt med specialistläkare presterade specialisterna betydligt bättre.
Det är en helt annan verklighet än rubriker om AI som hittar cancer på en röntgenbild.
Ju öppnare och mer verklighetslik den diagnostiska frågan blir, desto större blir människans fördel.
Läkaren bestämmer vilket test som ens ska göras
Det här är en förmåga som lätt glöms bort i jämförelser mellan AI och läkare.
Om en AI får ett EKG är uppgiften redan definierad.
Någon har bestämt att ett EKG behövs.
Någon har bestämt vilka elektroder som ska användas.
Någon har sett patientens symtom och valt just denna undersökning.
I verklig diagnostik är själva valet av test ofta lika viktigt som testresultatet.
En patient med bröstsmärta kan behöva EKG omedelbart.
En annan patient med nästan samma beskrivning kanske behöver helt andra undersökningar.
En tredje kan ha ett akut livshotande tillstånd trots ett normalt första test.
Läkaren behöver hela tiden bedöma sannolikheter och risk.
Vilken diagnos är vanligast?
Vilken är farligast att missa?
Hur mycket ska ett negativt prov påverka bedömningen?
Behöver patienten läggas in trots normala tester?
När bör man sluta utreda?
Det finns sällan ett perfekt facit.
Medicinsk information motsäger ofta sig själv
Ett annat problem är att verkliga patienter inte levererar perfekta dataset.
En röntgenbild kan se misstänkt ut samtidigt som blodproverna talar emot sjukdomen.
Ett AI-system kan upptäcka en möjlig hjärtsjukdom i ett EKG medan patienten saknar alla relevanta symtom.
En undersökning kan hitta en förändring som är verklig men helt betydelselös.
Detta är vardag i medicinen.
Ju känsligare diagnostiken blir, desto fler sådana fynd kommer dessutom att upptäckas.
Att kunna hitta en avvikelse är därför inte alltid samma sak som att hjälpa patienten.
I vissa situationer är det svåraste medicinska beslutet inte att beställa ytterligare ett test.
Det är att förstå när man inte behöver göra något alls.
Om AI ser sjukdom tidigare kan det ändå förändra medicinen
Alla dessa begränsningar gör inte utvecklingen mindre betydelsefull.
Tvärtom.
Om ett vanligt EKG kan avslöja statistiska signaler om sjukdom flera år innan en människa normalt skulle upptäcka den kan själva betydelsen av ett medicinskt test förändras.
En undersökning som i dag görs av ett visst skäl kan samtidigt fungera som screening för helt andra tillstånd.
En mammografibild kan sorteras automatiskt innan radiologen börjar arbeta.
Digitala patologiprover kan genomsökas efter mikroskopiska metastaser.
Näthinnebilder kan granskas direkt när de tas.
Problemet för vården blir då inte längre om AI kan hitta något.
Den större frågan blir:
Vad ska vården göra med allt som AI hittar?
Fler upptäckta avvikelser betyder inte automatiskt bättre hälsa.
För att en ny diagnostisk metod verkligen ska vara värdefull behöver tidigare upptäckt leda till behandling eller uppföljning som hjälper patienten.
Det är därför randomiserade studier och kliniska resultat är så mycket viktigare än tävlingar om vem som tolkar en bild bäst.
Den verkliga prövningen är om patienterna får bättre vård
Det finns redan mängder av medicinska AI-system som kan visa höga resultat i efterhandsanalyser.
Men den avgörande frågan är en annan:
Vad händer när de införs i sjukvården?
Hittas fler behandlingsbara sjukdomar?
Missas färre farliga tillstånd?
Behöver färre patienter genomgå onödiga undersökningar?
Blir väntetiderna kortare?
Överlever fler patienter?
Blir arbetsbelastningen lägre?
Här är forskningen fortfarande betydligt tunnare än mängden spektakulära AI-resultat kan få det att verka.
En metaanalys från 2026 av randomiserade AI-studier inom hjärt-kärlvård omfattade närmare 1,7 miljoner patienter.
Många studier visade förbättringar i processer eller mellanliggande mått.
Men evidensen var betydligt svagare när forskarna tittade på verkligt viktiga kliniska resultat.
Det är en påminnelse om att den bästa algoritmen inte automatiskt skapar den bästa vården.
Vem ansvarar när AI har fel?
När AI blir en faktisk del av diagnostiken uppstår också en juridisk och praktisk fråga som inte finns i en laboratoriestudie.
Vem ansvarar när systemet missar cancer?
Tillverkaren?
Sjukhuset?
Läkaren som följde rekommendationen?
Den som köpte in systemet?
I Sverige har Läkemedelsverket fått ansvar för tillsyn över medicintekniska AI-system som omfattas av relevanta medicintekniska regelverk.
EU:s AI-regler innebär dessutom särskilda krav för AI-system som bedöms som högrisk.
Men ansvarskedjan blir inte enkel bara för att systemet är reglerat.
Tillverkaren ansvarar för att produkten fungerar som avsett.
Vårdgivaren ansvarar för hur den införs och används.
Och vårdpersonal arbetar fortfarande under sitt professionella ansvar.
Ju mer avancerade systemen blir, desto viktigare blir därför dokumentation, uppföljning och tydliga gränser för när människan måste ingripa.
Kommer AI då att ersätta läkare?
Inte på det sätt frågan ofta formuleras.
Det mest sannolika är inte att en fullt autonom AI plötsligt tar över hela läkarbesöket.
I stället försvinner diagnostiska arbetsuppgifter en efter en in i tekniken.
AI sorterar mammografierna.
AI analyserar EKG.
AI markerar misstänkta celler i patologibilder.
AI granskar näthinnor.
AI hittar patienter som borde utredas för en viss sjukdom.
AI kanske sammanfattar journalen och föreslår vilka diagnoser läkaren bör överväga.
Varje sådan förändring kan vara relativt liten.
Tillsammans kan de förändra läkaryrket radikalt.
Läkaren går från att själv leta efter varje avvikelse till att i allt högre grad bedöma och agera på information som algoritmer redan har sorterat.
Det är därför frågan om AI blir ”bättre än läkare” egentligen har två helt olika svar.
På frågan:
Kan AI bli bättre än läkare på vissa medicinska test?
är svaret redan ja.
På frågan:
Kan AI ersätta läkaren som samlar hela patientens situation och ställer den slutliga diagnosen?
är svaret fortfarande inte i närheten på samma generella nivå.
Det kan ändras.
Men för att komma dit räcker det inte att skapa en algoritm som ser fler mönster än människan.
AI måste kunna avgöra vilka frågor som är relevanta, vilka tester som behövs, hur motstridiga resultat ska vägas, när ett fynd betyder något och när det inte gör det – och hur stor osäkerhet som är acceptabel när en verklig människas hälsa står på spel.
Det är en betydligt större uppgift än att slå en läkare på ett test.
Och just därför kan AI bli övermänsklig på allt fler delar av diagnostiken långt innan den blir en bättre läkare.