In der Rheumatologie wird künstliche Intelligenz (KI) engagiert diskutiert. Chronische Erkrankungen begleiten Menschen über Jahrzehnte, sie hinterlassen Spuren in Bild- und Labordaten. Trotz hervorragender Substanzen gibt es oft Unsicherheiten bei Therapieentscheidungen. Dies macht das Fach zu einem naheliegenden Anwendungsfeld.
Kein KI-Tool ist so präsent wie große Sprachmodelle (Large Language Models, LLMs). Eine Arbeit in Rheumatology International verglich ChatGPT-4 mit Rheumatolog:innen bei der Differenzialdiagnose: Insgesamt lag das Modell ähnlich häufig richtig wie die Fachleute, bei gesicherten entzündlich rheumatischen Erkrankungen lag die richtige Diagnose in 86 % der Fälle unter den ersten 3 Vorschlägen des Modells (gegenüber 74% bei Fachleuten). Bei nichtentzündlichen Fällen schnitt das Modell deutlich schlechter ab und neigte zur Überschätzung entzündlicher Ursachen.1
Eine kanadische Studie in Arthritis & Rheumatology fand: Patient:innen bewerteten KI- und arztgenerierte Antworten als nahezu gleichwertig und konnten kaum unterscheiden, welche von der Maschine stammten. Die beteiligten Rheumatolog:innen jedoch beurteilten die KI-Antworten in puncto Genauigkeit signifikant schlechter (6,48 versus 9,08 auf einer Zehnerskala). Genau hier liegt das Risiko: Die Lücke, die Fachleute erkennen, bleibt Lai:innen verborgen. LLMs eignen sich heute als Hilfsmittel für Entwürfe, Patienteninformation und Triage-Unterstützung – nicht als autonome Quelle medizinischen Rats.2
Beginnen wir dort, wo KI im Alltag am greifbarsten ist. Wer regelmäßig Handröntgen über Jahre vergleicht, kennt das Dilemma: Das Auszählen von Erosionen und Gelenkspaltverschmälerungen nach Sharp/van der Heijde ist präzise gemeint, in der Praxis aber zeitraubend und von Befunder:in zu Befunder:in unterschiedlich. Hier entlastet maschinelles Lernen – nicht als Ersatz des geübten Blicks, sondern als unermüdlicher Zweitbefunder (Abb.). Eine praxisnahe Übersicht im ACR-Journal Arthritis & Rheumatology benennt die Felder, in denen das bereits funktioniert: das Erkennen von Erosionen im konventionellen Röntgen, die Vorhersage künftiger Krankheitsaktivität und sogar das Aufspüren des Halo-Zeichens in der Temporalarterien-Sonografie.3
Der internationale RA2-DREAM-Wettbewerb in JAMA Network Open zeigte, dass Algorithmen den Gelenkschaden an 674 Röntgenserien nahe an Expertenwerten quantifizieren können.4 Eine finnische Studie in Rheumatology (Oxford) validierte ein Modell extern an 205 Patient:innen und erfasste damit auch die Progression über Jahre.5 Praktisch bedeutet das ein reproduzierbares Verlaufs-Scoring, das Zeit spart und die Vergleichbarkeit erhöht. Das offizielle Positionspapier des American College of Rheumatology (ACR) bestätigt: Solche Tools zur Bildklassifikation sind bereits verfügbar – stets als Unterstützung, nicht als Autopilot.6
Das größte Versprechen ist die richtige, frühe Medikamentenwahl. Eine österreichische Arbeitsgruppe um Dubravka Ukalovic nutzte Daten des Biologika-Registers BioReg, um für 5 verschiedene Biologika das Risiko eines Nichtansprechens vorherzusagen. Bei 1.397 Patient:innen und 19 Variablen erreichten die besten Modelle je Substanz Werte (AUROC) zwischen 0,66 (Abatacept) und 0,84 (Certolizumab). Besonders wertvoll: Erklärbare KI machte sichtbar, dass einzelne Einflussfaktoren je nach Wirkstoff sogar gegensätzlich wirken können.7
Eine deutsche Untersuchung aus Erlangen in Journal of Clinical Medicine ergänzt das Bild. An 154 RA-Behandelten sagte ein Gradient-Boosting-Modell das initiale Ansprechen nach 6 Monaten mit einer AUCROC von 0,91 voraus, wobei der initiale DAS28-ESR als wichtigster Prädiktor fungierte.8 Solche Ergebnisse stammen jedoch meist aus einzelnen Zentren mit begrenzten Fallzahlen und retrospektivem Design – prospektive, multizentrische Validierung fehlt noch. Ein Überblick in Nature Reviews Rheumatology zeigt aber, dass multimodale Ansätze, etwa molekulare Modelle auf Basis synovialer RNA-Profile, bereits Krankheitssubtypen und Therapieansprechen vorhersagen können.9
Kritische Stimmen warnen davor, KI-Vorhersagen unreflektiert zu übernehmen. Probleme sind u. a. Verzerrungen in Trainingsdaten, mangelnde Generalisierbarkeit über Populationen hinweg, unklare Entscheidungswege (Black-Box-Problem) und potenzielle Verstärkung gesundheitlicher Ungleichheiten.
Gemeinsamer Fallstrick aller Anwendungen: Modelle, die an einer Kohorte gut funktionieren, können an einer anderen scheitern. Externe Validierung ist Pflicht. Die 2024 im BMJ veröffentlichte TRIPOD+AI-Leitlinie setzt erstmals verbindliche Standards für die transparente Berichterstattung von Vorhersagemodellen – eine Reaktion darauf, dass viele Studien diese bislang nicht erfüllen. Ohne Transparenz bleibt das Black-Box-Problem bestehen.10
Das ACR fordert in seinem Positionspapier, dass Algorithmen frei von schädlicher Verzerrung, datenschutzkonform, geprüft und zertifiziert sein müssen – und keinesfalls den Versorgungszugang einschränken dürfen.6 Die EULAR-Empfehlungen zum Umgang mit Big Data samt zugrunde liegendem Literaturreview ergänzen methodische Leitplanken: saubere Datenerhebung, Datenschutz, adäquate Berichterstattung und vorsichtige Interpretation.11, 12
Medizinische KI unterliegt der EU-Medizinprodukteverordnung und gilt im europäischen AI Act meist als Hochrisikoanwendung. Jedoch berücksichtigen auch dieser und die FDA-Regeln autonome Agenten bislang nur teilweise. Unklar bleibt beispielsweise, wer bei Fehlern haftet – die Entwickler:innen, das Krankenhaus oder die behandelnden Ärzt:innen? Somit erscheinen heutige Gesetze bisher nur unzureichend auf KI vorbereitet.
Die Evidenz zeigt erhebliche Chancen der KI in der Rheumatologie: KI ersetzt Rheumatolog:innen nicht, sondern verschiebt ihre Aufmerksamkeit dorthin, wo sie gebraucht wird. Das ACR betont, dass KI ein mächtiges Werkzeug ist, aber kein Ersatz für das klinische Urteil – die Verantwortung bleibt beim Menschen.6
Präzisere Diagnostik, personalisierte Therapieplanung, bessere Analysen langfristiger Krankheitsverläufe, verbesserte Erreichbarkeit für Patient:innen, beschleunigte Forschung und Entlastung von Routineaufgaben – durch den Einsatz von KI entsteht etwas Wertvolles: Zeit – für das aufklärende Gespräch, das geduldige Abwägen, das Gesamtbild aus Erfahrung und Empathie. Gleichzeitig wäre es ein Fehler, die Entwicklung zu verschlafen: KI misst heute schon präziser und macht Muster sichtbar, die dem Einzelnen entgehen.
Substanzielle Risiken müssen bewusst gemacht und vermieden werden: fehlervermittelnde Kaskaden, Scheinsicherheit und Sicherheitslücken.
Der tragfähige Mittelweg besteht darin, KI als Assistenzsystem zu nutzen, dessen Vorschläge man versteht, prüft und einordnet. Für Österreich ist das BioReg-Register mit heimischen Daten und Forscher:innen ein gutes Zeichen, die Entwicklung aktiv mitzugestalten.7 Die Technik wird besser werden – die entscheidende Kompetenz bleibt aber menschlich: zu wissen, wann man dem Algorithmus folgt, wann man widerspricht und wie man seine Ergebnisse so übersetzt, dass am Ende ein Mensch eine gute Entscheidung für einen anderen Menschen trifft.