In einer vom Zentralinstitut für Seelische Gesundheit (Zi) geleiteten Studie konnten große KI-Sprachmodelle psychische Symptome fast ebenso gut erkennen wie junge Psychiater ohne große Berufserfahrung. Während sich viele frühere KI-Studien auf Diagnosen oder standardisierte Fragebögen konzentrierten, ist diese Studie die erste, die systematisch untersucht, wie sich große Sprachmodelle (LLMs) bei der komplexen Aufgabe der psychopathologischen Beurteilung im Vergleich zu praktizierenden Klinikern schlagen.
LLMs gegen 108 Fachärzte
Die Aufgabe für zehn LLMs bestand darin, alle 100 Merkmale des sogenannten "AMDP-Systems" zu bewerten. Das AMDP-System ist eine in der deutschsprachigen Psychiatrie weitverbreitete Methode zur systematischen Beschreibung psychischer Symptome nach festgelegten Kriterien. Zum Vergleich haben 108 praktizierende Ärzte und Psychologen aus drei psychiatrischen Kliniken dieselben Bewertungen durchgeführt. Die meisten Teilnehmer befanden sich noch am Anfang ihrer klinischen Laufbahn.
Während den Sprachmodellen ausschließlich die schriftlichen Transkripte zur Verfügung standen, konnten die Kliniker die vollständigen Video- und Audioaufzeichnungen sichten, um eine möglichst realistische Beurteilung zu gewährleisten.
Die beiden leistungsstärksten Modelle - GPT-5.1 und Gemini-3-Pro-Preview - erreichten eine durchschnittliche Genauigkeit in ihren Diagnosen von 72 Prozent, während die klinische Vergleichsgruppe nur 68 Prozent erreichte.
Die Ergebnisse zeigen das Potenzial von KI-gestützten Entscheidungshilfen, deuten jedoch nicht darauf hin, dass diese Hilfsmittel das medizinische Urteilsvermögen von erfahrenen Ärzten ersetzen können.
Quelle: pte










