Camathias C, Papp K, Betschart P, Speth B, Valderrabano V, Ammann E. Human medical documentation significantly outperforms ChatGPT-4o in critical clinical dimensions: A blinded comparative assessment in paediatric orthopaedics. Knee Surg Sports Traumatol Arthrosc. 2026 May;34(5):1910-1916.
Eine prospektive, randomisierte, verblindete Level-I-Studie, die in der Fachzeitschrift „Knee Surgery, Sports Traumatology, Arthroscopy“ veröffentlicht wurde, verglich von ChatGPT-4o erstellte Anamnesezusammenfassungen mit den von Ärzten in einer kinderorthopädischen Praxis angefertigten Unterlagen. Zwanzig aufeinanderfolgende Konsultationen mit Kindern und Jugendlichen, die mit Kniebeschwerden vorstellig wurden, wurden transkribiert und sowohl von den Ärzten als auch von ChatGPT-4o unabhängig voneinander zusammengefasst. Anschließend bewerteten drei Fachärzte für Orthopädie die Qualität der Dokumentation anhand von acht vordefinierten klinischen Kriterien.
Die Studie zeigte, dass die von Menschen erstellten Unterlagen die von KI generierten Zusammenfassungen in der Gesamtqualität deutlich übertrafen, insbesondere in klinisch kritischen Bereichen wie zeitlicher Konsistenz, räumlicher Konsistenz, Genauigkeit der Unfallbeschreibungen und dem allgemeinen klinischen Eindruck. Zwar erstellte ChatGPT-4o Zusammenfassungen mit akzeptablem Schreibstil und dokumentierte frühere Maßnahmen vergleichbar wie die Ärzte, doch führte es häufig zeitliche Inkonsistenzen ein und ließ wichtige Details zu den Verletzungsmechanismen aus. Die Autoren kommen zu dem Schluss, dass aktuelle große Sprachmodelle die medizinische Dokumentation durch Menschen in der Kinderorthopädie noch nicht ersetzen können und einer sorgfältigen klinischen Überwachung bedürfen. Stattdessen sprechen die Ergebnisse für einen hybriden Arbeitsablauf, bei dem KI als Hilfsmittel dient, während die endgültige klinische Beurteilung weiterhin bei medizinischem Fachpersonal liegt.
Unter den Mitautoren trug Professor Victor Valderrabano zur Konzeption und wissenschaftlichen Validierung dieser vergleichenden Auswertung bei und half dabei, die aktuellen Fähigkeiten und Grenzen künstlicher Intelligenz in der orthopädischen klinischen Dokumentation zu bewerten. Seine Beteiligung unterstreicht die wachsende Bedeutung evidenzbasierter Forschung für die Definition der angemessenen Rolle von KI-Technologien in der routinemäßigen klinischen Praxis.