01.10.2026
Retrieval-Augmented Generation als Brücke zwischen KI, biomedizinischen Daten und klinischen Infrastrukturen
Schematische Darstellung eines RAG-Grounding-Workflows: Von der QSchematische Darstellung eines RAG-Grounding-Workflows: Von der Quellenkuratierung über Retrieval und Kontextbildung bis zur quellenverknüpften LLM-Antwort.
Wie lassen sich Large Language Models in Forschung und Versorgung so einsetzen, dass ihre Antworten nicht nur plausibel klingen, sondern auch auf nachvollziehbaren, aktuellen und kontrollierbaren Datenquellen basieren?
Ein einfaches Beispiel macht die Herausforderung deutlich: Ein Sprachmodell allein „weiß“ nicht, welche Version einer Leitlinie aktuell ist, welche Laborwerte zu welchem Zeitpunkt erhoben wurden oder ob ein bestimmter Zellmarker in einem konkreten Gewebe tatsächlich relevant ist. Retrieval-Augmented Generation (RAG) setzt genau hier an. Bevor eine Antwort erzeugt wird, werden gezielt passende Informationen aus geeigneten Daten- und Wissensquellen abgerufen und dem Modell als zusätzlicher Kontext zur Verfügung gestellt. So kann beispielsweise eine Zelltyp-Annotation mit aktuellen Marker-Datenbanken oder eine klinische Zusammenfassung mit konkreten Befunden, Arztbriefen und Leitlinien verknüpft werden.
In der neuen Publikation „From Fine-Tuning to Grounding: Retrieval-Augmented Generation for Biomedical LLMs in Research and Clinical Data Infrastructures“ untersuchen Mahdi Enayati, Vishnu Priya, Eveline Prochaska, Kathrin Sobe und Markus Wolfien das Potenzial solcher Ansätze für die biomedizinische Forschung und klinische Dateninfrastrukturen.
„Für uns ist RAG weit mehr als eine technische Erweiterung eines Chatbots. Es geht darum, generative KI mit den Daten, dem Wissen und den Regeln zu verbinden, die in Forschung und Versorgung tatsächlich relevant sind“, sagt Markus Wolfien. „Genau darin liegt die Idee einer Grounding-Infrastruktur: Antworten sollen nicht nur gut formuliert sein, sondern auf konkreten Quellen, ihrem Kontext und ihrer Herkunft beruhen und unter den richtigen Bedingungen genutzt werden können.“
Die Arbeit verbindet dabei Perspektiven aus mehreren Arbeitsbereichen: Data Science und Bioinformatik, Interoperabilität und medizinische Datenintegration sowie Künstliche Intelligenz und Large Language Models. Damit reicht das Spektrum von der Analyse komplexer Omics- und Single-Cell-Daten über FHIR- und OMOP-basierte Datenstrukturen bis hin zu Fragen der Evaluation, Nachvollziehbarkeit und Governance von KI-Systemen. Zugleich spiegelt die Publikation die enge Verbindung dieser Themen mit ScaDS.AI Dresden/Leipzig wider.
Anhand zweier unterschiedlicher Anwendungsszenarien (Single-Cell- und Omics-Interpretation sowie der Integration von elektronischen Patientenakten, PDF-Dokumenten und klinischen Freitexten) zeigt die Arbeit, dass biomedizinische RAG-Systeme nicht nach einem einheitlichen Schema entwickelt werden können. Während im Forschungsbereich etwa biologische Plausibilität und aktuelle Wissensquellen entscheidend sind, kommen im klinischen Umfeld zeitlicher Kontext, Datenherkunft, Zugriffsrechte, Sicherheit und Governance hinzu.
Ein zentraler konzeptioneller Beitrag ist deshalb die Unterscheidung verschiedener Formen des Groundings. Neben der faktischen Verankerung in externem Wissen werden auch Kontext, Analyseergebnisse, Herkunft der Informationen, normative Vorgaben und die Einbettung in konkrete Arbeitsabläufe berücksichtigt. Entscheidend ist damit nicht nur, ob ein KI-System eine richtige Antwort erzeugt, sondern auch, worauf diese Antwort basiert, in welchem Kontext sie gilt und wie sie überprüft werden kann.
Die Publikation unterstreicht damit eine zentrale Entwicklung für den Einsatz generativer KI in der Medizin: Entscheidend wird künftig nicht allein die Leistungsfähigkeit einzelner Modelle sein, sondern vor allem, wie gut KI, interoperable Dateninfrastrukturen, domänenspezifisches Wissen und Governance miteinander verbunden werden.
Publikation:
Enayati M, Priya V, Prochaska E, Sobe K, Wolfien M. From Fine-Tuning to Grounding: Retrieval-Augmented Generation for Biomedical LLMs in Research and Clinical Data Infrastructures. Sci. 2026. DOI: https://doi.org/10.3390/sci8090266