Gepostet am 11.12.2025
Datenqualität für KI-Modelltraining: Welche Governance-Standards Medien brauchen

Glasklares Wasser ist keine Selbstverständlichkeit: Es ist das Resultat durchdachter Prozesse, vorausschauenden Handelns und unermüdlicher Pflege. Illustration: Mit KI erstellt.
Mehr Effizienz durch Künstliche Intelligenz: Das trifft vor allem dann zu, wenn die Datenqualität stimmt. Ist die Datenbasis für ein KI-Projekt fehlerhaft, veraltet oder unvollständig, versagen selbst die besten Modelle. Aus dem erhofften Effizienzgewinn wird schnell das Gegenteil, weil Entscheidungen im schlimmsten Fall auf erfundenen Informationen beruhen.
Das hat Folgen: ein Newsticker, der ständig falschen Alarm schlägt, oder Artikel, die sich auf verzerrte Informationen stützen. Für Medienhäuser, die vom Vertrauen ihres Publikums leben, ist ein solcher Verlust an Glaubwürdigkeit fatal. Wer das vermeiden will, braucht proaktive Data Governance.
Warum Data Governance für KI-Modelle entscheidend ist
Zwei zentrale Herausforderungen generativer KI-Systeme sind Verzerrungen (Biases) und Halluzinationen. Beide entstehen aus der Funktionsweise von Sprachmodellen. Architektur und Pre-Training eines Modells können Anwender:innen kaum beeinflussen, die verarbeiteten Daten dagegen schon. Und weil gut strukturierte Daten in jeder Phase nützen und Zugang zu KI-Tools heute alle haben, wird konsequente Data Governance zum Wettbewerbsvorteil.
Biases: Woher sie stammen und an welchen Stellen sie wirken
Sprachmodelle arbeiten nach dem Wahrscheinlichkeitsprinzip. Wie sie diese Wahrscheinlichkeiten berechnen, hängt vom Training ab. Der Lebenszyklus eines Modells beginnt also lange vor dem eigentlichen Einsatz. Verzerrungen können an drei Punkten entstehen.
Im Pre-Training
Für das Pre-Training werden Modelle meist mit Daten aus dem Internet trainiert. Diese Daten sind von sozialen und kulturellen Voreingenommenheiten geprägt. KI-Modelle übernehmen solche Verzerrungen als Grundlage ihrer Wahrscheinlichkeitsberechnung. Der Output ist zwangsläufig davon gefärbt.
Im Finetuning
KI-Systeme kombinieren Muster, um überzeugende Antworten zu erzeugen. Selbst bei fehlerfreier Datenbasis kann dabei falscher Output entstehen. Halluzinationen gelten deshalb als schwer lösbares Problem. Falsch gelabelte Daten können sogar gute Gewichtungen aus dem Pre-Training überschreiben. Sorgfältige Datenaufbereitung steuert bedingt gegen, ersetzt aber keine fortlaufende Kontrolle.
In der Inferenz
Im laufenden Betrieb greifen Modelle auf Echtzeitquellen zurück: unternehmenseigene Archive, Compliance-Dokumente, Nachrichten-Feeds oder Live-Ticker. Auch diese Quellen tragen eigene Verzerrungen in sich und prallen mit den Vorannahmen des Modells zusammen. Im Medienkontext ist das besonders heikel, weil sich Themen rasant ändern: Ein Modell, das nicht nachjustiert wird, beschreibt eine Welt von gestern.
Worauf Redaktionen bei der Datenpflege achten sollten
Eine Datenbank zu pflegen heißt, kontinuierlich an einem lebendigen Datensatz zu arbeiten, bei Echtzeitdaten ebenso wie beim Finetuning-Datensatz.
Vollständigkeit und Konsistenz
Lückenhafte oder uneinheitliche Daten verwirren ein Modell und öffnen Raum für Halluzinationen. Schon ein Tippfehler kann den Output verzerren. Gute Datensätze folgen einer einheitlichen Nomenklatur und lassen keine Lücken an Stellen, die ein Modell nicht selbst füllen sollte.
Repräsentativität und Fairness
Jede Quelle ist ein Produkt ihrer Entstehung. Historische, redaktionelle oder politische Tendenzen wirken unbewusst ins Modell hinein. Ganz auflösen lässt sich das nicht, Entwickler:innen können sich aber bewusst für Quellen mit größerer Diversität entscheiden.
Aktualität und Relevanz
Veralteter oder inkompatibler Input macht den Output schnell unbrauchbar. Medienhäuser sollten darauf achten, dass die Datenbasis journalistischen Qualitätsstandards entspricht und vor der Inferenz kuratiert wird.
Herkunft und Sicherheit
Wer nicht weiß, woher Input-Daten stammen, riskiert Lizenzverstöße und Folgefehler. Idealerweise lässt sich die Herkunft lückenlos belegen, inhaltlich wie juristisch.
Vier Ratschläge für mehr Datenrichtigkeit
Gute Data Governance zeigt sich am Ende in der Richtigkeit der Daten. Vier Ansätze helfen dabei.
Kein KI-Output ohne menschliche Prüfung
Jeder KI-Workflow gehört von einem Menschen kontrolliert. Doppel-LLM-Architekturen und RAG-Verfahren unterstützen bei der Vorarbeit.
Datenbankpflege mit KI-Assistenten
Auto-Complete-Werkzeuge sorgen für einheitliche Eingabe und Verschlagwortung in Archiven. KI-Tools erkennen problematische Daten und reduzieren so manuelle Arbeit.
Data Governance ist Chefsache
Die Verantwortung für eine hochwertige Datengrundlage darf nicht allein bei der IT liegen. Wer Datenpflege als essenzielle Tätigkeit versteht, gibt ihr Raum im Arbeitsalltag, etwa durch Schulungen und klare Zuständigkeiten.
Biases abmildern mit Prompt-Engineering
Prompt-Engineering ersetzt keine sauberen Trainingsdaten, wirkt aber sofort und flexibel. Gezielte, einheitliche Anweisungen bringen ein Modell zu mehr Neutralität.
Fazit: Warum die Datenqualität mindestens so wichtig ist wie die Modellgröße
Ein leistungsstarkes Sprachmodell fängt allein kein Datenchaos ein. Sind die Daten dagegen gut gepflegt, erzielt schon ein kleines Modell den gewünschten Effekt. Weil Datengrundlage und Modellentscheidungen so eng zusammenhängen, muss ein KI-System samt Datenbasis laufend überprüft und gepflegt werden.
Gute Daten schlagen große Modelle. Jedenfalls meistens: Ein Small Language Model mit hochwertiger Datenbasis übertrifft ein Large Language Model mit mangelhaften Daten. Für Medienhäuser zahlt sich die Investition in Data Governance direkt in verlässlicheren, glaubwürdigeren Produkten aus.
FAQ: Datenqualität beim KI-Einsatz in Medienhäusern
Was bedeutet „Catastrophic Forgetting"?
Falsch oder inkonsistent gelabelte Daten können beim Finetuning bessere, also genauere Gewichtungen aus dem Pre-Training überschreiben. Dieses „katastrophale Vergessen" führt dazu, dass selbst ein leistungsstarkes Large Language Model unzuverlässig wird, wenn es mit einer instabilen Datenbasis arbeitet.
Können kleine Modelle große schlagen?
Ja, sofern die Daten stimmen. Mit gut gepflegten Daten arbeiten kleinere Small Language Models (SLMs) oft deutlich effizienter als ressourcenaufwendige Large Language Models (LLMs), bei geringerem Rechenbedarf. Ein SLM mit hochwertiger Datenbasis kann ein LLM mit mangelhaften Daten übertreffen.
Was passiert bei der Inferenz, wenn interne und externe Quellen kollidieren?
Im laufenden Betrieb bezieht ein Modell Wissen aus internen Archiven und Compliance-Dokumenten ebenso wie aus externen Nachrichten-Feeds oder Live-Tickern. Jede dieser Quellen wurde bereits gefiltert und selektiert und bringt eigene Vorannahmen mit. Treffen sie aufeinander, muss das Modell zwischen widersprüchlichen Vorannahmen vermitteln, was den Output verzerren kann.
Warum ist Datenaktualität im Medienkontext besonders kritisch?
Themen und Kontexte verändern sich im Journalismus rasant. Ein Modell, das nicht regelmäßig nachjustiert wird, bildet die Nachrichtenlage nur in dem Ausschnitt ab, der in seinen Quellen vorhanden ist, und beschreibt damit schnell eine Welt von gestern. Regelmäßige kuratorische Pflege der Datenbasis hält es auf dem aktuellen Stand.
Geschrieben von

Vincent Broy
Werkstudent
Vincent Broy war von 2025 bis 2026 als Werkstudent im KI-Kompetenzzentrum Medien (KI.M) tätig. Mit seinem akademischen Hintergrund in Science and Technology Studies an der Technischen Universität München befasst er sich schwerpunktmäßig mit den Wechselwirkungen zwischen Technologie und Gesellschaft.


