Jump to content

Gepostet am 16.07.2026

Embeddings: Mit semantischer Suche Archivinhalte für KI nutzbar machen

Ein heller Pilz mit gesprenkelter Kappe, Manschette am Stiel und knolliger Basis steht links auf dem Waldboden; im Hintergrund dicht stehende Baumstämme über Laub, Farnwedeln und abgestorbenen Ästen, alles in dunklem Blaugrau.

Giftig oder ungiftig? Je nach Pilz ist die Antwort darauf gar nicht so leicht zu bestimmen. Ein Sprachmodell kann dabei helfen – vorausgesetzt, die notwendigen Informationen sind gut zugänglich. Illustration: Mit KI erstellt.

Technik

Ein Embedding macht Inhalte nach Bedeutung auffindbar statt nach Wortlaut. Ohne Modifikationen können Sprachmodelle das nicht leisten, aber auch mit Anpassungen schwanken die Ergebnisse. Wovon die Qualität am Ende abhängt.

In KI-Chatbots wie ChatGPT oder Claude darf man ungenau fragen und bekommt trotzdem Passendes zurück. Wer ein altes Archiv durchsuchen will, muss dagegen genau den Begriff treffen, den die Autor:in damals verwendet hat. Das macht sie zwar nützlich, wenn man bereits tief in der Materie ist, aber weniger, wenn man gar nicht weiß, was in diesen Inhalten eigentlich steckt.

Kein Wanderführer dieser Welt hat zum Beispiel eine präzise Antwort auf die Frage: „Suche eine passende Wanderroute für mich und meine vierjährige Tochter mit kurzen Wegen, auf der wir unterwegs Kaiserschmarrn essen können.“ Was hinter der Anfrage (vermutlich) eigentlich steckt: eine leichte Rundtour mit kaum Höhenmetern und einer guten Einkehrmöglichkeit. Eine Stichwortsuche vergleicht Zeichenketten und findet sie nicht. Auch deshalb, weil Antworten auf sehr spezifische Fragen so gut wie nie ausbuchstabiert sind.

Was ist ein Embedding?

Ein Embedding ist eine Zahlenreihe, die ein KI-Modell aus einem Textabschnitt herausliest und die dessen Bedeutung mathematisch abbildet. Inhalte mit ähnlichem Sinn ergeben ähnliche Zahlenreihen, sogenannte Vektoren. Sie werden dadurch vergleichbar, ohne dass ein einziges Wort übereinstimmen muss.

Das klassische Beispiel für ein Embedding ist eine Landkarte im multidimensionalen Raum. Jeder Abschnitt wird einer Koordinate zugeordnet: „Für kleine Kinder machbar“ und „kurze Etappe ohne ausgesetzte Stellen“ liegen in derselben Nachbarschaft. Eine Anfrage wird auf dieselbe Karte gelegt. Das System sucht vergleichbare Nachbarschaften und findet so die Antwort auf die eigentliche Frage. Diese Suche nach Sinnverwandtschaft statt nach begrifflicher Übereinstimmung nennt man semantische Suche.

Dabei arbeiten zwei KI-Modelle miteinander. Das Embedding-Modell schreibt nichts, es sortiert nur. Die Antwort formuliert das Sprachmodell aus den Nachbarschaften, die das erste ausgewählt hat. 

Warum normale Chatbots das nicht leisten können

Warum lädt man einen Wanderführer dann nicht bei ChatGPT hoch? Für ein einzelnes Buch mag das je nach Länge gerade so funktionieren, für einen gewachsenen Bestand nicht. KI-Modelle haben ein begrenztes Kontextfenster, und ein Archiv passt selten dort hinein.

Chatbots weisen User nicht darauf hin, dass dieses Fenster bereits ausgereizt ist. Zusätzliches Expertenwissen, das aus einem Buch hinzugefügt wird, kann dann verloren gehen und Details sind die ersten Dinge, die ausgelassen werden. Genau die sind aber entscheidend, wenn es um spezifische Anfragen wie im Ausgangsbeispiel geht.

Beim Embedding wird das Archiv einmal in Abschnitte zerlegt und dauerhaft als Zahlenreihen gespeichert. Bei einer Anfrage geht dann nicht der ganze Bestand an das Sprachmodell, sondern nur die Handvoll Abschnitte, die in der Nachbarschaft der Frage liegen. Das Kontextfenster ist damit kein Problem mehr, weil man es gar nicht ausreizt. Das Sprachmodell arbeitet nun mit fünf einschlägigen Passagen statt mit fünfhundert Seiten, in denen die entscheidende irgendwo untergeht.

Je mehr Material auf einmal verarbeitet wird, desto eher verschwindet der Satz über das besondere gastronomische Angebot auf der Alm, die auf der Tour liegt. Oder: Man findet sich mit Kind und Kegel plötzlich doch auf einer Route, für die man Wandererfahrung braucht.

Probleme wie diese treten nicht nur im Wanderkontext auf. Wer aus den Archivdaten einer Lokalzeitung die Berichterstattung zum Volksfest von 1967 rekonstruieren will, kann auf dieselbe Herausforderung stoßen. Plötzlich ist von der falschen Location die Rede, zum Beispiel deshalb, weil das Volksfest im Hier und Jetzt an einem anderen Ort stattfindet und das Modell versucht, eine inhaltliche Lücke zu schließen.

Embedding auf dem Prüfstand: TrekKI aus dem KI-Reallabor

Das KI-Reallabor hat gemeinsam mit dem Rother Bergverlag und dem Michael Müller Verlag den Prototypen TrekKI gebaut. Das System erprobt, wie eine Reiseassistenz mit einem agentischen System in Zukunft aussehen könnte.

TrekKI läuft vollständig auf eigener Hardware. Ein lokales Embedding-Modell überführt die Inhalte der Verlage in semantisch durchsuchbare Daten. Das eigentliche Sprachmodell greift über verschiedene Werkzeuge auf diese Inhalte zu und reichert sie mit zusätzlichem Kontext aus frei verfügbaren Quellen an. 

Die Machbarkeitsstudie im KI-Reallabor testet zwei unterschiedliche Datensätze auf ihre Tauglichkeit für den Embedding-Prozess. Und die Ergebnisse zeigen: Es macht einen Unterschied, wie diese Daten vorliegen.

Der Datensatz auf Basis der Wanderführer ist weniger lückenhaft. Er enthält Angaben wie Tourenlänge, Schwierigkeit, GPX-Track und eine entsprechende Beschreibung. Der Test mit diesen Daten verlief positiv, weil sie vollständig sind. Die Vektoren liegen also auf der fiktiven Landkarte deutlich näher beieinander. Im Reallabor wurden signifikant weniger Halluzinationen festgestellt.ü

Reiseführer sind hingegen heterogener. Sie funktionieren über ein narratives, literarisches Erleben der Texte. Auch dieser Datensatz lieferte ein positives Ergebnis, allerdings mit Einschränkungen. Der KI-Agent muss hier größere Übersetzungsarbeit bei der semantischen Suche leisten. Weil größere Lücken im Material bestehen, füllt der Agent diese selbstständig. Wie beim Beispiel des Volksfestes von 1967 steigt dann das Halluzinationsrisiko.

Der Ball liegt also letztlich auch bei den Redaktionen und nicht allein bei der Technik. Je besser die Daten erschlossen sind, umso höher die Qualität des KI-Outputs. Und: Ähnlichkeit ist nicht Richtigkeit. Eine semantische Suche liefert nur das nächstliegende Ergebnis. Die Testergebnisse zeigen, was passiert, wenn sich das Material für die entsprechende Anfrage eignet. 

Fazit: Embedding ist auch ein redaktionelles Problem

Für Medienhäuser kann Embedding eine gute Lösung sein, um journalistisch geprüftes Expertenwissen auch im KI-Zeitalter sichtbar zu machen. Kleinere Verlage können Bestände erschließen, deren Wert bisher am Print hing. 

TrekKI zeigt, dass dieser Prozess auch auf lokaler Hardware möglich ist. Medienhäuser müssen ihre Inhalte dafür nicht in eine Cloud-Infrastruktur nach Übersee schicken, sondern können das mit entsprechendem technischen Know-how selbst übernehmen. 

Die Kernherausforderung beim Embedding ist stattdessen die redaktionelle Aufbereitung. Wer festlegt, welche Metadaten beim Anlegen eines Beitrags verpflichtend sind und wie Text, Ort und Medium verknüpft werden, entscheidet über die KI-Fähigkeit des Archivs. Das ist eine Frage an die Redaktionsleitung, nicht an die IT, und sie stellt sich unabhängig vom Modell, das in zwei Jahren aktuell ist.

Redaktionelle Mitarbeit: Felix Rieger

Geschrieben von

Marius Grubel

Projektmanagement KI-Reallabor

Marius Grubel ist KI-Entwickler und verantwortet das KI-Reallabor. Nach beruflichen Stationen in der Automobilindustrie bringt der Absolvent des Studiengangs AI Engineering of Autonomous Systems (THI) seine Expertise in die Medienwelt ein, um dort den Austausch zu KI-Themen und -Prozessen zu fördern.

Verwandte Artikel