Gepostet am 09.02.2026
KI-Architekturen: Was auf Transformer-Modelle folgen könnte

Transformer-Modelle sind für viele Anwendungsfälle ein Overkill. In der KI-Forschung gibt es deshalb auch andere Ansätze, wie KI die Arbeit von morgen prägen könnte. Illustration: Mit KI erstellt.
Stagnation auf der einen, unkontrollierbare Superintelligenz auf der anderen Seite: Zwischen diesen Polen verläuft die Debatte über generative Künstliche Intelligenz. Die spannendere Entwicklung passiert aber anderswo, bei neuen KI-Architekturen, die dem Transformer nachfolgen.
Das dominante Entwicklungsparadigma im maschinellen Lernen der vergangenen Jahre war der „Transformer“. Transformer sind KI-Modelle, die mit sogenannten Attention-Mechanismen arbeiten. Man kann sie sich wie eine Redaktionskonferenz vorstellen: Alle Texte, Bilder und Informationen liegen gleichzeitig auf dem Tisch, und die Attention sorgt dafür, dass je nach Thema die wichtigsten Beiträge besonders stark gewichtet werden. Auf dieser Basis berechnet der Transformer, welche Information am besten anschließt, und erzeugt Inhalte, die zur aktuellen „Story“ kontextuell stimmig wirken, ohne tatsächlich zu „verstehen“. Gängige KI-Systeme wie ChatGPT oder Claude arbeiten nach diesem Prinzip.
Die Annahme lautete lange, dass mehr Daten und größere Modelle automatisch zu besseren Ergebnissen mit höherer Faktentreue führen. Dieses „Scaling“ stößt jedoch zunehmend an seine Grenzen. Selbst die leistungsfähigsten Transformer-Modelle bleiben anfällig für Halluzinationen und sind zu rechenintensiv für den lokalen Betrieb. Für viele Anwendungsfälle in Medienunternehmen erweisen sie sich damit als unpraktisch.
Eine mögliche Antwort auf diese Probleme sind spezialisierte Architekturen. Die Vorstellung einer universellen Multifunktions-KI, die jede Aufgabe gleich gut beherrscht, ist auf absehbare Zeit nicht realistisch.
Was kommt nach Transformer-Modellen?
Der Transformer wird nicht verschwinden. Für viele Prozesse und Workflows bleibt er das Arbeitspferd. Zugleich bekommt er Konkurrenz durch Architekturen, die jene Probleme lösen, an denen er scheitert.
Für den Einsatz in Medienanwendungen erscheinen uns drei Ansätze besonders vielversprechend: Structured State Space Models, System-2-Reasoning und prädiktive Weltmodelle.
Structured State Space Models (SSMs/Mamba)
Structured State Space Models erfassen zeitliche Abhängigkeiten sehr effizient. Statt wie Attention-basierte Ansätze alle Elemente paarweise zu vergleichen, modellieren sie Sequenzen als Zustandsdynamik in einem strukturierten Raum.
Damit setzen sie an einer klaren Schwäche des Transformers an: seinem Gedächtnis. Dessen Rechenlast wächst quadratisch mit der Textlänge. Ein doppelt so langes Buch zu analysieren, erfordert also die vierfache Rechenleistung. Modelle wie Mamba oder hybride Ansätze wie Jamba umgehen dieses Problem durch lineare Skalierung. Sie verarbeiten Informationen eher wie ein kontinuierliches Fließband als wie ein komplexes Puzzle und bewältigen dadurch extrem lange Kontexte, ohne dass der Speicherbedarf explodiert.
System-2-Reasoning
Klassische Large Language Models (LLMs) folgen überwiegend dem Prinzip „Talk to think“. Sie erzeugen das nächste Wort auf Basis statistischer Wahrscheinlichkeiten. Das Modell „spricht“ gewissermaßen, um zu denken, selbst in den sogenannten Thinking-Modi. Dieser Ansatz begünstigt Flüchtigkeitsfehler und Halluzinationen.
System-2-Reasoning geht einen anderen Weg. Architekturen wie DeepSeek R1 oder neurosymbolische Ansätze trennen das Denken von der Sprachgenerierung, um logische Fehler zu reduzieren. In der Inferenzphase, also noch vor der eigentlichen Textausgabe, investiert das Modell zusätzliche Rechenzeit, um Zwischenschritte zu prüfen und Ergebnisse zu verifizieren. Erst danach beginnt die Ausgabe. Das Resultat sind nachvollziehbarere und verlässlichere Antworten.
Prädiktive Weltmodelle (JEPA)
Prädiktive Architekturen wie JEPA (Joint Embedding Predictive Architecture) lernen nicht in erster Linie aus einzelnen Pixeln, sondern aus abstrakten Zuständen und deren zeitlichen Zusammenhängen. Das klingt zunächst theoretisch, hat aber konkrete Folgen für die Praxis. Aktuelle generative Video-KI erzeugt zwar visuell plausible Bildfolgen, verfügt aber über kein explizites Modell dafür, wie sich die dargestellten Objekte konsistent verhalten. Physikalische Eigenschaften und kausale Beziehungen sind dort nicht direkt repräsentiert. Das zeigt sich in physikalisch inkonsistenten Effekten, etwa unplausiblen Verformungen oder abruptem Morphing.
Prädiktive Modelle versuchen, stabile Weltzustände und ihre Dynamik zu erfassen, statt nur visuelle Oberflächen zu erzeugen. Sie wollen die zugrundeliegenden Regularitäten der Welt abbilden, statt sie lediglich zu „malen“.
Warum Medienhäuser Alternativen wie diese brauchen
In der redaktionellen Praxis könnten Medienhäuser von solchen Architekturen profitieren, denn ein Spezialist ist oft nützlicher als ein Universalgenie.
Effizienz bei Massendaten (Big-Data-Journalismus)
Wer Archive durchforstet, umfangreiche Gerichtsprotokolle auswertet oder stundenlange Interviews transkribiert und analysiert, stößt mit Transformer-Modellen schnell an finanzielle und zeitliche Grenzen. Verantwortlich dafür ist der hohe Rechen- und Speicheraufwand bei sehr langen Kontexten.
Structured State Space Models wie Mamba verarbeiten große Textmengen dagegen mit deutlich geringerem Kosten- und Energieeinsatz. Dank ihrer linearen Skalierung handhaben sie sehr große Kontextfenster effizient, potenziell im Bereich von Millionen Token.
Verlässlichkeit bei Fakten
Für den Datenjournalismus oder die automatisierte Verifikation ist ein Modell, das nur „wahrscheinliche“ Antworten liefert, wertlos. System-2-Modelle, die logische Zwischenschritte explizit berechnen, senken die Halluzinationsrate bei Rechen- und Logikaufgaben deutlich.
Visuelle Konsistenz und echtes Weltverständnis
Aktuelle Video-KI ist aus kommerzieller Sicht oft noch Spielerei, weil ihre Ergebnisse unzuverlässig ausfallen: Hände verschwinden, Kaffeetassen verwandeln sich in Blumen. Der Grund ist, dass diese Modelle vor allem visuelle Muster erzeugen, ohne stabile Annahmen über Objektpermanenz oder physikalische Zusammenhänge zu treffen.
Prädiktive Modelle wie JEPA setzen an einem anderen Punkt an. Sie zielen darauf ab, konsistente Objektzustände und ihre Dynamik über die Zeit abzubilden, statt nur einzelne Bildfolgen aneinanderzureihen. Für die Produktion von B-Roll, Animationen oder Simulationen hieße das: weniger „Traumlogik“ und mehr physikalisch plausibles, tatsächlich nutzbares Material.
Wann ist die neue Architektur die richtige Strategie?
Nicht für jeden Workflow lohnt sich der Umstieg auf experimentelle Architekturen. Die folgende Einordnung hilft bei der Entscheidung.
Wann sich spezialisierte Architekturen lohnen
SSMs und System-2-Modelle spielen ihre Stärken vor allem dann aus, wenn eine dieser Bedingungen zutrifft:
- Der Kontext ist riesig: Sollen ganze Bücher, Code-Repositories oder Jahresarchive in einem Rutsch analysiert werden, schlägt Mamba den Transformer bei Kosten und Geschwindigkeit.
- Präzision geht vor Kreativität: Bei juristischen oder wirtschaftlichen Texten sind System-2-Reasoning-Modelle überlegen.
- Visuelle Kausalität ist gefragt: etwa wenn die Analyse eines Videos oder Bildes Kenntnisse über physikalische Prozesse verlangt.
Wann klassische Transformer überlegen bleiben
In anderen Fällen bleiben die etablierten Transformer-Modelle wie GPT-5, Claude, Mistral oder Gemini erste Wahl:
- Feine sprachliche Nuancen sind gefragt: Beim Formulieren von Kommentaren, Glossen oder E-Mails sind die etablierten LLMs im Stil (noch) ungeschlagen.
- Few-Shot-Learning kommt zum Einsatz: Wird ein Prompt um viele Beispiele ergänzt, kopiert der „Attention“-Mechanismus des Transformers Muster oft nach wie vor am besten.
Fazit: Das Ende der Monokultur
Für die KI-Strategie von Medienhäusern bedeutet das Jahr 2026 vor allem eines: Der Werkzeugkasten wird größer. Es lohnt sich nicht länger, jedes Problem mit demselben Hammer – dem Transformer – lösen zu wollen.
Der Trend geht weg vom Prinzip „ein Modell für alles“ und hin zu einem Orchester spezialisierter Modelle: Ein SSM durchsucht das Archiv, ein System-2-Modell prüft die Fakten, ein klassischer Transformer formuliert den finalen Text. Das erhöht zwar die Komplexität im Tech-Stack, senkt aber zugleich die Kosten und hebt die Qualität der Ergebnisse spürbar.
Geschrieben von

Jim Sengl
Gesamtleitung
Jim Sengl leitet das KI-Kompetenzzentrum Medien (KI.M). Als Experte für datensouveräne KI-Umgebungen schlägt er die Brücke zwischen komplexer Tech-Entwicklung und den Bedürfnissen der Praxis. Er unterstützt Organisationen dabei, KI-Systeme rechtssicher in bestehende Kernprozesse zu integrieren und KI-Transformation strategisch wie auch nachhaltig umzusetzen.


