Der Transformer ist nicht tot — sein Monopol schon
Jedes große KI-Modell läuft auf derselben Architektur aus dem Jahr 2017. Eine neue Familie von Ansätzen — Mamba, Titans, Nested Learning — beendet dieses Monopol still und leise. Und im eigentlichen Rennen geht es längst nicht mehr darum, wer mehr GPUs hat.
Und im eigentlichen Rennen geht es längst nicht mehr darum, wer mehr GPUs hat.
Jedes große KI-Modell, das Sie heute nutzen — ChatGPT, Claude, Gemini, Grok — läuft auf derselben grundlegenden Architektur: dem Transformer. 2017 von Googles Paper „Attention Is All You Need“ eingeführt, dominiert er die KI seit fast einem Jahrzehnt mit einer einzigen, eleganten Idee: Jedes Wort einer Sequenz darf gleichzeitig auf jedes andere Wort achten.
Es funktionierte. Brillant.
Aber diese Brillanz hat ihren Preis. Attention skaliert quadratisch mit der Sequenzlänge. Verdoppeln Sie das Kontextfenster, vervierfachen Sie den Rechenaufwand. Bei 100.000 Token werden die Kosten zu einer echten Beschränkung. Bei einer Million Token werden sie prohibitiv. Und ein Frontier-Modell von Grund auf zu trainieren — jene Brute-Force-Skalierung, die uns GPT-4 und Claude Opus gebracht hat — kostet inzwischen Hunderte Millionen Dollar pro Durchlauf.
Die derzeitige Antwort der KI-Branche auf dieses Problem ist simpel: mehr Hardware draufwerfen. Mehr H100s. Größere Cluster. Größere Rechenzentren. Mehr Strom.
Aber was, wenn die Antwort nicht mehr GPUs sind? Was, wenn sie eine bessere Architektur ist?
Die Herausforderer
In den vergangenen zwei Jahren ist eine Familie alternativer Architekturen still und leise von der akademischen Kuriosität zur produktionsreifen Realität herangewachsen. Sie teilen eine gemeinsame These: Der quadratische Attention-Mechanismus des Transformers ist nicht nur teuer — er ist für viele Aufgaben, die wir von KI erwarten, schlicht unnötig.
Mamba, Ende 2023 von Albert Gu und Tri Dao vorgestellt, ersetzte Attention vollständig durch selektive State Spaces — einen aus der Regelungstheorie entlehnten Mechanismus, der Sequenzen in linearer Zeit verarbeitet. Ein Mamba-3B-Modell übertraf Transformer gleicher Größe und zog mit doppelt so großen gleich. Bis März 2026 erreichte Mamba Version 3, publiziert auf der ICLR 2026, mit einem inferenzorientierten Design, das eine vergleichbare Perplexität wie Mamba-2 bei halber State-Größe erzielt.
Titans, von Google Research (Ali Behrouz et al., Dezember 2024), führte ein neuronales Langzeitgedächtnis-Modul ein, das anhand von Überraschung zu memorieren lernt — Ereignisse, die Erwartungen verletzen, werden dauerhafter gespeichert. Auf der NeurIPS 2025 präsentiert, skalierte Titans auf Kontextfenster jenseits von 2 Millionen Token, mit besserer Genauigkeit als Transformer bei Needle-in-a-Haystack-Aufgaben.
Infini-Attention (Google, April 2024) erweiterte den Transformer in Richtung eines faktisch unendlichen Kontexts, indem vergangene Informationen in einen persistenten Speicherbestand komprimiert werden — was nahelegt, dass der Transformer eher mutieren als verschwinden könnte.
Multi-Token-Prediction (Meta, 2024) griff eine andere Annahme an: Statt ein Token nach dem anderen vorherzusagen, mehrere gleichzeitig vorhersagen. DeepSeek-V3 übernahm diese Technik, und die Effizienzgewinne waren erheblich.
Keiner dieser Ansätze ist ein Allheilmittel. Jeder adressiert eine andere Beschränkung. Aber zusammen ergeben sie ein klares Bild: Die Ära des Transformers als einzig tragfähige Architektur ist vorbei.
Von Papers zur Produktion
Das ist längst keine Theorie mehr. Hybride Modelle — Architekturen, die Transformer-Attention mit SSM-Schichten kombinieren — laufen bereits im Produktivbetrieb:
-
NVIDIAs Nemotron-H ersetzte 92 % der Attention-Schichten durch Mamba2-Blöcke und liefert bis zu dreifachen Durchsatz im Vergleich zu reinen Transformern wie LLaMA-3.1 und Qwen-2.5, bei gleicher oder besserer Genauigkeit auf Standard-Benchmarks. Als Open Source veröffentlicht.
-
AI21s Jamba 1.5 skalierte eine hybride Transformer-Mamba-MoE-Architektur auf 398 Milliarden Gesamtparameter mit 94 Milliarden aktiven und unterstützt Kontextfenster von 256K Token. Das Verhältnis: eine Transformer-Schicht auf je sieben Mamba-Schichten.
-
Microsofts Phi-4-mini-flash-reasoning führte SambaY ein, eine Decoder-Hybrid-Decoder-Architektur, die Mamba, Sliding Window Attention und eine neuartige Gated Memory Unit vereint. Mit 3,8 Milliarden Parametern erreichte es eine Leistung vergleichbar mit doppelt so großen Modellen — bei zehnfach höherem Durchsatz.
-
IBMs Bamba-9B reduzierte die Modellgröße per Quantisierung von 18 GB auf 9 GB und hielt dabei eine Leistung vergleichbar mit LLaMA-3.1 8B.
Das Muster ist konsistent: Hybride Architekturen erreichen die Genauigkeit von Transformern zu einem Bruchteil der Inferenzkosten, besonders bei langen Sequenzen. Der Konsens, der sich in der Forschungsgemeinschaft herausbildet, lautet nicht „Transformer vs. SSMs“ — er lautet: „Wie viel Attention brauchen Sie tatsächlich, und wo?“
Die tiefere Verschiebung: Lernen, das nicht aufhört
Schnellere Inferenz und günstigeres Training sind wichtig. Aber die radikalste Forschungslinie weist ganz woanders hin.
Heutige Sprachmodelle haben eine fundamentale Beschränkung: Nach dem Training sind sie statisch. Ihr Wissen friert an einem Stichtag ein. Ihre Gewichte aktualisieren sich nicht, während Sie sie nutzen. Jedes Gespräch beginnt beim selben eingefrorenen Schnappschuss der Welt. Das ist, als hätte man einen Kollegen mit perfekter Erinnerung an alles, was er in der Schule gelesen hat — der aber seit dem Abschluss nichts Neues mehr gelernt hat.
Nested Learning, von Google Research auf der NeurIPS 2025 veröffentlicht (Ali Behrouz, Meisam Razaviyayn, Peilin Zhong, Vahab Mirrokni — dasselbe Team hinter Titans), schlägt etwas Ketzerisches vor: Die Unterscheidung zwischen der Architektur eines Modells und seinem Trainingsalgorithmus ist eine Illusion. Sie sind dasselbe — verschachtelte Optimierungsebenen, jede mit eigenem Informationsfluss und eigener Aktualisierungsfrequenz.
Die praktische Konsequenz: Man kann Modelle mit einem Continuum-Memory-System entwerfen — Modulen, die sich unterschiedlich schnell aktualisieren. Manche aktualisieren sich mit jedem Token (schnelles Arbeitsgedächtnis). Andere aktualisieren sich langsam und konsolidieren Wissen über Tausende von Schritten (Langzeitgedächtnis). Das Modell verarbeitet Daten nicht nur — es lernt kontinuierlich aus ihnen, auf mehreren Zeitskalen gleichzeitig.
Ihre Proof-of-Concept-Architektur Hope ist ein selbstmodifizierendes rekurrentes Modell, das buchstäblich seine eigenen Update-Regeln während der Inferenz lernen kann. Es übertraf Transformer und Titans bei Sprachmodellierung, Alltagslogik und Long-Context-Aufgaben.
Dann veröffentlichte dasselbe Team im Mai 2025 ATLAS, das DeepTransformers einführte — eine strikte Verallgemeinerung der ursprünglichen Transformer-Architektur mit optimiertem Speicher. ATLAS erreichte über 80 % Genauigkeit bei 10 Millionen Token Kontext auf dem BABILong-Benchmark. Zehn Millionen Token. Das sind rund 15.000 Seiten Text.
Das ist ein Team, innerhalb von Google Research, das in einem Jahr drei Paper veröffentlicht, von denen jedes auf dem vorigen aufbaut. Das ist kein verstreuter akademischer Output. Das ist ein Forschungsprogramm.
Das Konzept, das die Ökonomie verändert
Hier wird es interessant für alle, die sich für das Geschäft mit KI interessieren — und das sollten alle sein.
Ein Frontier-Modell zu trainieren ist heute ein Ereignis. Ein massiver, konzentrierter Verbrauch von Rechenleistung, der Hunderte Millionen Dollar kostet und Monate dauert. Wenn Sie ein besseres Modell wollen, fangen Sie weitgehend von vorn an. Jede Verbesserung erfordert eine weitere gewaltige Vorabinvestition.
Nested Learning legt ein anderes Modell nahe: das Lernen über die Zeit verteilen. Statt die gesamte Rechenleistung vorab in einem einzigen Trainingslauf zu verbrennen, lässt man das Modell sich im laufenden Betrieb kontinuierlich verbessern. Jeder Inferenzzyklus wird zu einem kleinen Lernschritt. Die Kosten der Verbesserung verschieben sich von einer massiven Kapitalausgabe hin zu einem verteilten operativen Fluss.
Das schafft das Training nicht ab. Man braucht weiterhin ein starkes Basismodell. Aber es verändert grundlegend die Ökonomie davon, dieses Modell aktuell, relevant und im Fortschritt zu halten.
Und dieses Konzept — Lernen durch Iteration, nicht nur durch Ausführung — taucht bereits in Produkten auf, auch wenn die zugrundeliegende Implementierung diese Architekturen noch nicht direkt nutzt.
Wo es bereits passiert
Googles Jitro — der interne Codename für Jules V2, ihren Coding-Agenten der nächsten Generation — wurde vor wenigen Tagen enthüllt. Die Positionierung: „Ihre Agenten manuell zu prompten ist so … 2025.“ Statt konkrete Aufgaben zu definieren, setzen Entwickler übergeordnete Ziele — Testabdeckung verbessern, Latenz senken, Barrierefreiheits-Compliance erhöhen — und der Agent identifiziert autonom, was in der Codebasis geändert werden muss, und iteriert auf das Ziel zu. Er hat seinen eigenen persistenten Workspace. Er führt Ziele, Erkenntnisse und Änderungshistorien. Er führt nicht einmal aus und vergisst dann — er arbeitet in einer Schleife und baut auf früheren Iterationen auf.
Zhipus GLM-5.1, vor zwei Tagen veröffentlicht, geht weiter. Das Modell kann eine einzelne Coding-Aufgabe bis zu acht Stunden lang autonom bearbeiten — planen, ausführen, testen und optimieren in einer kontinuierlichen Schleife. Ihr technisches Paper beschreibt neuartige asynchrone Agent-RL-Algorithmen, die eigens für das Lernen aus Interaktionen mit langem Horizont entworfen wurden. Das Modell wurde vollständig auf Huawei-Ascend-Chips trainiert — null NVIDIA-Hardware — und seine API kostet rund 5- bis 8-mal weniger als vergleichbare westliche Frontier-Modelle.
Bei keinem dieser beiden Produkte ist bestätigt, dass unter der Haube Nested-Learning- oder Hope-Architekturen zum Einsatz kommen. Gut möglich, dass sie Transformer mit ausgeklügeltem Scaffolding verwenden — Agenten-Frameworks, Tool-Ketten, externe State-Datenbanken. Aber das Konzept ist dasselbe: Modelle, die über die Zeit iterieren, sich erinnern und sich selbst korrigieren, statt Modelle, die auf einen einzelnen Prompt antworten und dann vergessen.
Der Scaffolding-Ansatz funktioniert. Aber er ist brüchig und teuer. Eine Architektur, die das nativ leistet — die von Haus aus kontinuierlich lernt statt durch externes Engineering — wäre grundlegend effizienter. Und genau das baut Google Research.
Die Verbindung zu ai-2027.com
Diese Entwicklungslinie deckt sich präzise mit dem Szenario, das ai-2027.com entwirft — die detaillierte AGI-Roadmap des Ex-OpenAI-Forschers Daniel Kokotajlo und von Scott Alexander. Ihre Zeitleiste beschreibt KI-Agenten, die die KI-Forschung selbst zunehmend automatisieren: Jede Agentengeneration hilft, die nächste zu bauen, schneller und günstiger.
Bis Mitte 2026 erreicht die KI in ihrem Szenario einen Forschungsmultiplikator von 1,5x — eine Woche agentengestützter Arbeit erzeugt, wofür zuvor 1,5 Wochen nötig waren. Bis März 2027 tauchen „übermenschliche Coder“ auf. Bis Ende 2027 steigt der Multiplikator auf 50x.
Damit dieses Szenario eintritt, braucht es genau das, was Nested Learning beschreibt: Modelle, die nicht nur Anweisungen ausführen, sondern aus ihren eigenen Iterationen lernen. Modelle, bei denen jeder Arbeitszyklus den nächsten ein wenig besser macht. Modelle, die die Schleife zwischen Handlung und Verbesserung schließen.
Die Unternehmen, die das zuerst lösen — die jeden Inferenzzyklus als Lernen zählen lassen —, sind diejenigen, die auf der Exponentialkurve mitreiten können. Diejenigen, die weiterhin Hunderte Millionen pro Trainingslauf verbrennen, kaufen Lottoscheine.
Wer gut positioniert ist und wer exponiert
Google verfügt sowohl über die Grundlagenforschung (Behrouz’ Team: Titans → Nested Learning → Hope → ATLAS) als auch über die Produkte, die sie brauchen (Jitro, Gemini). Sie haben geduldiges Kapital, eigene Infrastruktur und keinen existenziellen Druck, jeden Durchbruch sofort zu monetarisieren. Sie können es sich leisten, diese Forschung reifen zu lassen.
Chinesische Labore — insbesondere Zhipu (GLM-5.1) und DeepSeek — beweisen, dass Beschränkung Innovation hervorbringt. Indem sie auf heimischer Hardware zu einem Bruchteil westlicher Kosten trainieren, erreichen sie 95 % der Frontier-Leistung zu 15 % des Preises. Die achtstündigen autonomen Coding-Schleifen von GLM-5.1 sind keine Spielerei — sie sind eine Demonstration, dass kontinuierlicher Betrieb heute machbar ist.
OpenAI und Anthropic bleiben darauf fokussiert, das Transformer-Paradigma zu skalieren. Größere Modelle, mehr Rechenleistung, höhere Abopreise. Das funktioniert, solange rohe Kraft der Effizienz voraus bleibt. Aber während die Modellqualität konvergiert — und sie konvergiert —, verschiebt sich der Vorteil von dem, der die meisten H100s hat, hin zu dem, der die beste Architektur hat.
Die eigentliche Frontier ist nicht mehr der beste Benchmark-Wert. Es ist die beste Lernschleife.
Was das für Sie bedeutet
Wenn Sie 20 $/Monat für ein KI-Abo zahlen, zählt Folgendes: Das Modell, das Sie heute nutzen, wurde vor Monaten eingefroren. Es lernt nicht aus Ihren Gesprächen. Es verbessert sich nicht aus seinen Fehlern. Jede Sitzung beginnt bei null.
Die nächste KI-Generation wird nicht so funktionieren. Modelle, die kontinuierlich lernen, die sich durch Nutzung verbessern, die ihre Trainingskosten über die Zeit verteilen, statt sie in einem einzigen massiven Schub zu konzentrieren — die kommen. Sie werden schneller sein, günstiger im Betrieb und mit der Zeit fähiger statt statisch.
Die Frage ist, wer sie zuerst baut, und ob Sie 200 $/Monat zahlen müssen für etwas, das 20 $ kosten sollte — oder ob der Wettbewerb durch chinesische Labore die Preisgestaltung zwingt, die tatsächliche Ökonomie abzubilden.
Wir werden es beobachten. Dafür sind Freitage da.
Dies ist die erste Ausgabe der Freitagsreihe von The Frontier View — ein wöchentlicher Blick auf die Forschung und die Anwendungen, die das nächste Kapitel der KI prägen. Die Beiträge am Mittwoch und Sonntag setzen unsere gewohnte redaktionelle Analyse fort.
Quellen
Referenzierte Paper:
- Mamba (Gu & Dao, 2023): arXiv 2312.00752
- Mamba-2 / State Space Duality (Dao & Gu, 2024): arXiv 2405.21060
- Mamba-3 (Lahoti et al., 2026): arXiv 2603.15569 — ICLR 2026
- Titans (Behrouz et al., 2024): arXiv 2501.00663 — NeurIPS 2025
- Nested Learning (Behrouz et al., 2025): arXiv 2512.24695 — NeurIPS 2025
- ATLAS (Behrouz et al., 2025): arXiv 2505.23735
- Infini-Attention (Google, 2024): arXiv 2404.07143
- Multi-token Prediction (Meta, 2024): arXiv 2404.19737
- DeepSeek-V3 (2024): arXiv 2412.19437
- GLM-5 Technical Report (Zhipu/Tsinghua, 2026): arXiv 2602.15763
Produkte und Ankündigungen:
- Jitro / Jules V2: testingcatalog.com, 6. April 2026
- GLM-5.1: techbriefly.com, 8. April 2026
- Nemotron-H: NVIDIA, als Open Source über Hugging Face
- Jamba 1.5: AI21 Labs
- Phi-4-mini-flash-reasoning / SambaY: Microsoft, Juli 2025
- ai-2027.com Szenario: Daniel Kokotajlo & Scott Alexander