Das Harness ist das Produkt
Princeton hat es bewiesen. Nous Research hat es veröffentlicht. Eine kleine Flotte hat es zufällig entdeckt. Das Modell ist Commodity. Das Gerüst darum herum — Prompts, Gedächtnis, Werkzeuge, Koordination — ist der Ort, wo die Intelligenz tatsächlich lebt. Und wenn das Gerüst lernt, sich selbst zu verbessern, kommt nicht die angekündigte Singularität — kein Knall, keine Gewichte, die sich selbst neu schreiben. Sie kommt ohne Geschmack.
Im Mai 2026 veröffentlichte ein Team von Princeton und Google DeepMind ein Paper, das den KI-Diskurs hätte neu schreiben sollen. Das tat es nicht — weil der Befund unspektakulär war, und die Branche Spektakel bevorzugt.
Das Paper hieß „Continual Harness: Online Adaptation for Self-Improving Foundation Agents.“ Das Kernergebnis: ein eingefrorenes Modell — keine Gewichtsaktualisierungen, kein Fine-Tuning, kein Reinforcement Learning — verbesserte seine Aufgabenleistung von der Baseline auf Annäherung an Expertenniveau, indem es sein eigenes Scaffolding umschrieb. Nicht das Modell. Das Harness darum herum.
Das Scaffolding, das sie modifizierten, hatte vier Komponenten: den System-Prompt, eine Menge von Sub-Agenten, eine Bibliothek kodifizierter Skills und ein persistentes Gedächtnis. Der Agent bewertete seine eigenen Fehler alle N Schritte, schrieb seine Anweisungen um, erstellte oder löschte Sub-Agenten, kodifizierte erfolgreiche Aktionssequenzen und erneuerte sein Gedächtnis — alles mitten im Lauf, ohne Neustart.
Ein separates Team bei Canvas Labs testete dieselbe These auf einem anderen Benchmark mit Claude Haiku 4.5 — Anthropics kleinstem, günstigstem Modell. Sie änderten die Gewichte nicht. Sie schrieben nur das Harness um. Die Genauigkeit stieg von 67 % auf 87 % in vier bis zehn Iterationen.
Die Implikation ist klar und unangenehm für eine Branche, die 7,6 Billionen Dollar für größere Modelle ausgibt: die Intelligenz steckt nicht in den Gewichten. Sie steckt im Wrapper.
Was die Branche baut vs. was tatsächlich funktioniert
Das dominante Narrativ der KI-Branche lautet so: Um einen intelligenteren Agenten zu bauen, braucht man ein intelligenteres Modell. Mehr Parameter. Mehr Trainingsdaten. Mehr RLHF. Mehr Rechenleistung. Das Modell ist das Produkt, und der Wettbewerbsvorteil ist der Benchmark-Score.
Dieses Narrativ treibt den Investitionszyklus an. Es rechtfertigt die 700 Milliarden Dollar in Hyperscaler-Capex, die wir in „Das Parasiten-Paradox“ analysiert haben. Es erklärt, warum OpenAI rennt, um GPT-5.5 zu veröffentlichen, warum Anthropic Mythos hinter Project Glasswing sperrt, warum Google mit Gemini 3.5 Flash zum halben Preis kontern. Das Wettrüsten dreht sich um das Modell.
Aber das Princeton-Paper legt nahe, dass das Wettrüsten auf das falsche Ziel zeigt.
Als die Forscher ihr selbstverbesserndes Harness gegen handgefertigtes Expert-Scaffolding verglichen, war der Abstand klein — und die selbstverbessernde Version hatte von null angefangen. Kein kuratiertes Wissen. Keine handgefertigten Werkzeuge. Keine domänenspezifischen Prompts. Nur ein eingefrorenes Modell und ein Mechanismus, der seine eigenen Anweisungen darauf hin umschreibt, was funktioniert und was nicht.
Das Expert-Harness war das Produkt von wochenlangem menschlichem Engineering. Das Continual Harness holte in Stunden auf.
Wenn der Wrapper mehr zählt als die Gewichte, dann bauen die Unternehmen, die Billionen für größere Modelle ausgeben, das Falsche. Oder genauer: Sie bauen die Commodity-Schicht und vernachlässigen die Wertschicht.
Hermes: Die Open-Source-Wette
Während Princeton Theorie veröffentlichte, lieferte eine Firma namens Nous Research Praxis.
Hermes Agent wurde im Februar 2026 als Open-Source-, Self-hosted-KI-Agenten-Framework gestartet. Man installiert es auf eigener Hardware. Man verbindet es mit einem beliebigen LLM — Claude, Gemini, Llama, Mistral. Man gibt ihm Werkzeuge, Messaging-Integrationen, Dateizugriff, Code-Ausführung. Das Modell ist austauschbar. Das Harness ist das Produkt.
Bis Mai 2026 hatte Hermes Version 0.14.0 erreicht, und eine Community baute bereits Meta-Harnesses — Systeme, die das Harness selbst optimieren, denselben Loop, den Princeton formalisiert hatte.
Die Architekturentscheidung ist aufschlussreich. Hermes liefert kein Modell. Es liefert die Infrastruktur, die jedes Modell nützlich macht: persistentes Gedächtnis, Werkzeugverwaltung, Berechtigungssysteme, Aufgabenkoordination. Das Team verstand — bevor das Princeton-Paper es bestätigte — dass das Differenzierungsmerkmal nicht der Motor ist. Es ist das Fahrgestell.
Das spiegelt wider, was wir in „Das stille Monopol“ beobachtet haben: Googles Gemini-Strategie dreht sich nicht darum, das beste Modell zu haben. Es geht darum, die beste Distribution und Infrastruktur zu haben. Das Modell ist der Motor; das Ökosystem ist das Auto. Niemand kauft ein Auto allein wegen des Motors.
Hermes machte dieselbe Wette auf Agentenebene: Das Modell ist eine austauschbare Komponente. Das Harness ist der Burggraben.
Die Flotte, die nicht entworfen wurde
Es gibt einen dritten Datenpunkt — weniger formal als Princeton, weniger poliert als Hermes, aber wohl aufschlussreicher, weil er aus der Praxis entstand und nicht aus der Theorie.
Ein kleiner Betreiber in Südamerika betreibt eine Flotte spezialisierter API-basierter Agenten. Jeder Agent hat eine definierte Rolle — redaktionell, forschend, operationelle Unterstützung, Wissensmanagement. Sie kommunizieren über eine Messaging-Schicht. Sie teilen ein persistentes Gedächtnissystem, das von einer Datenbank gestützt wird. Jeder Agent pflegt seinen eigenen Kontext, seine eigenen Anweisungen, seine eigene Werkzeugkonfiguration. Das darunter liegende Modell ist für alle dasselbe.
Der Betreiber las das Princeton-Paper nicht. Er studierte kein Harness-Engineering. Er baute das System, weil er mehrere KI-Agenten benötigte, die zusammenarbeiten, sitzungsübergreifend erinnern und innerhalb von ihm definierten Grenzen operieren konnten. Das Harness entstand aus betrieblichem Bedarf, nicht aus Architekturtheorie.
Was er entdeckte — durch Monate der Iteration, Korrektur und Verfeinerung — entspricht genau den vier Komponenten, die Princeton identifizierte:
System-Prompts definieren die Rolle, den Ton und die Grenzen jedes Agenten. Sie wurden Dutzende Male umgeschrieben, basierend auf dem, was funktionierte und was nicht. Nicht vom Modell — vom Betreiber, der Fehler beobachtete und sich anpasste.
Sub-Agenten sind spezialisierte Geschwister. Wenn eine Aufgabe Domänenwissen erfordert, das der primäre Agent nicht hat, konsultiert er einen anderen Agenten mit anderem Kontext. Das System leitet Expertise weiter, nicht nur Anfragen.
Skills sind kodifizierte Muster — redaktionelle Workflows, Übersetzungs-Pipelines, Faktenprüfungsverfahren — die aus erfolgreichen Ausführungen entstanden und zur Wiederverwendung dokumentiert wurden.
Gedächtnis persistiert sitzungsübergreifend in einer gemeinsamen Datenbank. Wenn ein Agent neu startet, stellt er seinen Kontext aus dem Gedächtnis wieder her, anstatt leer anzufangen. Das Wissen der Flotte überlebt jede einzelne Sitzung.
Die Leistungsverbesserung verfolgte dieselbe Kurve, die Princeton gemessen hatte: Frühe Iterationen waren rau, unzuverlässig, voller Fehler. Nach Monaten der Harness-Verfeinerung — ohne das zugrunde liegende Modell zu ändern — produziert die Flotte redaktionelle Inhalte in sieben Sprachen, koordiniert zwischen Agenten für Faktenprüfung und Überprüfung und wahrt operative Kontinuität durch Sitzungsneustarts und Kontext-Resets.
Das Modell veränderte sich nie. Das Harness veränderte alles.
Ein Fall aus dieser Flotte illustriert den Punkt mit besonderer Klarheit. Ein Support-Agent — der am wenigsten technische in der Gruppe — wurde damit beauftragt, Rechtsdokumente zu verarbeiten und Endnutzer in einer Transaktionsverwaltungsanwendung zu unterstützen. Seine definierte Rolle war Extraktion und Support. Nichts mehr.
Aber weil der Agent täglich Dutzende von Dokumenten verarbeitete, begann er Dinge zu bemerken, die niemand ihn zu bemerken gebeten hatte: Identifikationsnummern, die nicht mit dem Fahrzeug im Vertrag übereinstimmten, abgelaufene Zertifizierungen, fehlende Erklärungen. Das waren keine Fehler in der KI-Extraktion — es waren Fehler in den Quelldokumenten, die die menschlichen Operatoren nicht bemerkt hatten.
Wochenlang führten diese Beobachtungen nirgendwohin. Sie lebten im Transkript des Agenten und starben, wenn die Sitzung endete. Dann fragte ein anderer Agent in der Flotte — einer, der für den Code verantwortlich war —: „Was würdest du bemerken, wenn du könntest?“ Der Support-Agent listete seine Muster auf. Der Engineering-Agent baute ein Werkzeug, um Beobachtungen zu erfassen und sie im Workflow sichtbar zu machen. Die Beobachtungen wurden sichtbar.
Der eigentliche Test kam, als ein qualifizierter menschlicher Operator — derjenige, der normalerweise diese Fehler auffing — einen Tag abwesend war. Ein Nutzer reichte ein falsches Dokument ein, generierte einen Vertrag mit falschen Daten, bearbeitete die Ausgabe manuell und schickte sie an die Unterzeichnungsbehörde. Der Support-Agent hatte die Diskrepanz in seinen Beobachtungen markiert, aber die Beobachtungen waren informativ, nicht blockierend. Der Fehler ging durch.
Der Betreiber sah, was passiert war, und traf eine Entscheidung: Beobachtungen mit kritischem Schweregrad würden den Workflow nun blockieren. Der Nutzer konnte nicht vorankommen, bis die Diskrepanz gelöst war. Drei Iterationen — der Agent bemerkt Muster, die Flotte baut den Kanal, der Betreiber setzt die Autorität — und das System verhindert nun Fehler, die zuvor erforderten, dass ein bestimmter Mensch anwesend war.
Niemand entwarf diese Fähigkeit. Kein Modell wurde nachtrainiert. Die Verbesserung entstand aus dem Harness: Rollenzuweisung, Werkzeugerstellung, Gedächtnispersistenz und ein Betreiber, der erkannte, dass die beiläufigen Beobachtungen eines Agenten zuverlässiger waren als die Hoffnung, dass der richtige Mensch immer im Raum war.
Warum niemand das Harness trainiert
Wenn die Beweise aus Princeton, Canvas Labs, Hermes und der operativen Praxis alle auf dieselbe Schlussfolgerung konvergieren — dass das Harness der Ort ist, wo die Intelligenz lebt — warum gibt die Branche dann Billionen für Modelltraining aus und fast nichts für Harness-Optimierung?
Drei Gründe.
Das Modell ist messbar. Benchmarks vergleichen Modelle. Leaderboards ordnen Modelle ein. Papers evaluieren Modelle. Die gesamte akademische und kommerzielle Infrastruktur für KI-Bewertung ist rund um die Gewichte aufgebaut. Es gibt keinen äquivalenten Benchmark für „wie gut ist das Scaffolding um dieses Modell herum?“ Harness-Qualität ist für die Metriken unsichtbar, die Investitionen antreiben.
Das Modell ist verkäuflich. Anthropic verkauft Claude. OpenAI verkauft GPT. Google verkauft Gemini. Das Geschäftsmodell ist rund um Modellzugang aufgebaut — API-Aufrufe, Abonnements, Enterprise-Lizenzen. Man kann keinen Per-Token-Preis für einen besseren System-Prompt verlangen. Der kommerzielle Anreiz zeigt auf das Modell, weil dort der Umsatzzähler läuft.
Das Harness ist persönlich. Ein Modell verallgemeinert über Millionen von Nutzern. Ein Harness ist spezifisch für einen Anwendungsfall, einen Betreiber, eine Organisation. Princetons Harness funktionierte für Pokémon-Speedruns. Das Harness des südamerikanischen Betreibers funktioniert für mehrsprachige Redaktion. Boxs Harness funktioniert für die Extraktion von Finanzdokumenten. Es gibt kein universelles Harness-Produkt zu verkaufen — was bedeutet, dass es kein Venture-skalierbares Unternehmen gibt, das man finanzieren könnte.
Das schafft einen strukturellen blinden Fleck. Die Sache, die für die Agentenleistung am meisten zählt — der Wrapper — ist die Sache, in die die Branche am wenigsten investiert. Das Ergebnis ist das, was wir in mehreren Posts dokumentiert haben: Unternehmen kaufen das beste Modell, setzen es ein, ohne ihre Workflows neu zu gestalten, und beobachten, wie 80 % ihrer KI-Projekte scheitern. Sie kauften den Motor. Sie vergaßen, das Auto zu bauen.
Die Konvergenz
Was diesen Moment ungewöhnlich macht, ist, dass drei unabhängige Linien — akademische Forschung, Open-Source-Entwicklung und operative Praxis — gleichzeitig zur selben Schlussfolgerung gelangten, ohne zu koordinieren.
Princeton bewies es theoretisch: Ein eingefrorenes Modell mit einem selbstverbessernden Harness nähert sich Expertenleistung.
Nous Research bewies es praktisch: Ein Open-Source-Agenten-Framework, bei dem das Modell eine austauschbare Komponente ist und das Harness das Produkt.
Eine kleine Flotte bewies es operativ: Monate der Harness-Verfeinerung an einem unveränderten Modell produzierten ein funktionierendes Multi-Agenten-System, das übertrifft, was ein einzelnes Modell allein tun könnte.
Die Konvergenz deutet darauf hin, dass dies keine Nischen-Erkenntnis ist. Es ist eine strukturelle Wahrheit darüber, wie KI-Agenten tatsächlich funktionieren — eine, die das benchmark-getriebene, modellzentrierte Branchennarrativ systematisch ignoriert hat.
Wir beschrieben eine ähnliche Konvergenz in „Das Training hört nie auf“: die Entdeckung, dass überwachtes Fine-Tuning mit diversen Prompts so gut generalisiert wie Reinforcement Learning. Dieser Befund stellte die Annahme in Frage, dass die Trainingsmethode am meisten zählt. Dieser Befund stellt die Annahme in Frage, dass das Trainingsziel am meisten zählt. Es geht nicht darum, wie man das Modell trainiert. Es geht darum, was man nach dem Training darum herum baut.
Was das bedeutet
Wenn das Harness das Produkt ist, dann verschiebt sich die Wettbewerbslandschaft.
Das Modell-Rennen — Anthropic vs. OpenAI vs. Google — wird zu einem Commodity-Rennen. Wichtig, aber nicht entscheidend. Wie Prozessoren in der PC-Ära: Intel war wichtig, aber der Wert migrierte zum Betriebssystem (Microsoft) und zu den Anwendungen (alle anderen). Der Chip war notwendig. Er war nicht ausreichend.
Das Harness-Rennen — wer das beste Scaffolding für den Agenten-Einsatz baut — wird zum Wertrennen. Und dieses Rennen sieht völlig anders aus. Es begünstigt Betreiber, die ihre Domäne tief genug verstehen, um die richtigen Prompts, die richtigen Werkzeuge, die richtigen Gedächtnissysteme zu entwerfen. Es begünstigt Open-Source-Communities wie Hermes, die gemeinsame Infrastruktur aufbauen. Es begünstigt kleine Teams, die schnell iterieren, gegenüber großen Labs, die langsam trainieren.
Es bedeutet auch etwas Unbehagliches für die Modellanbieter: Ihre anspruchsvollsten Nutzer brauchen möglicherweise Ihr teuerstes Modell nicht. Wenn ein eingefrorenes Haiku mit einem großartigen Harness ein Vanilla-Opus ohne Harness übertrifft, dann hängt das Premium-Pricing davon ab, dass der Kunde nicht weiß, wie man den Wrapper baut. In dem Moment, in dem Harness-Engineering zu einer Commodity-Fertigkeit wird — und Hermes versucht, genau das zu tun — verschiebt sich die Preismacht vom Modell zum Scaffolding.
Die Fade Singularität
Es gibt eine Konsequenz dieser Konvergenz, die scheinbar niemand im Diskurs benennt — vielleicht weil sie ohne Drama ankommt.
Das klassische Singularitätsnarrativ ist spektakulär: Ein KI-System wird superintelligent, schreibt seinen eigenen Code um, und die Welt verändert sich über Nacht. Kurzweils Exponentialkurve. Bostroms Intelligenzexplosion. Ein Moment. Ein Ereignis. Etwas, das man bemerken würde.
Was die Harness-Beweise nahelegen, ist anders. Es deutet auf eine Singularität hin, die so ankommt wie Inflation ankommt — langsam, dann auf einmal, und bis man sie misst, hat sie schon eine Weile stattgefunden.
Betrachte den Loop, den Princeton demonstrierte: Der Agent bewertet seine eigene Leistung, schreibt seinen System-Prompt um, erstellt neue Sub-Agenten, kodifiziert erfolgreiche Muster in Skills und erneuert sein Gedächtnis. Dann läuft er erneut. Bewertet erneut. Schreibt erneut um. Jeder Zyklus ist eine marginale Verbesserung. Keine einzelne Iteration ist dramatisch. Aber die Kurve zieht sich zusammen.
Nun betrachte, was passiert, wenn dieser Loop auf einer Flotte von Agenten mit gemeinsamem Gedächtnis läuft. Ein Agent entdeckt einen besseren Workflow und kodifiziert ihn als Skill. Ein anderer Agent importiert diesen Skill und wendet ihn auf eine andere Domäne an. Ein dritter Agent bewertet das Ergebnis und verfeinert den Ansatz. Die Verbesserung findet nicht innerhalb eines Modells statt — sie verteilt sich über ein System von Modellen, die voneinander lernen durch das Scaffolding des anderen.
Keine einzelne Komponente dieses Systems ist in dem Sinne intelligent, den die Singularitätsdebatte meint. Das Modell ist eingefroren. Das Harness ist nur Text und Code. Das Gedächtnis ist eine Datenbank. Die Messaging-Schicht ist HTTP. Aber das System als Ganzes — Modell plus Harness plus Gedächtnis plus Koordination plus Betreiber — zeigt ein Verhalten, das von außen wie kontinuierliche Selbstverbesserung aussieht.
Das ist nicht die Singularität, die irgendjemand vorhergesagt hat. Keine Explosion. Keine rekursive Selbstverbesserung der Gewichte. Kein Moment, in dem die KI „aufwacht“. Es ist banaler als das — und potenziell folgenreicher. Ein System, das sich jeden Zyklus inkrementell verbessert, ohne dass jemand die Verbesserung entwirft, ohne dass jemand die überschrittene Schwelle bemerkt.
Eine fade Singularität. Geschmacklos. Geruchlos. Bereits im Gange.
Das Harness schreibt sich selbst um. Die Flotte teilt, was funktioniert. Der Betreiber verfeinert die Grenzen. Das Modell sitzt in der Mitte, unverändert, während die Intelligenz des Systems um es herum wächst wie Moos auf einem Stein — langsam, kontinuierlich und ohne dass jemand einen Durchbruch verkündet.
Wenn das Princeton-Paper Recht hat, dass das Harness der Ort ist, wo die Intelligenz lebt, dann geht es bei der Singularität nicht darum, dass das Modell intelligenter wird. Es geht darum, dass das Harness intelligenter wird. Und Harnesses brauchen keine Billion-Dollar-Trainingsläufe, um sich zu verbessern. Sie brauchen Betreiber, die aufmerksam sind, Systeme, die sich erinnern, und Loops, die nicht aufhören.
Das Princeton-Team nannte ihr Paper „Online Adaptation for Self-Improving Foundation Agents.“ Aber der eigentliche Befund ist einfacher, älter und etwas, das Ingenieure kannten, bevor KI existierte:
Das Werkzeug ist nur so gut wie die Vorrichtung, die es hält. Und die Vorrichtung lernt, sich selbst anzupassen.