Hintergrund

AI Harnesses sind die Software-Hüllen, die aus KI-Modellen fähige Agenten machen

Knights in harnesses. © Jose Luis Cernadas Iglesias (CC BY 2.0)
Knights in harnesses. © Jose Luis Cernadas Iglesias (CC BY 2.0)

Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.

Wer über künstliche Intelligenz spricht, meint häufig vor allem die Modelle. Namen wie Claude, GPT oder Gemini stehen stellvertretend für die Leistungsfähigkeit ganzer KI-Systeme. Bei sogenannten Agenten greift diese Betrachtung zu kurz. Ein Sprachmodell kann Texte erzeugen oder den Aufruf eines Werkzeugs vorschlagen. Damit es eigenständig Dateien bearbeitet, recherchiert, Programme ausführt und über viele Schritte hinweg ein Ziel verfolgt, braucht es zusätzliche Software.

Diese operative Umgebung wird zunehmend als „Agent Harness“ bezeichnet. Eine verbindliche Definition gibt es bislang nicht. Microsoft beschreibt den Begriff als Laufzeitgerüst, das aus einem Sprachmodell einen arbeitsfähigen Agenten macht: Modell- und Werkzeugaufrufe, Gesprächszustand, Kontext sowie Regeln für Freigaben und mehrstufige Aufgaben. Die wissenschaftliche Arbeit Harness-Bench definiert ihn als Mechanismus, der Kontext, Werkzeuge, Status, Berechtigungen, Beschränkungen und Fehlerbehebung zwischen Modellausgabe und Außenwelt organisiert. Vereinfacht gilt die Formel: Agent gleich Modell plus Harness.

Was ein AI Harness leistet

Die trainierten Gewichte eines Modells bleiben unverändert. Der Harness schafft die Bedingungen, unter denen das Modell handeln kann, im Kern über vier Funktionen.

Erstens Anweisungen und Richtlinien. Ein System Prompt legt fest, welche Rolle ein Agent hat, wie er priorisieren soll und wann er abbrechen oder eine Freigabe verlangen muss. Solche Regeln wirken wie eine Arbeitsanweisung, die das Modell zur Laufzeit als verbindlichen Kontext erhält.

Zweitens Werkzeuge. Websuche, Terminal, Dateisystem, E-Mail-Programm oder Schnittstellen zu Unternehmenssoftware. Der Harness beschreibt dem Modell, wofür ein Werkzeug gedacht ist, führt den gewählten Aufruf aus und gibt das Ergebnis zurück. Offene Standards wie MCP und Agent Skills, von Anthropic entwickelt und später als offener Standard veröffentlicht, sollen solche Fähigkeiten portabel machen.

Drittens die agentische Schleife. Ein Agent interpretiert den Auftrag, wählt eine Handlung, betrachtet das Ergebnis und entscheidet, ob ein weiterer Schritt nötig ist. Der Harness hält diesen Ablauf in Gang und setzt zugleich Grenzen für Laufzeit, Kosten und Zahl der Iterationen. Microsofts Agent Harness unterstützt dafür etwa automatische Kontextkomprimierung, Approval-Regeln und begrenzte Schleifen.

Viertens Kontext und Speicher. Lange Aufgaben passen irgendwann nicht mehr vollständig in das Kontextfenster. Der Harness fasst ältere Informationen zusammen, lagert Daten in Dateien oder Datenbanken aus und stellt sie später gezielt wieder bereit. Hinzu kommen Protokollierung, Berechtigungen und isolierte Ausführungsumgebungen. Davon hängt ab, ob sich ein Agent nach hundert Arbeitsschritten noch an sein ursprüngliches Ziel erinnert.

Eine Übersetzungsschicht kann zudem verschiedene Modelle hinter derselben Oberfläche verfügbar machen. Modellagnostische Harnesses wie OpenCode, Pi oder Hermes Agent binden mehrere Anbieter oder offene Modelle ein. Systeme wie Claude Code, Codex oder Gemini CLI erfüllen ähnliche Funktionen, bleiben dabei aber eng mit ihrem jeweiligen KI-Ökosystem verbunden.

Warum die Softwarehülle an Bedeutung gewinnt

Mehrere Untersuchungen zeigen inzwischen, dass derselbe Modellkern je nach Harness deutlich unterschiedliche Ergebnisse liefert. In einer Studie zu Harness-Effekten erreichte Claude Opus 4.5 auf SWE-bench Pro in einem standardisierten Gerüst 45,9 Prozent, mit Claude Code dagegen 55,4 Prozent. Die Unterschiede zwischen sechs führenden Modellen im standardisierten Gerüst lagen bei lediglich 4,9 Prozentpunkten.

Auch die Kosten variieren stark, ein Thema, das sich im Alltag vieler Teams bemerkbar macht, etwa wenn Agenten selbstständig Guthaben nachkaufen. Databricks verglich identische Modelle mit gleichem Rechenaufwand in unterschiedlichen Coding-Harnesses. Teils unterschieden sich die Kosten pro Aufgabe um mehr als den Faktor zwei, während die Ergebnisqualität gleich blieb. Ein Grund: Der minimalistische Pi-Harness übermittelte pro Schritt etwa dreimal weniger Kontext.

Besonders sichtbar wurde die Rolle des Harness bei ARC-AGI-3, einem interaktiven Benchmark aus unbekannten Computerspielen. Nvidia berichtete, dass seine Forschungsarchitektur Agentic Variation Operators, kurz AVO, mit Claude Opus 5 alle 183 Level des öffentlichen Sets löste. Sie kombiniert eine eigene Ausführungsschleife, persistenten Speicher und einen Supervisor, der festgefahrene Lösungswege erkennt und den Hauptagenten umlenkt.

Die daraus abgeleitete Schlagzeile „30 Prozent ohne Harness, 100 Prozent mit Harness“ greift allerdings zu kurz. Der ARC Prize meldete für Claude Opus 5 im eigenen Test 30,2 Prozent, doch beide Werte stammen aus unterschiedlichen Versuchsanordnungen. Ein kontrollierter Vergleich, bei dem ausschließlich der Harness getauscht wurde, fehlt damit. Auch der HarnessOpt-Bench von Scale AI mahnt zur Vorsicht: Bei der Optimierung von Harnesses hatte die Wahl des Optimierungsmodells im Schnitt einen etwa 1,8-mal größeren Effekt als die Wahl des Harness. Entscheidend ist demnach das Zusammenspiel beider Komponenten.

Vom technischen Werkzeug zur strategischen Ebene

Für Unternehmen könnte der Harness wertvoll werden, weil dort die dauerhafte Konfiguration eines Agenten liegt. Modelle lassen sich über eine Programmierschnittstelle vergleichsweise leicht austauschen. Schwieriger zu übertragen sind Arbeitsabläufe, Berechtigungen, Werkzeuge, gespeicherte Erfahrungen, Prüfroutinen und die Historie ausgeführter Aufgaben. Damit verlagert sich potenziell auch der Lock-in: Ein offener Harness senkt die Abhängigkeit von einem einzelnen Modellanbieter, während die Bindung an die Harness-Plattform wächst, sobald dort das institutionelle Wissen eines Agenten liegt. Für Nutzerinnen und Nutzer zählen deshalb offene Datenformate, exportierbare Sitzungen, portable Skills und die Option, den Harness lokal oder bei einem anderen Betreiber auszuführen.

Lokale Systeme versprechen mehr Kontrolle über Daten und Infrastruktur. OpenClaw positioniert sich als persönlicher Assistent auf eigenen Geräten und verbindet den Agenten mit Kanälen wie Slack, Signal, Telegram oder WhatsApp. Hermes Agent lässt sich selbst hosten und mit verschiedenen Modellen sowie lokalen, Docker-, SSH- oder Cloud-Sandboxes betreiben. Ob daraus volle Datenhoheit entsteht, hängt allerdings davon ab, welches Modell und welche externen Dienste anschließend angebunden werden.

Welche Geschäftsmodelle möglich sind

Rund um Harnesses entstehen mehrere, teilweise überlappende Erlösmodelle.

Open Source mit kommerziellen Zusatzdiensten: Der Kern bleibt frei verfügbar, verdient wird an Hosting, Teamfunktionen oder Governance. Laut Earendils Lizenzierungsmodell für Pi bleibt der Kern MIT-lizenziert, während Zusatzprodukte als Fair Source, proprietäre Software oder Cloud-Dienst angeboten werden können. OpenCode kombiniert einen offenen Coding-Agenten mit dem kostenpflichtigen Gateway OpenCode Zen.

Abonnements und Unternehmenslizenzen: Modellanbieter bündeln Harness und Modelle in Benutzer- oder Teamtarifen. Claude Code ist Teil verschiedener Claude-Abos, OpenAI Codex wird über ChatGPT-Tarife, Credits und API-Nutzung monetarisiert. Im Unternehmensmarkt kommen Identitätsverwaltung, Audit-Logs und Compliance-Funktionen hinzu. Wie umkämpft das Segment ist, zeigt der Markteintritt weiterer Konzerne, etwa Metas Coding-Agent Muse Code.

Managed Runtime: Wer einen Agenten außerhalb der eigenen Geräte betreibt, benötigt isolierte Rechenumgebungen, dauerhaften Status, Geheimnisverwaltung und Protokollierung. Microsofts Foundry Hosted Agents vermarkten diese Ebene als verbrauchsabhängige Laufzeit, die bei Inaktivität auf null skaliert.

Inference-Gateways: Ein modellagnostischer Harness kann zum Vertriebskanal für Rechenleistung werden. OpenCode Zen und Nous Portal bündeln Modelle verschiedener Anbieter und rechnen deren Nutzung über ein eigenes Guthabensystem ab.

Sicherheit, Governance und Memory: Berechtigungen, Prüfregeln, Beobachtbarkeit und Langzeitspeicher lassen sich als eigenständige Produkte verkaufen. ProofAgent kombiniert einen offenen Evaluations-Harness mit einer kommerziellen Governance-Plattform, Mem0 bietet Speicherfunktionen als abgestuften Cloud- und Enterprise-Dienst.

Marktplätze und vertikale Harnesses: Denkbar sind kostenpflichtige Skills und spezialisierte Agentenumgebungen für Recht, Finanzen oder Medizin. Verteilkanäle wie die Plugin-Marktplätze für Claude Code existieren bereits, ein breit etabliertes Revenue-Share-Modell ist bislang jedoch noch nicht belegt.

Bekannte Harnesses und verwandte Systeme

Der Markt reicht von minimalistischen Open-Source-Projekten bis zu umfassenden Unternehmensplattformen. Manche Produkte erfüllen entsprechende Funktionen, ohne den Begriff „Harness“ für sich selbst zu verwenden.

System Einordnung Offenheit und Modellbindung Typische Nutzung
Claude Code Produktisierter Coding-Harness mit mehreren Oberflächen proprietär, an Claude gebunden Terminal, IDE, Desktop, Web und Slack
OpenAI Codex / Codex CLI Coding-Agent mit Harness-Funktionen CLI unter Apache 2.0, OpenAI-Modelle Terminal, IDE, Desktop und Cloud
Gemini CLI Offener, aber modellgebundener Terminal-Agent Apache 2.0, Gemini-Modelle Programmierung und Automatisierung
OpenCode Modellagnostischer Open-Source-Coding-Harness MIT-Lizenz, verschiedene Anbieter Terminal, Desktop und IDE
Pi Minimaler Agent Harness und Entwickler-Toolkit MIT-Kern, mehrere Anbieter Terminal, eigene Agenten und Erweiterungen
OpenClaw Persönliche Agentenplattform mit Harness-Plugins MIT-Lizenz, Provider über Plugins Messaging, lokales Gateway und Web
Hermes Agent Selbst gehosteter Allzweck-Agent MIT-Lizenz, zahlreiche Modelle Terminal, Messaging, Smart Home, Sandboxes
Microsoft Agent Framework Harness Expliziter Harness in einem Agenten-Framework Open-Source-SDK, modellagnostisch .NET/Python und Microsoft Foundry
Nvidia AVO Forschungsarchitektur für Langzeitaufgaben kein verfügbares Produkt belegt ARC-AGI-3 und autonome Optimierung

Anders einzuordnen sind Systeme, die oft im selben Zusammenhang genannt werden: Nvidias NeMo Agent Toolkit bezeichnet sich als offene Bibliothek, die bestehende Frameworks ergänzt. Lefos ist laut der Ankündigung von Earendil eine Endnutzeranwendung für E-Mail und Telegram, die auf dem offenen Pi-Harness aufbaut.

Die Risiken liegen ebenfalls im Harness

Je mehr ein Agent tun darf, desto größer wird die Bedeutung von Sicherheitsgrenzen. Ein kompromittierter Webinhalt kann ihn zu unerwünschten Aktionen verleiten, ein falsch gesetztes Dateirecht dazu führen, dass er sensible Informationen liest oder Daten verändert. Sandboxing, Tool-Freigaben und menschliche Bestätigungen zählen daher zu den zentralen Bestandteilen des Harness. In der SHarD-Studie verbesserten Skill-Scanning, Betriebssystem-Sandboxing und Werkzeugberechtigungen die Sicherheitswerte von Claude Code und Codex deutlich. Einzelne Schutzmechanismen kollidierten jedoch miteinander oder waren technisch nur in einem der beiden Systeme umsetzbar.

Auch lange Arbeitsabläufe bleiben fehleranfällig, was besonders dort zählt, wo Agenten reguläre Aufgaben in der Arbeitswelt übernehmen sollen. Für die Studie DELEGATE-52 untersuchte Microsoft Research 19 Sprachmodelle in 52 beruflichen Domänen. Selbst führende Modelle beschädigten am Ende langer Abläufe durchschnittlich rund 25 Prozent der Dokumentinhalte. In einer ergänzenden Einordnung betonten die Forscherinnen und Forscher, dass sie einen vereinfachten Harness verwendeten und die Resultate nur bedingt auf Produktionssysteme übertragbar seien. Der Harness wirkt damit in beide Richtungen: Er beschleunigt die Arbeit eines Agenten und ist zugleich der Ort, an dem Fehler verstärkt, begrenzt oder entdeckt werden.

Eine neue Wettbewerbsebene der KI

AI Harnesses könnten zu einer der wertvollsten Schichten im künftigen KI-Markt werden, weil sie Modelle in dauerhaft nutzbare Arbeitskräfte verwandeln. Ihr Wert entsteht aus der Kombination von Werkzeugen, Speicher, Sicherheitsregeln, Modellzugang und wiederverwendbaren Abläufen. Wer diese Ebene kontrolliert, bestimmt zunehmend auch, wie ein Agent arbeitet und wie leicht er zu einem anderen Anbieter wechseln kann.

Das Basismodell behält dabei sein Gewicht. Die Forschung zeigt sowohl starke Harness-Effekte als auch Fälle, in denen das Modell den größeren Einfluss hat. Erfolgreiche Systeme dürften daher aus einer abgestimmten Kombination aus Modell, Harness, Werkzeugen und Kontrollmechanismen entstehen. Für Unternehmen verschiebt sich damit die entscheidende Frage: Künftig zählt vor allem, welches Gesamtsystem über Stunden oder Tage zuverlässig arbeitet, seine Kosten kontrolliert, Daten schützt und bei Bedarf den Modellanbieter wechseln kann.

Rank My Startup: Erobere die Liga der Top Founder!
Werbung
Werbung

Specials unserer Partner

Die besten Artikel in unserem Netzwerk

Deep Dives

Wasner + Steinschaden | Der KI Podcast

News, Modelle, Strategien
#glaubandich CHALLENGE: SVAN triumphiert in Klagenfurt

#glaubandich CHALLENGE 2027

Österreichs größter Startup-Wettbewerb - Top-Investoren mit an Bord
© Wiener Börse

IPO Spotlight

powered by Wiener Börse

RankMyStartup.com

Steig' in die Liga der Top Founder auf!

2 Minuten 2 Millionen | Staffel 13

Alle Startups | Alle Deals | Alle Hintergründe

Future{hacks}

Zwischen Hype und Realität

Trending Topics Tech Talk

Der Podcast mit smarten Köpfen für smarte Köpfe

Weiterlesen

Newsletter

Founders Dispatch

Zwei Mal pro Woche kostenlos in die Inbox: die wichtigsten Startups, Deals und Tech-Entwicklungen aus Europa, handgeschrieben von der Redaktion.

Jederzeit abbestellbar. Mehr über den Newsletter