Die KI-Startup-Falle: Founder werden zu Token-Resellern
Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.
Viele KI-Startups glauben, ein Softwaregeschäft zu betreiben, während ihre Margen wie die eines Zwischenhändlers aussehen.
Stell dir eine Sport-App vor: kostenlos zum Mitlaufen, Premium für 9,99 Euro im Monat mit KI-Coach, der Trainingspläne baut, Läufe analysiert und rund um die Uhr Fragen beantwortet. 100.000 Menschen nutzen sie, 5 Prozent zahlen. Das sind 5.000 Premium-User und knapp 50.000 Euro Umsatz im Monat. Klingt solide, bis die Rechnung kommt.
Wie die Rechnung aussieht
Rund 15 Prozent gehen an den App Store, also etwa 7.500 Euro. Die KI-Coach-Funktion der Premium-User verschlingt im Schnitt 3 Euro Token-Kosten pro Kopf, macht 15.000 Euro. Und weil die Gratis-User ohne Schnupperfunktion nie konvertieren würden, bekommen auch sie ein paar KI-Antworten pro Woche, sagen wir für 20 Cent pro Kopf. Bei 95.000 Gratis-Usern sind das weitere 19.000 Euro. Übrig bleiben rund 8.500 Euro, also etwa 17 Prozent vom Umsatz. Die Premium-User bezahlen ihren eigenen Coach, die KI-Antworten der Gratis-Fraktion und die Marge des Lieferanten. Der eigentliche Gewinner sitzt in San Francisco und schickt jeden Monat die Rechnung.
Die Zahlen sind fiktiv, die Mechanik ist es nicht. Klassische Software hatte Grenzkosten nahe null, jede zusätzliche Userin kostete praktisch nichts. Mit KI kostet jede Anfrage Rechenzeit. Laut einer Marktstudie liegt der Anteil der Inferenz am Umsatz bei skalierenden KI-Firmen im Schnitt bei 23 Prozent, die Bruttomargen sitzen bei rund 52 Prozent, verglichen mit 78 bis 80 Prozent bei klassischem SaaS (zur Studie über die Token-Steuer im Anwendungsmarkt). Das ist ein Strukturbruch im Geschäftsmodell: Software, die sich wie ein Rohstoffhandel rechnet. Entsprechend stellen Anbieter wie Notion, GitHub Copilot oder Zendesk laut Trending Topics bereits teilweise von Flatrates auf verbrauchsabhängige Preise um.
Wer die Preise macht
Wer Token weiterverkauft, verhandelt mit Lieferanten, die zugleich Konkurrenz sind. OpenAI und Anthropic bauen eigene Apps, Coding-Tools, Agenten, Browser. Sie bestimmen, was ein Token kostet, wie lang ein Kontextfenster sein darf, welche Modelle auslaufen und welche Rate Limits gelten. Kein Startup kann seinen Kund:innen sagen: Wir wechseln einfach den Lieferanten, wenn das Frontier-Modell des einen Anbieters nur mit dem Produkt des anderen mithalten kann.
Das ist Pricing Power in Reinform. Wer die besten Modelle hat, kann Aufschläge verlangen, Tarife umbauen oder Vielnutzer:innen gezielt zur Kasse bitten. Kunden mit großen Rechnungen merken das als Erste. Die Gegenstrategie ist teuer: Der Coding-Editor Cursor ist ein oft zitiertes Beispiel für ein Startup, das sich aus der Abhängigkeit freikämpfen wollte, indem es Hunderte Millionen in eigene Modell-Infrastruktur investierte. Die Analyse dazu hält fest: Das ist ein Spielbuch, das die meisten B2B-Startups nicht nachspielen können. Inzwischen gehört Cursor zu SpaceX, und damit hängt der Editor an einer der größten KI-Rechenkapazitäten der Welt: Der Konzern betreibt mit Colossus einen eigenen Cluster mit rund 200.000 Nvidia-GPUs. Die Unabhängigkeit von den Modell-Anbietern gibt es hier nur im Paket mit einem Konzern, der eigene Rechenleistung mitbringt.
Souveräne KI können sich nur wenige leisten
Wirklich unabhängig ist, wer drei Dinge selbst beherrscht: Chips, Betrieb und Strom. Das heißt GPUs in Stückzahlen, die zu Schlangen vor den Fabriken führen, Rechenzentren mit der nötigen Kühlung und Netzanbindung, Teams, die Cluster am Laufen halten, und dazu Energieverträge, die sich mit Industriegrößen messen lassen. Dazu kommen Training, Datenpipelines und der Mut, Milliarden zu verbrennen, bevor ein Euro zurückfließt.
Das können eine Handvoll Konzerne und ein paar extrem gut kapitalisierte Labs. Alle anderen, vom Fintech bis zur Sport-App, bleiben Kund:innen. Dass ein Startup in Wien, Berlin oder Paris ein eigenes Frontier-Modell trainiert, ist ein schöner Gedanke, aber mit Seed- oder Series-A-Budgets ungefähr so realistisch wie ein eigenes Mobilfunknetz.
Neoclouds lösen das Problem nicht
Die europäische Antwort lautet oft: Neoclouds. Anbieter, die GPU-Kapazität in Europa betreiben, Daten im Land halten und Souveränität als Verkaufsargument führen. Das hat seinen Wert, etwa für Datenschutz, Compliance und Latenz. Gartner erwartet, dass solche Anbieter bis 2030 rund ein Fünftel des KI-Cloud-Markts auf sich vereinen.
Für die Abhängigkeit selbst ändert das wenig. Auch bei der europäischen Neocloud kauft das Startup Token oder GPU-Stunden ein und verkauft sie in Form von Funktionen an die eigenen User weiter. Es ist dasselbe Zwischenhändler-Modell mit einem anderen Lieferanten und einem anderen Rechenzentrumsstandort. Die Margenlogik bleibt, die Preisgestaltung liegt weiter beim Vorlieferanten, und der kontrolliert in vielen Fällen ebenfalls US-Hardware. Datenhoheit und wirtschaftliche Souveränität sind zwei verschiedene Dinge.
Die Gegenposition
Es gibt eine andere Lesart, und sie hat Zahlen. Laut derselben Marktstudie fallen die Inferenzkosten um rund das Zehnfache pro Jahr, sodass die Bruttomargen von KI-Anwendungen steigen dürften. KI-native Startups haben demnach rund 63 Prozent des Anwendungsmarkts erobert, in Bereichen wie Coding, Vertrieb und Finanzen sogar zwischen 71 und 91 Prozent. Die Analyse betont allerdings auch, dass etablierte Konzerne durch Bündelung ihrer Produkte weiter Marktmacht behalten. Aus dieser Sicht ist der Zwischenhandel eine Übergangsphase, in der sinkende Token-Preise und Modellwettbewerb den Anwendungsschicht-Startups in die Karten spielen.
Was Gründer:innen daraus machen können
Wer Token weiterverkauft, sollte sich ehrlich fragen, was am Produkt übrig bleibt, wenn der Lieferant morgen dasselbe anbietet. Proprietäre Daten, tiefe Workflow-Integration, Vertrauen und Distribution sind Verteidigungslinien, die kein Modellupdate wegwischt. Preismodelle, die Nutzung abbilden statt Flatrates zu verschenken, verhindern, dass die Premium-User die Gratis-Fraktion und den Token-Lieferanten gleichzeitig finanzieren. Kleine, günstige Modelle für Routinejobs, Frontier-Modelle nur dort, wo sie den Unterschied machen, drücken die Rechnung. Und Architekturen, die den Anbieterwechsel ermöglichen, halten die Verhandlungsposition offen.
Wer als Startup überleben will, bleibt von einem einzelnen Anbieter unabhängig, optimiert die Token-Kosten konsequent und bietet viel mehr Mehrwert als die reinen KI-Funktionen. Sonst lässt sich das ganze Produkt an einem Nachmittag als ChatGPT-Plugin nachbauen.

