Im April 2026 teilte Ubers Chief Technology Officer in einem Interview mit, dass das Unternehmen sein gesamtes KI-Budget für das laufende Jahr bereits aufgebraucht hatte (1). Acht Monate vor dem Jahresende.
Das war kein Misserfolg. Das war das eigentliche Problem.
Claude Code hatte unter Ubers 5.000 Entwicklern eine Adoptionsrate von 84 bis 95 Prozent erreicht. Die Produktivität stieg, die Entwickler schätzten das Werkzeug. Doch die monatlichen API-Kosten lagen pro Kopf zwischen 500 und 2.000 Dollar und summierten sich schneller, als irgendjemand modelliert hatte. Was als Erfolg hätte gefeiert werden sollen, erzwang eine Grundsatzdiskussion über Budgets, Preismodelle und Wirtschaftlichkeit.
Microsoft zog im Sommer nach, erst leise, dann mit Nachdruck. Zum 30. Juni liefen tausende interne Lizenzen für Claude Code aus, die Entwickler wurden auf das hauseigene GitHub Copilot umgeleitet. Im August folgte eine interne Mail von Executive Vice President Jay Parikh, in der es hieß, tokenmaxxing sei nicht das, worauf man optimiere (2). Seither hat jede Division ein eigenes Token-Budget, das interne Standardmodell wurde auf eine günstigere Variante umgestellt, und der Verbrauch jedes Einzelnen ist in einem Dashboard sichtbar. Die Qualität der Modelle stand dabei nie in Frage, der Preis umso mehr: Kostenkontrolle heißt die neue Disziplin.
Die Ausgangsthese war eingängig. Wissensarbeit ist teuer, weil Menschen teuer sind. Wenn Maschinen Texte schreiben, Code erstellen und Anfragen beantworten, sinken die Kosten, die Produktivität steigt, die Personalkosten fallen. Diese Logik war so glatt, dass kaum jemand nachfragte, wer die Maschinen bezahlt.
Dass schon das Training von Frontier-Modellen Summen im dreistelligen Millionenbereich verschlingt und der Begriff „Open Source" bei KI oft trügt, zeigt ein Blick auf das freie Modell und seine wahren Kosten. Trainingskosten sind allerdings Vergangenheit: einmal ausgegeben, abgeschlossen. Neu ist, dass sich die Kosten vom Training in die tägliche Nutzung verlagern. Dort beginnt ein strukturelles Problem, das die Branche erst langsam durchrechnet.
Die Softwareindustrie hatte über Jahrzehnte ein Geschäftsmodell kultiviert, das sich fundamental von anderen Industrien unterschied. Ein Produkt wird einmal entwickelt und lässt sich beliebig oft verteilen, ohne dass jede weitere Kopie neue Kosten erzeugt. Diese nahezu freie Reproduzierbarkeit machte Software zu einem der attraktivsten Geschäftsmodelle der Wirtschaftsgeschichte.
KI bricht dieses Prinzip auf.
Jede Anfrage an ein Sprachmodell erzeugt echte, laufende Kosten: Rechenzeit auf GPU-Clustern, Energie, Kühlung, Netzwerk. Öffnen eine Million Menschen gleichzeitig eine Textverarbeitung, entstehen dem Hersteller keine zusätzlichen Produktionskosten. Stellen eine Million Menschen gleichzeitig Anfragen an ein Sprachmodell, laufen Kühlsysteme, drehen Lüfter, steigen Stromrechnungen.
Ökonomen sprechen von Grenzkosten, dem Preis für eine weitere produzierte Einheit. In der Softwarewelt tendierten sie gegen null, und genau darauf gründete der Plattformkapitalismus: einmal entwickeln, endlos skalieren. KI kehrt zu einer Ökonomie zurück, die Fertigungsunternehmen seit jeher kennen. Jeder Auftrag verbraucht Material. Jede Anfrage verbraucht Strom.
Für die Planung hat das unmittelbare Folgen. Klassische Software wird nach Lizenzen oder Sitzen eingekauft, ein fixer Jahresbetrag, den eine Organisation im Januar schon für den Dezember kennt. GitHub hat seine Copilot-Pläne im Juni auf nutzungsbasierte Abrechnung umgestellt, und damit gilt auch dort: Wer mehr nutzt, zahlt mehr. Finanzabteilungen, die KI-Ausgaben wie Software-Lizenzen behandeln, stellen fest, dass die Budgets nicht bis zum Jahresende reichen. Hinter jedem der Fälle, über die gerade berichtet wird, steckt dasselbe Beschaffungsproblem.
Der Sommer 2026 hat diese Fälle in schneller Folge geliefert. Atlassian dokumentiert die KI-Kosten pro Mitarbeitendem in einem internen Dashboard, nachdem die Ausgaben sprunghaft gestiegen waren. Adobe beendete die unbegrenzte Nutzung Ende Juni, Amazon führte binnen zwei Wochen nach Abschaffung eines internen Nutzungsrankings echte Token-Limits ein. Bei Citi wurden Angestellte aufgefordert, vor jeder Anfrage zu prüfen, ob Kolleginnen und Kollegen die Ressourcen sinnvoller einsetzen könnten, eine Rationierung, die exakt jene Grenzkostenrechnung abbildet, die Anbieter längst selbst anstellen. Öffentlich bestritten Citi und Atlassian die Einschränkungen, obschon interne Dokumente laut 404 Media das Gegenteil zeigen (3).
Aus diesem Problem folgt ein Widerspruch, den die Anbieter ungern laut aussprechen. KI wird als Produktivitätswerkzeug positioniert: Je intensiver jemand sie einsetzt, desto mehr leistet er. Bei klassischer Software ist der ideale Nutzer derjenige, der das Produkt täglich verwendet. Bei tokenbasierter KI wird genau dieser Nutzer zum teuersten Kunden.
Dass die Preise pro Token fallen, ändert daran erstaunlich wenig. Seit Ende 2022 sind sie um rund 98 Prozent gesunken, die KI-Rechnungen der Unternehmen haben sich trotzdem verdreifacht, weil agentische Werkzeuge pro Aufgabe ein Vielfaches an Tokens verbrauchen. Ökonomen kennen das Muster seit dem 19. Jahrhundert als Jevons-Paradoxon: Als Dampfmaschinen effizienter wurden, sank der Kohleverbrauch nicht, er stieg, weil sich plötzlich mehr Anwendungen lohnten. Ein Agent, der dieselbe Codebasis in vierzig Durchläufen wieder und wieder liest, ist die Dampfmaschine dieser Rechnung.
Wer KI-Werkzeuge erfolgreich in Prozesse integriert, hat also höhere KI-Kosten. Wer die Nutzung einschränkt, gibt den versprochenen Vorteil auf. Viele Unternehmen wählen inzwischen einen dritten Weg: günstige Modelle als Standard, teure nur dort, wo sie sich begründen lassen. Microsoft hat genau das umgesetzt, und die Anbieter bekommen es zu spüren.
Wie weit die Kalkulation von der Wirklichkeit abweicht, zeigt eine Untersuchung der Beratungsfirma Accenture: KI-Werkzeuge kommen häufiger bei einfachen Aufgaben zum Einsatz, etwa beim Umwandeln von PDF-Dateien in Präsentationsfolien, als bei anspruchsvoller Programmierarbeit. Ein erheblicher Teil des Kostenanstiegs geht damit auf Angestellte zurück, die Spitzenrechenleistung für Routine verbrauchen.
Klarna galt lange als Paradebeispiel der KI-gestützten Transformation und ist inzwischen das Lehrstück der Turing-Falle. Der Zahlungsdienstleister verkleinerte seine Belegschaft deutlich, erklärte öffentlich, KI könne menschliche Arbeit übernehmen, und begann Mitte 2025 wieder einzustellen, nachdem die Kundenzufriedenheit gesunken war. Die Rückabwicklung erzeugte eigene Kosten: Wiedereinstellung, Onboarding, beschädigtes Vertrauen.
Klarna ist kein Einzelfall. Forrester Research schätzte im Future-of-Work-Report 2026, dass 55 Prozent der Arbeitgeber es bereuen, Mitarbeitende aus KI-bezogenen Gründen entlassen zu haben (4). Ein Drittel jener, die Stellen wieder besetzt haben, gab dafür mehr aus, als die Entlassungen ursprünglich eingespart hatten. Gartner prognostiziert, dass die Hälfte der Unternehmen, die Kundenservice-Rollen gestrichen haben, diese innerhalb eines Jahres wieder besetzen wird.
Hinter diesen Zahlen steckt ein konsistentes Muster. KI erledigt 60 bis 80 Prozent einer Aufgabe zuverlässig und schnell. Die verbleibenden 20 bis 40 Prozent bleiben menschlich: Eskalationen, Urteilsvermögen, Verantwortung in Grenzfällen. Diese letzte Meile erscheint selten in der ersten Version der Kalkulation, ebenso wenig wie Qualitätskontrolle, Halluzinationsprüfung oder regulatorische Haftung.
Bryan Catanzaro, Vizepräsident für Applied Deep Learning beim Chiphersteller Nvidia, brachte es gegenüber Axios auf den Punkt: Für sein Team lägen die Rechenkosten weit über den Personalkosten. Goldman Sachs Research kam im Mai 2026 zu einem ähnlichen Befund für den Kundenservice, wo menschliche Mitarbeitende in der Gesamtrechnung günstiger sein können als ihre KI-Gegenstücke (5). Und eine MIT-Studie ermittelte schon 2024, dass KI nur in etwa 23 Prozent der untersuchten Aufgaben wirtschaftlich sinnvoller war als menschliche Arbeit (6).
Man könnte erwarten, dass die Anbieter auf diese Kosten-Realität mit Preissenkungen reagieren. Das geschieht auch, allerdings an Stellen, die in keiner Preistabelle oben stehen. Als Anthropic am 1. September Claude Fable 5.1 vorstellte, blieben die Listenpreise von 10 Dollar pro Million Eingabe- und 50 Dollar pro Million Ausgabetoken unverändert. Gesenkt wurde der Preis für Cache-Lesezugriffe, also für Kontext, den das Modell bereits verarbeitet hat, und zwar um drei Viertel. Für typische Arbeitslasten beziffert Anthropic die Ersparnis auf rund 25 Prozent, für stark agentische Aufgaben auf bis zu 45 Prozent.
Ganz so glatt geht die Rechnung nicht auf. Unabhängige Tests von Artificial Analysis ergaben, dass Fable 5.1 für dieselbe Aufgabe etwa 1,7-mal so viele Ausgabetoken erzeugt und pro erledigter Aufgabe teurer sein kann als sein Vorgänger. Der Rabatt sitzt damit genau dort, wo er die Kennzahl schont, an der Investoren ein Unternehmen wenige Wochen vor dem Börsengang messen. Der Listenpreis bleibt, was er in jeder Verhandlung mit Großkunden ist: ein Ankereffekt.
Die Kunden reagieren auf ihre Weise. Nach Auswertungen des Zahlungsdienstleisters Ramp fielen die durchschnittlich gezahlten Tokenpreise von 1,15 Dollar pro Million im März auf 0,68 Dollar im August, auch weil viele Unternehmen auf ältere, günstigere Modelle ausweichen (7). Bei den Firmen mit der intensivsten KI-Nutzung sanken die Ausgaben pro Kopf im August um fast zehn Prozent, und der Anteil der Ramp-Kunden, die überhaupt für KI zahlen, stagnierte bei 56 Prozent. Laut einer Auswertung der Financial Times entfielen mehr als zwei Monate nach dem Start nur rund 11 Prozent der Anthropic-Ausgaben von etwa 70.000 Unternehmen auf Fable 5 (8). Wer rechnen muss, greift zum Vorgängermodell.
Der Grund für die Zurückhaltung bei den Listenpreisen steht im Kalender. Anthropic hat im Juni vertraulich einen Börsengang bei der US-Börsenaufsicht beantragt; nach Reuters-Informationen soll die Vermarktung frühestens Mitte Oktober beginnen und die Notierung wenige Tage vor den US-Zwischenwahlen im November abgeschlossen sein (9). Im Raum steht eine Bewertung von bis zu 2 Billionen Dollar, mehr als das Doppelte der 965 Milliarden aus der letzten privaten Finanzierungsrunde. OpenAI hat ebenfalls vertraulich eingereicht, erwägt nach Reuters-Berichten aber, mit dem Börsengang bis 2027 zu warten; im ersten Quartal 2026 verlor das Unternehmen Berichten zufolge rund 1,22 Dollar pro eingenommenem Dollar.
Anthropic steht besser da und stellte Investoren für das zweite Quartal 2026 den ersten operativen Gewinn in Aussicht. Aufschlussreicher ist eine andere Zahl: Die Prognose für die Bruttomarge 2025 musste das Unternehmen von 50 auf rund 40 Prozent senken, weil die Inferenzkosten höher ausfielen als geplant. Die Grenzkosten stehen inzwischen in den Büchern der Anbieter selbst. Wer die Listenpreise jetzt senkt, drückt die Umsatzkennzahlen, auf die es beim Listing ankommt. Wer sie hält, riskiert, dass Großkunden weiter rationieren. Die Preisentscheidungen dieses Herbstes fallen deshalb im Wettbewerb und in der Roadshow-Präsentation gleichermaßen.
Ein Blick zurück lohnt. Die Dotcom-Ära verlief strukturell ähnlich: Enormes Kapital floss in Infrastruktur und Wachstum, bevor tragfähige Geschäftsmodelle existierten. Aus der Konsolidierung gingen Google, Amazon und das Cloud-Ökosystem hervor, aber kein Unternehmen, das damals Verluste schrieb, wurde dadurch automatisch zum Gewinner. Dass sich Geschichte ähnelt, ist kein Versprechen, dass sie sich wiederholt.
Allein die vier großen Hyperscaler Microsoft, Amazon, Alphabet und Meta planen für 2026 inzwischen rund 700 Milliarden Dollar an Investitionen, fast doppelt so viel wie im Vorjahr; bei Microsoft gehen von 190 Milliarden etwa 25 Milliarden allein auf gestiegene Komponentenpreise zurück (10). Breit angelegte Daten, die proportionale Produktivitätsgewinne belegen, fehlen weiterhin. Die Elektrifizierung hat gezeigt, dass sich eine solche Rendite um Jahrzehnte verspäten kann.
Die Frage, ob KI Arbeit ersetzt, hat die Debatte jahrelang dominiert, und sie hat ihre Berechtigung behalten. Dringlicher ist inzwischen eine andere: Kann KI wirtschaftlich so günstig werden, wie es die ursprünglichen Versprechen verlangten? Modelle werden effizienter, Tokenpreise sinken, Open-Source-Alternativen holen auf. Gleichzeitig wächst der Hunger nach Rechenleistung schneller als jeder Effizienzgewinn, und ein Börsenumfeld, das Listenpreise einfriert, ist kein günstiger Moment für Kundeninteressen.
Eine strukturelle Antwort auf das Budgetierungsproblem liegt im eigenen Betrieb. Wer Sprachmodelle auf eigener Infrastruktur betreibt, zahlt Fixkosten statt variabler Nutzungskosten: Eine Stunde intensiver Nutzung kostet so viel wie eine ruhige, und kein Agent sprengt das Quartalsbudget, weil er eine Codebasis zum vierzigsten Mal liest. Für Verbände und medizinische Einrichtungen kommt hinzu, dass sensible Daten im eigenen System bleiben. Ehrlich gesagt werden muss: Lokale Modelle erreichen selten die Spitzenleistung von Frontier-Modellen wie Claude Fable 5.1. Wer mit einem Großteil dieser Leistung auskommt und der Token-Spirale entgehen möchte, findet hier einen gangbaren Weg.
Leistungsfähigkeit und Wirtschaftlichkeit sind nicht dasselbe.
Wer das verwechselt, finanziert den nächsten Börsengang.