Kurz gesagt: Der Preis eines Tokens sinkt, während die Token-Kosten steigen. Das bedeutet, dass die entscheidende Budgetierungsgröße innerhalb einer Bank oder eines Fonds nicht mehr darin besteht, was ein Token kostet, sondern wie viele Token für eine Aufgabe verbraucht werden.
Bei den Ergebniskonferenzen ist das Thema „Token-Aufwendungen“ nun zur Sprache gekommen
Zwei Jahre lang waren die KI-Kosten innerhalb von Finanzinstituten ein Technologieposten, den niemand außerhalb der IT-Abteilung hinterfragte. Das hat sich in diesem Quartal geändert. Nach der Veröffentlichung der Ergebnisse von Goldman Sachs räumte David Solomon ein, dass “Es wird viel über die Ausgaben für Token und die Kosten der Technologie gesprochen.”, und warnte, dass der Ausbau “nicht ohne Rückschläge und Kurskorrekturen verlaufen wird, da erst noch geklärt werden muss, wie groß der tatsächliche Bedarf an dieser Technologie in Unternehmen letztendlich ist.”
Sharon Yeshaya, Finanzchefin von Morgan Stanley, äußerte sich präziser zur Entwicklung des Unternehmens Telefonkonferenz zum zweiten Quartal. Die Kosten dafür seien, so sagte sie, “ein Thema, das in diesem Jahr zwar keine finanzielle Bedeutung hat, aber in Zukunft möglicherweise an Bedeutung gewinnen könnte”, und es beansprucht bereits die Aufmerksamkeit der Geschäftsleitung.
Lesen Sie das bitte sorgfältig durch, denn darin liegt das gesamte Problem in einem Satz zusammengefasst. Kosten, die heute noch unerheblich sind, morgen aber eine wesentliche Rolle spielen, sind genau die Art von Kosten, die sich der Haushaltsdisziplin entziehen, bis sie zu groß sind, um sie noch unauffällig zu bereinigen.
Der Preisverfall ist real, und er ist eine Falle
Jede Kennzahl gibt Anlass zu Optimismus. Die durchschnittlichen Kosten für eine Million Token sank im Vergleich zum Vorjahr um 67%. Die Preise für Frontier-Produkte sind seit März 2023 um etwa 94,51 TP3T gesunken, da Öffentliches Benchmarking von Inferenzpreisen. Die Unterschiede zwischen den einzelnen Stufen sind mittlerweile enorm: Ein Standardmodell kostet nur wenige Cent pro Million eingegebener Token, während ein Modell mit fortschrittlichen Schlussfolgerungsalgorithmen mehrere Dollar kostet – und die Kosten für die Ausgabe sind noch um ein Vielfaches höher.
Und dennoch, im selben Erhebungszeitraum, 73% der Organisationen gaben an, dass die KI-Kosten ihre ursprüngliche Budgetplanung überstiegen hätten, während der Anteil der Teams, die ihre KI-Ausgaben aktiv verwalten, von 31% zwei Jahre zuvor auf 98% gestiegen ist. Sinkende Stückpreise, steigende Rechnungen und ein nahezu flächendeckendes Kostenmanagement, das die Entwicklung dennoch nicht eindämmen kann.
Der Mechanismus ist die elastische Nachfrage. Wenn die Grenzkosten einer Schlussfolgerung sinken, legen Unternehmen die Einsparungen nicht beiseite. Sie verlängern die Argumentationsketten, fügen Tool-Aufrufe hinzu, erweitern die Kontextfenster und übertragen Aufgaben an Agenten, die wiederum andere Agenten aufrufen. AT&T hat öffentlich berichtet, dass die Skalierung von etwa 8 Milliarden bis 27 Milliarden Token pro Tag nach der Einführung von Multi-Agenten-Systemen. Google hat berichtet, dass monatlich etwa 1,3 Billiarden Token verarbeitet werden, was einem Anstieg um das etwa 130-Fache im Vergleich zum Vorjahr entspricht.
Die Variable, die den Gesetzentwurf vorantreibt, ist die Anzahl der Token pro Aufgabe
Hier sollte ein quantitativ geschulter Leser seinen Fokus legen. Die Ausgaben ergeben sich aus dem Produkt aus Preis und Volumen. Der Preis folgt einer einigermaßen vorhersehbaren Kurve und ist in der Preisliste ersichtlich. Das Volumen hingegen nicht, da es nicht von der Nutzerzahl abhängt. Es hängt vielmehr von der Architektur ab.
Denkprozesse und handlungsbezogene Arbeitsbelastungen beanspruchen fünf- bis dreißigmal mehr Token pro Aufgabe als die entsprechende Chat-Interaktion. Eine einzelne Anfrage, die über eine Abruf-Pipeline mit einem Schlussfolgermodell und drei Tool-Aufrufen geleitet wird, kann ein bis zwei Größenordnungen mehr Tokens verbrauchen als dieselbe Frage, die direkt an ein kleineres Modell gestellt wird. Schlussfolgermodelle erzeugen lange interne Gedankengänge, die als Ausgabetokens abgerechnet werden, sodass das Verbrauchsprofil stark von dem abweicht, was die Benutzeroberfläche anzuzeigen scheint.
Das Ergebnis ist, dass der Token-Verbrauch in Bezug auf die für den Nutzer sichtbaren Aktivitäten nicht linear verläuft. Diese eine Eigenschaft erklärt den Großteil des Prognosefehlers auf dem Markt. Eine Bank, die KI-Kosten als Anzahl der Arbeitsplätze multipliziert mit einem Preis pro Arbeitsplatz modelliert, hat ein lineares Modell eines nichtlinearen Systems erstellt, und der Fehler vergrößert sich in Richtung überhöhter Ausgaben jedes Mal, wenn ein Entwicklerteam ein Modell aktualisiert oder einem Agenten mehr Autonomie gewährt.
Token sind zudem nicht homogen, was eine naive Volumenverfolgung zunichte macht. Die Wirtschaftlichkeit von Diensten bewegt sich an der Schnittstelle zwischen Durchsatz und Interaktivität, und das aussagekräftige Maß ist der „Goodput“: also die Leistung, die ein definiertes Latenz- und Geschwindigkeitsziel erfüllt, und nicht die Anzahl der produzierten Token.
| Token-Klasse | Profil | Dort, wo es hingehört |
|---|---|---|
| Großmenge | Hoher Durchsatz, geringe Geschwindigkeit pro Nutzer, kostengünstigste Bereitstellung | Dokumentenverarbeitung über Nacht, Einbettungen, Zusammenfassung in Stapeln |
| Goldilocks | Mäßige Interaktivität bei nahezu optimalem Durchsatz | Die meisten internen Analysten- und Kundendienstanwendungen |
| Premium mit geringer Latenz | Hohe Geschwindigkeit pro Nutzer, geringerer Gesamtdurchsatz, höhere Stückkosten | Sprachassistenten und Arbeitsabläufe, bei denen die Reaktionszeit die Produktivität einschränkt |
| Begründung | Sieht nach einem Standardaufruf aus; erzeugt pro zurückgegebenem Token viele interne Token. | Ausschließlich wirklich schwierige analytische Probleme; die Hauptursache für unerwartete Ausgaben |
| Das Rahmenkonzept basiert auf der Token-Ökonomie der FinOps Foundation und veröffentlichten Benchmark-Ergebnissen zu Inferenzverfahren (2026). | ||
Die Förderphase ist beendet
Die Annahme, die stillschweigend in den meisten mehrjährigen KI-Budgets zugrunde liegt, ist, dass die Preissenkungen im nächsten Jahr das Volumenwachstum des laufenden Jahres ausgleichen werden. Diese Annahme ist nun nicht mehr sicher, da die Anbieter begonnen haben, ihre Preise neu festzulegen, um ihre Kosten zu decken.
Der Unternehmenswandel bei Anthropic im April 2026 ist das deutlichste Beispiel dafür. Das Unternehmen Unternehmenskunden wurden auf ein Modell aus Lizenzgebühren und im Voraus festgelegter Token-Nutzung umgestellt, ohne dass ein Nutzungsspielraum enthalten ist, und trennte Pauschalabonnements von Agent-Harnesses von Drittanbietern, die nach Schätzungen von Analysten ein Vielfaches an Rechenleistung pro Dollar verbrauchten, als das Abonnement zu unterstützen ausgelegt war. Der Produktleiter von OpenAI für ChatGPT brachte denselben Punkt noch deutlicher auf den Punkt und merkte an, dass ein unbegrenzter KI-Tarif strukturell einem unbegrenzten Stromtarif ähnelt und nicht funktioniert.
Die praktische Konsequenz für die Finanzabteilung oder den CFO besteht darin, dass Einkäufer den Rechenbedarf nun so prognostizieren müssen, wie sie es vor einem Jahrzehnt – auf schmerzhafte Weise – bei der Prognose des Cloud-Bedarfs gelernt haben. Die Listenpreise pro Token sinken zwar weiter, doch konzentrieren sich die Rückgänge auf die Standard-Leistungsstufen, während die Stufen, die für agentenbasierte Workloads tatsächlich erforderlich sind, stabiler bleiben.
Was disziplinierte Institutionen tun
Yeshaya beschrieb den Ansatz von Morgan Stanley mit Begriffen, die jeder Betreiber als gewöhnliches Kostenmanagement erkennen würde: “Wende das richtige Modell für den richtigen Zweck an und setze Open Source dort sinnvoll ein, wo es angebracht ist.”. Ihr Anwendungsbeispiel ist gerade deshalb aufschlussreich, weil es so alltäglich ist. Die Zusammenfassung eines Analystenberichts ist eine echte Arbeitsaufgabe mit echtem Nutzen, und dafür “braucht man wirklich kein brandneues, hochmodernes und unglaublich teures Modell”.
Das ist das sogenannte „Model Routing“ und stellt die Kontrollmaßnahme mit der höchsten Rendite dar. Darum herum gruppieren sich die übrigen Maßnahmen: das Zwischenspeichern wiederkehrender Kontexte, das Bündeln aller Vorgänge, die nicht interaktiv sein müssen, die Begrenzung der Rekursionstiefe von Agenten sowie die Messung des „Goodput“ anstelle der reinen Token-Anzahl, damit ein schnelles und ein langsames Token nicht als gleichwertiges wirtschaftliches Gut behandelt werden.
Die Buchhaltung ist genauso wichtig wie die Technik. Die Herangehensweise von BCG in seiner Arbeit zu Verwaltung des Wertmarkenzählers ist, dass Token-Ausgaben nicht in eine einzige Kategorie fallen. Token, die wiederverwendbare Funktionen schaffen, verhalten sich wie Investitionen. Token, die interne Aufgaben ausführen, sind Betriebsausgaben. Token, die innerhalb eines Produkts oder bei einer Kundeninteraktion verbraucht werden, sind Wareneinsatzkosten. Ein Unternehmen, das alle drei Posten als IT-Gemeinkosten verbucht, kann nicht erkennen, welches seiner KI-Programme Wert schafft und welches still und leise die Marge schmälert.
Die letzte Kontrollmaßnahme ist die Zuordnung. Die Rückverrechnung des Token-Verbrauchs an die Abteilung, die ihn verursacht hat, verändert das Verhalten auf eine Weise, wie es ein zentrales Budget niemals vermag – aus demselben Grund, aus dem verbrauchsabhängige Versorgungsleistungen sorgfältiger genutzt werden als Pauschalangebote.
Warum es hier um eine Margenfrage und nicht um eine technologische Frage geht
Hier ist der Aspekt, dem am wenigsten Aufmerksamkeit geschenkt wird, der für Eigentümer und Kapitalgeber jedoch am wichtigsten ist.
Jamie Dimon wies die Vorstellung zurück, dass die durch KI erzielte Effizienz einfach dem Unternehmen zugutekommt, das sie einsetzt. “Wir können nicht einfach sagen: ‘Ach, das wird unsere Margen steigern, und das werden wir beibehalten.’ Wenn das zuträfe, lägen unsere Margen heute bei 80% – allein aufgrund der Computerisierung in den letzten 20 Jahren.” Er fuhr fort: “Nicht nur Sie profitieren von KI. Die größten Nutznießer der KI werden unsere Kunden sein.”
Der Wettbewerb gibt die Produktivitätsgewinne an den Kunden weiter. Was in der Gewinn- und Verlustrechnung verbleibt, sind die Kosten. Für einen Vermögensverwalter oder einen Fonds verlagern sich diese Kosten vom einmaligen Projektkapital hin zu wiederkehrenden Dienstleistungskosten und landen auf einer Gebührenbasis, die ohnehin schon strukturell unter Druck steht. Eine Technologieentscheidung wird daher zu einer Frage der Nachhaltigkeit der operativen Marge – und genau diese ist der Faktor, der den Multiplikator bestimmt, den ein Käufer zu zahlen bereit ist.
Auch das Umfeld auf der Inputseite wird sich nicht entspannen. Ted Pick, Vorstandsvorsitzender von Morgan Stanley, wies darauf hin, dass die Prognose für die Investitionsausgaben im Bereich Rechenzentren bei $575 Milliarden für 2026 nähern sich $850 Milliarden an, wobei die Schätzung für 2027 von etwa $700 Milliarden auf $1,3 Billionen revidiert wurde, und schätzte, dass die Branche über den gesamten Investitionszyklus hinweg nur 10% bis 15% beträgt. Zulieferer, die in diesem Tempo ausbauen, müssen letztendlich eine Rendite daraus erzielen.
Was kann man dagegen tun?
Wenn Sie eine Vermögensverwaltungsgesellschaft oder einen Fonds leiten. Berechnen Sie die Instrumentenkosten pro Aufgabe, bevor Sie einen Anwendungsfall skalieren, nicht danach. Legen Sie ein explizites Token-Budget pro Workflow fest, mit einem Schwellenwert, bei dessen Erreichen der Workflow neu gestaltet oder deaktiviert wird, und leiten Sie jede Aufgabe an die kostengünstigste Stufe weiter, die die Qualitätsanforderungen erfüllt. Klassifizieren Sie die Token-Ausgaben als Investition, Betriebsausgabe oder Umsatzkosten und verrechnen Sie sie an die Abteilung, die sie verbraucht. Dimons eigene Einordnung ist dabei eine nützliche Orientierungshilfe: JPMorgan betreibt fast tausend KI-Anwendungsfälle, von denen er etwa 50 als wirklich wichtig einstuft.
Wenn Sie eine Due-Diligence-Prüfung durchführen oder eine Zuweisung vornehmen. Hören Sie auf, Anwendungsfälle zu zählen. Fragen Sie nach den Kosten pro Aufgabe, der dahinterstehenden Preisstufenmischung und der Entwicklung der Token pro Aufgabe in den letzten zwei Quartalen. Ein Unternehmen mit tausend Pilotprojekten und ohne solide Wirtschaftlichkeit hat eine Kostenstelle mit guter Öffentlichkeitsarbeit aufgebaut. Ein Unternehmen, das seine Kosten pro abgeschlossenem Workflow angeben und zeigen kann, dass diese sinken, während das Volumen steigt, hat etwas geschaffen, das die Preisneufestsetzung übersteht.
Die Institutionen, die diesen Zyklus unbeschadet überstehen, werden nicht diejenigen sein, die am wenigsten für Inferenz ausgegeben haben. Es werden diejenigen sein, die stets wussten, was sie eine Einheit davon gekostet hat und welchen Nutzen sie davon hatten.
Referenzen
- diginomica. “Tokenomics – Die Investitionsrichtung von Goldman Sachs, JP Morgan Chase und Morgan Stanley” (Stuart Lauchlan, 17. Juli 2026). https://diginomica.com/tokenomics-direction-investment-travel-goldman-sachs-jp-morgan-chase-and-morgan-stanley
- FinOps Foundation. “Token Economics: Die atomare Einheit des KI-Werts” (J.R. Storment). https://www.finops.org/insights/token-economics-the-atomic-unit-of-ai-value/
- FinOps Foundation. Bericht „State of FinOps 2026“. https://data.finops.org/
- Epoch AI. “Die Preise für LLM-Inferenz sind rapide gesunken, jedoch je nach Aufgabe in unterschiedlichem Maße.” https://epoch.ai/data-insights/llm-inference-price-trends
- Boston Consulting Group. “Return on AI: Wie CFOs und CIOs den ”Token Meter‘ steuern können“ (2026). https://www.bcg.com/publications/2026/managing-ai-token-costs
- Morgan Stanley. Transkript der Telefonkonferenz zum Ergebnis des 2. Quartals 2026 (15. Juli 2026). https://www.fool.com/earnings/call-transcripts/2026/07/15/morgan-stanley-ms-q2-2026-earnings-call-transcript/
- Deloitte Insights. “KI-Token: Wie man sich in der neuen Ausgabendynamik der KI zurechtfindet.” https://www.deloitte.com/us/en/insights/topics/emerging-technologies/ai-tokens-how-to-navigate-spend-dynamics.html