Ch. du Vernay 14a
CH-Vaud
1196 Stopfbuchse
info@neumarz.com
+41.21.561.34.96
Zurück

Die Token-Preise fielen um 67%. Drei von vier KI-Budgets wurden trotzdem überschritten.

Kurz gesagt: Der Preis eines Tokens sinkt, während die Token-Kosten steigen. Das bedeutet, dass die entscheidende Budgetierungsgröße innerhalb einer Bank oder eines Fonds nicht mehr darin besteht, was ein Token kostet, sondern wie viele Token für eine Aufgabe verbraucht werden.

Bei den Ergebniskonferenzen ist das Thema „Token-Aufwendungen“ nun zur Sprache gekommen

Zwei Jahre lang waren die KI-Kosten innerhalb von Finanzinstituten ein Technologieposten, den niemand außerhalb der IT-Abteilung hinterfragte. Das hat sich in diesem Quartal geändert. Nach der Veröffentlichung der Ergebnisse von Goldman Sachs räumte David Solomon ein, dass “Es wird viel über die Ausgaben für Token und die Kosten der Technologie gesprochen.”, und warnte, dass der Ausbau “nicht ohne Rückschläge und Kurskorrekturen verlaufen wird, da erst noch geklärt werden muss, wie groß der tatsächliche Bedarf an dieser Technologie in Unternehmen letztendlich ist.”

Sharon Yeshaya, Finanzchefin von Morgan Stanley, äußerte sich präziser zur Entwicklung des Unternehmens Telefonkonferenz zum zweiten Quartal. Die Kosten dafür seien, so sagte sie, “ein Thema, das in diesem Jahr zwar keine finanzielle Bedeutung hat, aber in Zukunft möglicherweise an Bedeutung gewinnen könnte”, und es beansprucht bereits die Aufmerksamkeit der Geschäftsleitung.

Lesen Sie das bitte sorgfältig durch, denn darin liegt das gesamte Problem in einem Satz zusammengefasst. Kosten, die heute noch unerheblich sind, morgen aber eine wesentliche Rolle spielen, sind genau die Art von Kosten, die sich der Haushaltsdisziplin entziehen, bis sie zu groß sind, um sie noch unauffällig zu bereinigen.

Der Preisverfall ist real, und er ist eine Falle

Jede Kennzahl gibt Anlass zu Optimismus. Die durchschnittlichen Kosten für eine Million Token sank im Vergleich zum Vorjahr um 67%. Die Preise für Frontier-Produkte sind seit März 2023 um etwa 94,51 TP3T gesunken, da Öffentliches Benchmarking von Inferenzpreisen. Die Unterschiede zwischen den einzelnen Stufen sind mittlerweile enorm: Ein Standardmodell kostet nur wenige Cent pro Million eingegebener Token, während ein Modell mit fortschrittlichen Schlussfolgerungsalgorithmen mehrere Dollar kostet – und die Kosten für die Ausgabe sind noch um ein Vielfaches höher.

Und dennoch, im selben Erhebungszeitraum, 73% der Organisationen gaben an, dass die KI-Kosten ihre ursprüngliche Budgetplanung überstiegen hätten, während der Anteil der Teams, die ihre KI-Ausgaben aktiv verwalten, von 31% zwei Jahre zuvor auf 98% gestiegen ist. Sinkende Stückpreise, steigende Rechnungen und ein nahezu flächendeckendes Kostenmanagement, das die Entwicklung dennoch nicht eindämmen kann.

Der Mechanismus ist die elastische Nachfrage. Wenn die Grenzkosten einer Schlussfolgerung sinken, legen Unternehmen die Einsparungen nicht beiseite. Sie verlängern die Argumentationsketten, fügen Tool-Aufrufe hinzu, erweitern die Kontextfenster und übertragen Aufgaben an Agenten, die wiederum andere Agenten aufrufen. AT&T hat öffentlich berichtet, dass die Skalierung von etwa 8 Milliarden bis 27 Milliarden Token pro Tag nach der Einführung von Multi-Agenten-Systemen. Google hat berichtet, dass monatlich etwa 1,3 Billiarden Token verarbeitet werden, was einem Anstieg um das etwa 130-Fache im Vergleich zum Vorjahr entspricht.

Die Variable, die den Gesetzentwurf vorantreibt, ist die Anzahl der Token pro Aufgabe

Hier sollte ein quantitativ geschulter Leser seinen Fokus legen. Die Ausgaben ergeben sich aus dem Produkt aus Preis und Volumen. Der Preis folgt einer einigermaßen vorhersehbaren Kurve und ist in der Preisliste ersichtlich. Das Volumen hingegen nicht, da es nicht von der Nutzerzahl abhängt. Es hängt vielmehr von der Architektur ab.

Denkprozesse und handlungsbezogene Arbeitsbelastungen beanspruchen fünf- bis dreißigmal mehr Token pro Aufgabe als die entsprechende Chat-Interaktion. Eine einzelne Anfrage, die über eine Abruf-Pipeline mit einem Schlussfolgermodell und drei Tool-Aufrufen geleitet wird, kann ein bis zwei Größenordnungen mehr Tokens verbrauchen als dieselbe Frage, die direkt an ein kleineres Modell gestellt wird. Schlussfolgermodelle erzeugen lange interne Gedankengänge, die als Ausgabetokens abgerechnet werden, sodass das Verbrauchsprofil stark von dem abweicht, was die Benutzeroberfläche anzuzeigen scheint.

Das Ergebnis ist, dass der Token-Verbrauch in Bezug auf die für den Nutzer sichtbaren Aktivitäten nicht linear verläuft. Diese eine Eigenschaft erklärt den Großteil des Prognosefehlers auf dem Markt. Eine Bank, die KI-Kosten als Anzahl der Arbeitsplätze multipliziert mit einem Preis pro Arbeitsplatz modelliert, hat ein lineares Modell eines nichtlinearen Systems erstellt, und der Fehler vergrößert sich in Richtung überhöhter Ausgaben jedes Mal, wenn ein Entwicklerteam ein Modell aktualisiert oder einem Agenten mehr Autonomie gewährt.

Token sind zudem nicht homogen, was eine naive Volumenverfolgung zunichte macht. Die Wirtschaftlichkeit von Diensten bewegt sich an der Schnittstelle zwischen Durchsatz und Interaktivität, und das aussagekräftige Maß ist der „Goodput“: also die Leistung, die ein definiertes Latenz- und Geschwindigkeitsziel erfüllt, und nicht die Anzahl der produzierten Token.

Token-Klasse Profil Dort, wo es hingehört
Großmenge Hoher Durchsatz, geringe Geschwindigkeit pro Nutzer, kostengünstigste Bereitstellung Dokumentenverarbeitung über Nacht, Einbettungen, Zusammenfassung in Stapeln
Goldilocks Mäßige Interaktivität bei nahezu optimalem Durchsatz Die meisten internen Analysten- und Kundendienstanwendungen
Premium mit geringer Latenz Hohe Geschwindigkeit pro Nutzer, geringerer Gesamtdurchsatz, höhere Stückkosten Sprachassistenten und Arbeitsabläufe, bei denen die Reaktionszeit die Produktivität einschränkt
Begründung Sieht nach einem Standardaufruf aus; erzeugt pro zurückgegebenem Token viele interne Token. Ausschließlich wirklich schwierige analytische Probleme; die Hauptursache für unerwartete Ausgaben
Das Rahmenkonzept basiert auf der Token-Ökonomie der FinOps Foundation und veröffentlichten Benchmark-Ergebnissen zu Inferenzverfahren (2026).

Die Förderphase ist beendet

Die Annahme, die stillschweigend in den meisten mehrjährigen KI-Budgets zugrunde liegt, ist, dass die Preissenkungen im nächsten Jahr das Volumenwachstum des laufenden Jahres ausgleichen werden. Diese Annahme ist nun nicht mehr sicher, da die Anbieter begonnen haben, ihre Preise neu festzulegen, um ihre Kosten zu decken.

Der Unternehmenswandel bei Anthropic im April 2026 ist das deutlichste Beispiel dafür. Das Unternehmen Unternehmenskunden wurden auf ein Modell aus Lizenzgebühren und im Voraus festgelegter Token-Nutzung umgestellt, ohne dass ein Nutzungsspielraum enthalten ist, und trennte Pauschalabonnements von Agent-Harnesses von Drittanbietern, die nach Schätzungen von Analysten ein Vielfaches an Rechenleistung pro Dollar verbrauchten, als das Abonnement zu unterstützen ausgelegt war. Der Produktleiter von OpenAI für ChatGPT brachte denselben Punkt noch deutlicher auf den Punkt und merkte an, dass ein unbegrenzter KI-Tarif strukturell einem unbegrenzten Stromtarif ähnelt und nicht funktioniert.

Die praktische Konsequenz für die Finanzabteilung oder den CFO besteht darin, dass Einkäufer den Rechenbedarf nun so prognostizieren müssen, wie sie es vor einem Jahrzehnt – auf schmerzhafte Weise – bei der Prognose des Cloud-Bedarfs gelernt haben. Die Listenpreise pro Token sinken zwar weiter, doch konzentrieren sich die Rückgänge auf die Standard-Leistungsstufen, während die Stufen, die für agentenbasierte Workloads tatsächlich erforderlich sind, stabiler bleiben.

Was disziplinierte Institutionen tun

Yeshaya beschrieb den Ansatz von Morgan Stanley mit Begriffen, die jeder Betreiber als gewöhnliches Kostenmanagement erkennen würde: “Wende das richtige Modell für den richtigen Zweck an und setze Open Source dort sinnvoll ein, wo es angebracht ist.”. Ihr Anwendungsbeispiel ist gerade deshalb aufschlussreich, weil es so alltäglich ist. Die Zusammenfassung eines Analystenberichts ist eine echte Arbeitsaufgabe mit echtem Nutzen, und dafür “braucht man wirklich kein brandneues, hochmodernes und unglaublich teures Modell”.

Das ist das sogenannte „Model Routing“ und stellt die Kontrollmaßnahme mit der höchsten Rendite dar. Darum herum gruppieren sich die übrigen Maßnahmen: das Zwischenspeichern wiederkehrender Kontexte, das Bündeln aller Vorgänge, die nicht interaktiv sein müssen, die Begrenzung der Rekursionstiefe von Agenten sowie die Messung des „Goodput“ anstelle der reinen Token-Anzahl, damit ein schnelles und ein langsames Token nicht als gleichwertiges wirtschaftliches Gut behandelt werden.

Die Buchhaltung ist genauso wichtig wie die Technik. Die Herangehensweise von BCG in seiner Arbeit zu Verwaltung des Wertmarkenzählers ist, dass Token-Ausgaben nicht in eine einzige Kategorie fallen. Token, die wiederverwendbare Funktionen schaffen, verhalten sich wie Investitionen. Token, die interne Aufgaben ausführen, sind Betriebsausgaben. Token, die innerhalb eines Produkts oder bei einer Kundeninteraktion verbraucht werden, sind Wareneinsatzkosten. Ein Unternehmen, das alle drei Posten als IT-Gemeinkosten verbucht, kann nicht erkennen, welches seiner KI-Programme Wert schafft und welches still und leise die Marge schmälert.

Die letzte Kontrollmaßnahme ist die Zuordnung. Die Rückverrechnung des Token-Verbrauchs an die Abteilung, die ihn verursacht hat, verändert das Verhalten auf eine Weise, wie es ein zentrales Budget niemals vermag – aus demselben Grund, aus dem verbrauchsabhängige Versorgungsleistungen sorgfältiger genutzt werden als Pauschalangebote.

Warum es hier um eine Margenfrage und nicht um eine technologische Frage geht

Hier ist der Aspekt, dem am wenigsten Aufmerksamkeit geschenkt wird, der für Eigentümer und Kapitalgeber jedoch am wichtigsten ist.

Jamie Dimon wies die Vorstellung zurück, dass die durch KI erzielte Effizienz einfach dem Unternehmen zugutekommt, das sie einsetzt. “Wir können nicht einfach sagen: ‘Ach, das wird unsere Margen steigern, und das werden wir beibehalten.’ Wenn das zuträfe, lägen unsere Margen heute bei 80% – allein aufgrund der Computerisierung in den letzten 20 Jahren.” Er fuhr fort: “Nicht nur Sie profitieren von KI. Die größten Nutznießer der KI werden unsere Kunden sein.”

Der Wettbewerb gibt die Produktivitätsgewinne an den Kunden weiter. Was in der Gewinn- und Verlustrechnung verbleibt, sind die Kosten. Für einen Vermögensverwalter oder einen Fonds verlagern sich diese Kosten vom einmaligen Projektkapital hin zu wiederkehrenden Dienstleistungskosten und landen auf einer Gebührenbasis, die ohnehin schon strukturell unter Druck steht. Eine Technologieentscheidung wird daher zu einer Frage der Nachhaltigkeit der operativen Marge – und genau diese ist der Faktor, der den Multiplikator bestimmt, den ein Käufer zu zahlen bereit ist.

Auch das Umfeld auf der Inputseite wird sich nicht entspannen. Ted Pick, Vorstandsvorsitzender von Morgan Stanley, wies darauf hin, dass die Prognose für die Investitionsausgaben im Bereich Rechenzentren bei $575 Milliarden für 2026 nähern sich $850 Milliarden an, wobei die Schätzung für 2027 von etwa $700 Milliarden auf $1,3 Billionen revidiert wurde, und schätzte, dass die Branche über den gesamten Investitionszyklus hinweg nur 10% bis 15% beträgt. Zulieferer, die in diesem Tempo ausbauen, müssen letztendlich eine Rendite daraus erzielen.

Was kann man dagegen tun?

Wenn Sie eine Vermögensverwaltungsgesellschaft oder einen Fonds leiten. Berechnen Sie die Instrumentenkosten pro Aufgabe, bevor Sie einen Anwendungsfall skalieren, nicht danach. Legen Sie ein explizites Token-Budget pro Workflow fest, mit einem Schwellenwert, bei dessen Erreichen der Workflow neu gestaltet oder deaktiviert wird, und leiten Sie jede Aufgabe an die kostengünstigste Stufe weiter, die die Qualitätsanforderungen erfüllt. Klassifizieren Sie die Token-Ausgaben als Investition, Betriebsausgabe oder Umsatzkosten und verrechnen Sie sie an die Abteilung, die sie verbraucht. Dimons eigene Einordnung ist dabei eine nützliche Orientierungshilfe: JPMorgan betreibt fast tausend KI-Anwendungsfälle, von denen er etwa 50 als wirklich wichtig einstuft.

Wenn Sie eine Due-Diligence-Prüfung durchführen oder eine Zuweisung vornehmen. Hören Sie auf, Anwendungsfälle zu zählen. Fragen Sie nach den Kosten pro Aufgabe, der dahinterstehenden Preisstufenmischung und der Entwicklung der Token pro Aufgabe in den letzten zwei Quartalen. Ein Unternehmen mit tausend Pilotprojekten und ohne solide Wirtschaftlichkeit hat eine Kostenstelle mit guter Öffentlichkeitsarbeit aufgebaut. Ein Unternehmen, das seine Kosten pro abgeschlossenem Workflow angeben und zeigen kann, dass diese sinken, während das Volumen steigt, hat etwas geschaffen, das die Preisneufestsetzung übersteht.

Die Institutionen, die diesen Zyklus unbeschadet überstehen, werden nicht diejenigen sein, die am wenigsten für Inferenz ausgegeben haben. Es werden diejenigen sein, die stets wussten, was sie eine Einheit davon gekostet hat und welchen Nutzen sie davon hatten.

Referenzen

  1. diginomica. “Tokenomics – Die Investitionsrichtung von Goldman Sachs, JP Morgan Chase und Morgan Stanley” (Stuart Lauchlan, 17. Juli 2026). https://diginomica.com/tokenomics-direction-investment-travel-goldman-sachs-jp-morgan-chase-and-morgan-stanley
  2. FinOps Foundation. “Token Economics: Die atomare Einheit des KI-Werts” (J.R. Storment). https://www.finops.org/insights/token-economics-the-atomic-unit-of-ai-value/
  3. FinOps Foundation. Bericht „State of FinOps 2026“. https://data.finops.org/
  4. Epoch AI. “Die Preise für LLM-Inferenz sind rapide gesunken, jedoch je nach Aufgabe in unterschiedlichem Maße.” https://epoch.ai/data-insights/llm-inference-price-trends
  5. Boston Consulting Group. “Return on AI: Wie CFOs und CIOs den ”Token Meter‘ steuern können“ (2026). https://www.bcg.com/publications/2026/managing-ai-token-costs
  6. Morgan Stanley. Transkript der Telefonkonferenz zum Ergebnis des 2. Quartals 2026 (15. Juli 2026). https://www.fool.com/earnings/call-transcripts/2026/07/15/morgan-stanley-ms-q2-2026-earnings-call-transcript/
  7. Deloitte Insights. “KI-Token: Wie man sich in der neuen Ausgabendynamik der KI zurechtfindet.” https://www.deloitte.com/us/en/insights/topics/emerging-technologies/ai-tokens-how-to-navigate-spend-dynamics.html
Orsen Okami
Orsen Okami
https://www.kainjoo.com
Kainjoo ist ein Brand-Tech-Unternehmen, das regulierte Branchen mit Kaizen- und Six-Sigma-konformen Markenaktivitäten unterstützt.

Leave a Reply

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Rechtlicher Hinweis

Investitionen sind mit einem hohen Risiko behaftet.

Anleger sollten die beschriebenen Risiken und alle anderen Informationen in der Ihnen zur Verfügung gestellten Anlegervereinbarung sorgfältig abwägen, bevor sie entscheiden, ob sie in den Vorschlag investieren.

Beteiligungen und Investitionen sind spekulative Aktivitäten, die ein hohes Maß an finanziellem Risiko beinhalten. Bestimmte Risikofaktoren, die bei der Bewertung einer Investition in Neumarz (eine Marke von Allegory Capital & Kainjoo SA) und seine Aktivitäten berücksichtigt werden sollten, umfassen unter anderem die unten aufgeführten.

Jedes einzelne oder mehrere dieser Risiken könnten den Wert einer Investition in Neumarz, eine Marke von Allegory Capital & Kainjoo SA, und die Geschäfts-, Finanz- oder Betriebsergebnisse von Neumarz, einer Marke von Allegory Capital & Kainjoo SA, erheblich beeinträchtigen.

Ein Anleger kann seine Investition in Neumarz, eine Marke von Allegory Capital & Kainjoo SA, ganz oder teilweise verlieren.

Zusätzliche Risiken und Ungewissheiten, die den leitenden Angestellten und Direktoren von Neumarz, einer Marke von Allegory Capital & Kainjoo SA, derzeit nicht bekannt sind, können sich ebenfalls nachteilig auf die laufenden Aktivitäten auswirken. Die nachstehenden Informationen stellen keine erschöpfende Zusammenfassung der Risiken dar, die Neumarz, eine Marke der Allegory Capital & Kainjoo SA, betreffen. Es ist nicht beabsichtigt, sie in einer angenommenen Prioritätsreihenfolge darzustellen. Zu den Gefahren im Zusammenhang mit der Geschäftstätigkeit von Neumarz, einer Marke von Allegory Capital & Kainjoo SA, gehören unter anderem:

(a) Es gibt keine Garantien dafür, dass Allegory Capital oder Kainjoo SA in Zukunft Gewinne erzielen werden oder dass die Rentabilität aufrechterhalten wird;

(b) es gibt keine Zusicherung, dass Allegory Capital oder Kainjoo SA Zugang zu ausreichenden Finanzmitteln für künftige Operationen oder zur Erfüllung ihrer Verpflichtungen im Rahmen laufender Verträge haben werden;

(c) Risiken, die mit Investitionen verbunden sind, einschließlich (i) der Tatsache, dass die Bewertung dieser Vermögenswerte einer erheblichen Volatilität unterliegt, (ii) der Tatsache, dass das für Risikokapitalinvestitionen geltende Regulierungssystem unsicher ist und neue Vorschriften oder Strategien die Entwicklung von Investitionen erheblich beeinträchtigen können, (iii) der Tatsache, dass die weitere Entwicklung von Unternehmen von einer Vielzahl schwer zu bewertender Faktoren abhängt, (iv) der Tatsache, dass Unternehmen und immaterielle Vermögenswerte dem Risiko von Sicherheitsverletzungen ausgesetzt sind, (v) des potenziellen Verlusts oder der Zerstörung aufgrund von Bedrohungen der Cybersicherheit und (vi) der Risiken eines illiquiden Marktes für Vermögenswerte;

(d) Schwierigkeiten bei der Bewertung von Investitionen;

(e) Allegory Capital und Kainjoo SA können nur auf eine begrenzte Betriebsgeschichte zurückblicken, und es gibt keine Gewähr dafür, dass die Investitionen von Allegory Capital rentabel sein werden;

(f) Allegory Capital hat bisher noch keine Einnahmen erzielt, und es kann keine garantierte Rendite auf seine Investitionen geben;

(g) Direktoren, leitende Angestellte und Mitarbeiter in Schlüsselpositionen können von Allegory Capital zurücktreten;

(h) Allegory Capital ist nicht in der Lage, sich gegen alle Risiken zu versichern, denen es ausgesetzt ist;

(i) Gesetze, die sich auf die Geschäftstätigkeit von Allegory Capital beziehen, können in einer Weise geändert werden, die sich nachteilig auf Allegory Capital auswirkt;

(j) Allegory Capital kann in Unternehmen investieren, die keine Betriebsgeschichte haben, was die Bewertung solcher Unternehmen komplex macht und

(k) Risiko im Zusammenhang mit Wechselkursen.

Zusätzliche Risiken und Ungewissheiten, die Allegory Capital und Kainjoo SA derzeit nicht bekannt sind oder die sie derzeit als unwesentlich erachten, können die Geschäftstätigkeit, die Finanzlage, die Bewertungen, die Handelsleistung und die Aussichten des Unternehmens erheblich beeinträchtigen.

Potenziellen Anlegern wird daher empfohlen, einen unabhängigen Finanzberater zu konsultieren, der auf die Beratung zu Anlagen dieser Art spezialisiert ist, bevor sie eine Anlageentscheidung in Allegory Capital oder Kainjoo SA treffen.

Ein potenzieller Anleger sollte abwägen, ob eine Investition in Allegory Capital oder Kainjoo SA in Anbetracht seiner Umstände und der verfügbaren finanziellen Mittel geeignet ist.