Das Wichtigste in Kürze
FinOps für KI ist die laufende Steuerung der KI-Kosten durch IT, Finanzen und Fachbereiche: Kosten messen, Teams und Anwendungsfällen zuordnen und gezielt senken.
Das Thema ist in der Breite angekommen. 98 % der FinOps-Teams managen inzwischen KI-Ausgaben, 2024 waren es 31 % (State of FinOps 2026, 1.192 Befragte, Februar 2026).
Token sind heute für wenige ein großer Posten, mit Agenten ändert sich das. Nur 8 % der deutschen KI-Anwender nennen Token als großen Kostenpunkt (Bitkom, 14.09.2026). Agenten verbrauchen laut Anthropic rund viermal so viele Tokens wie ein Chat.
Die wichtigsten Hebel sind dokumentiert. Zwischengespeicherte Eingaben kosten bei Anthropic, OpenAI und Google rund 10 % des normalen Eingabepreises, Batch-Verarbeitung halbiert den Preis (Preislisten, Stand September 2026).
20 bis 40 % weniger Kosten im ersten Quartal nennt Pexon Consulting als typisches Ergebnis von Kostenzuordnung und Caching in Projekten (Pexon, Mai 2026).
Zwei Jahre lang ließ sich die KI-Rechnung als Innovationsbudget verbuchen. Mit dem Schritt in den Betrieb wird sie zum laufenden Kostenblock. Laut Bitkom-KI-Studie 2026 setzen 57 % der Unternehmen ab 20 Beschäftigten KI ein, und 45 % wenden 2026 mehr Geld dafür auf. Gleichzeitig nennen 54 % der KI-Anwender schwer kalkulierbare Kosten als Hemmnis.
International zeigt sich dasselbe Bild. Nur 11 % der 396 Organisationen im Bericht von Mavvrik und Benchmarkit sagen ihre KI-Ausgaben auf ±10 % genau voraus (Juli 2026). Gartner erwartet, dass mehr als 40 % der Projekte mit KI-Agenten bis Ende 2027 eingestellt werden, wegen steigender Kosten, unklaren Nutzens oder unzureichender Risikokontrollen (Gartner, Juni 2025).
Dieser Leitfaden erklärt, wie Token-Kosten entstehen, was Modelle im September 2026 kosten, mit welchen sieben Hebeln Sie die Rechnung senken und wie Sie in 90 Tagen eine Kostensteuerung aufbauen, die Geschäftsführung und Fachbereiche verstehen.
Was ist FinOps für KI?
FinOps für KI ist die Übertragung des FinOps-Ansatzes auf nutzungsabhängige KI-Kosten: IT, Finanzen und Fachbereiche steuern gemeinsam, was KI kostet und was sie dafür leistet. Die FinOps Foundation beschreibt FinOps als Arbeitsweise, in der Technik, Finanzen und Geschäftsverantwortliche Technologieausgaben gemeinsam und laufend steuern.
Bei KI ist das anspruchsvoller als bei klassischer Software. Eine Lizenz wächst mit der Zahl der Nutzer. Token-Kosten wachsen mit der Zahl der Anfragen, der Länge der Eingaben, dem mitgeschickten Kontext, der Zahl der Werkzeugaufrufe eines Agenten und der Länge jeder Antwort.
In der Praxis besteht FinOps für KI aus drei Schichten:
- Messen: Jeder Modellaufruf wird mit Eingabe-, Ausgabe- und Cache-Tokens erfasst und gekennzeichnet, etwa nach Team, Anwendungsfall und Modell.
- Zuordnen: Kosten landen bei den Teams, Anwendungsfällen oder Kunden, die sie verursachen.
- Optimieren: Modellwahl, Zwischenspeicher, Kontextlänge und Obergrenzen werden anhand der Daten angepasst.
Drei Abgrenzungen verhindern Missverständnisse. Eine TCO-Rechnung ist eine Planungsrechnung vor der Entscheidung, FinOps die laufende Steuerung danach. Der Einkauf verhandelt Konditionen je Vertragsperiode, FinOps beeinflusst Architekturentscheidungen im laufenden Betrieb. Und klassische IT-Kostenkontrolle misst Server und Speicher, FinOps für KI braucht Token-Daten je Anfrage, Nutzer und Anwendungsfall.
Wie entstehen Token-Kosten?
Token-Kosten ergeben sich aus der Zahl der verarbeiteten Tokens, getrennt nach Eingabe und Ausgabe, multipliziert mit dem Preis des gewählten Modells. Ein Token ist die Recheneinheit, in die Sprachmodelle Text zerlegen: meist Wortteile, einzelne Wörter oder Satzzeichen.
Vier Eigenschaften bestimmen die Rechnung:
- Eingabe und Ausgabe kosten unterschiedlich. Bei den Modellen in der Preistabelle unten kostet ein Ausgabe-Token das Fünf- bis Sechsfache eines Eingabe-Tokens.
- Kontext zählt als Eingabe. Mitgeschickte Dokumente, Gesprächsverläufe und Systemanweisungen werden bei jeder Anfrage erneut berechnet, sofern sie nicht zwischengespeichert sind.
- Denkschritte zählen als Ausgabe. Bei Reasoning-Modellen rechnen die Anbieter die internen Denkschritte als Ausgabe-Tokens ab, auch wenn der Nutzer sie nicht sieht. Mehr dazu im Beitrag zu Thinking Models.
- Tokens sind zwischen Anbietern nicht direkt vergleichbar. Deutsche Texte zerfallen wegen langer Wörter in mehr Tokens als englische, und jeder Anbieter zählt anders. Anthropic weist darauf hin, dass Claude-Modelle ab Version 4.7 für denselben Text rund 30 % mehr Tokens erzeugen als ihre Vorgänger (Anthropic, Preise). Vergleichen Sie deshalb Kosten je Anfrage, nicht Preise je Token.
Die Grundformel lautet: Monatskosten = Anfragen × (Eingabe-Tokens × Eingabepreis + Ausgabe-Tokens × Ausgabepreis) ÷ 1.000.000, mit Preisen je Million Tokens.
Rechenbeispiel: ein interner Wissensassistent
Annahmen: 150 aktive Beschäftigte stellen je 15 Anfragen pro Arbeitstag an 21 Arbeitstagen, also 47.250 Anfragen im Monat. Jede Anfrage enthält 4.000 Eingabe-Tokens (Frage, Anweisungen, Auszüge aus Dokumenten) und erzeugt 500 Ausgabe-Tokens. Das ergibt 189 Millionen Eingabe- und 23,625 Millionen Ausgabe-Tokens pro Monat.
| Modell (Eingabe / Ausgabe je 1 Mio. Tokens) | Eingabe | Ausgabe | Monatskosten |
|---|---|---|---|
| GPT-6 Astra (10 $ / 50 $) | 1.890,00 $ | 1.181,25 $ | 3.071,25 $ |
| Claude Opus 5 (5 $ / 25 $) | 945,00 $ | 590,63 $ | 1.535,63 $ |
| GPT-5.6 Terra (2 $ / 12 $) | 378,00 $ | 283,50 $ | 661,50 $ |
| Claude Sonnet 5 (2 $ / 10 $) | 378,00 $ | 236,25 $ | 614,25 $ |
| Gemini 3.8 Flash (0,75 $ / 3,75 $) | 141,75 $ | 88,59 $ | 230,34 $ |
| GPT-5.6 Luna (0,20 $ / 1,20 $) | 37,80 $ | 28,35 $ | 66,15 $ |
Rechenbeispiel mit Annahmen, Standardtarife ohne Zwischenspeicher und ohne Batch-Rabatt, Preisstand 14.09.2026.
Je aktiver Person sind das zwischen rund 0,44 US-Dollar (GPT-5.6 Luna) und rund 20,48 US-Dollar (GPT-6 Astra) im Monat. Ein Modellmix verändert die Rechnung stärker als jede Preisverhandlung: Laufen 70 % der Anfragen auf GPT-5.6 Luna, 25 % auf Claude Sonnet 5 und 5 % auf Claude Opus 5, sinken die Kosten auf rund 277 US-Dollar im Monat. Das sind rund 82 % weniger als mit Opus 5 für alle Anfragen.
Ob ein kleines Modell für eine Aufgabe reicht, zeigt allerdings erst ein Test mit Ihren eigenen Fällen. Die Rechnung vereinfacht außerdem, denn die Anbieter zählen denselben Text unterschiedlich.
Warum steigen KI-Kosten gerade jetzt?
KI-Kosten steigen, weil mehr Menschen KI im Alltag nutzen, weil der größte Teil der Kosten bei jeder einzelnen Anfrage entsteht und weil Agenten pro Vorgang ein Vielfaches an Tokens verbrauchen. Die folgenden Kennzahlen zeigen die Entwicklung.
| Kennzahl | Wert | Quelle |
|---|---|---|
| FinOps-Teams, die KI-Ausgaben managen | 98 % (2024: 31 %) | State of FinOps 2026, Linux Foundation, 02/2026 |
| Unternehmen ab 20 Beschäftigten mit KI-Einsatz | 57 % (2025: 36 %) | Bitkom-KI-Studie, 09/2026 |
| Unternehmen, die 2026 mehr Geld für KI aufwenden | 45 % | Bitkom-KI-Studie, 09/2026 |
| Organisationen, die KI-Ausgaben auf ±10 % genau vorhersagen | 11 % | Mavvrik und Benchmarkit, 07/2026 |
| Anteil der Inferenz an den laufenden KI-Kosten | 80 bis 90 % | FinOps Foundation, zitiert nach cloudmagazin, 05/2026 |
| Tokenverbrauch eines Agenten im Vergleich zum Chat | rund 4-fach, mit mehreren Agenten rund 15-fach | Anthropic, 06/2025 |
Drei Entwicklungen erklären diese Zahlen. Erstens die Breite: Innerhalb von zwei Jahren wurde KI vom Thema einzelner Teams zur Aufgabe fast aller FinOps-Teams. Laut Linux Foundation ist das Management des KI-Nutzens inzwischen die Fähigkeit, die Teams am dringendsten aufbauen wollen.
Zweitens die Inferenz: Die laufenden Kosten entstehen bei jeder Anfrage, nicht beim Training der Modelle. Jede zusätzliche Person und jeder längere Kontext erhöht die Rechnung.
Drittens die Agenten: Ein Chat ruft das Modell pro Frage ein- oder zweimal auf. Ein KI-Agent plant, ruft Werkzeuge auf und prüft Zwischenergebnisse. Laut Bitkom setzen 11 % der Unternehmen bereits Agenten ein, weitere 29 % planen es. Wer 2026 Agenten in den Betrieb bringt, sieht das auf der Rechnung.
Welche Kostenfallen treiben die KI-Rechnung?
Die meisten Kostensprünge gehen auf vier Muster zurück: unterschätzte Ausgaben, zu viel Kontext, Agenten ohne Grenzen und Nutzung, die niemand zuordnet.
- Ausgabe-Tokens werden unterschätzt. Ausgaben kosten das Fünf- bis Sechsfache der Eingaben, bei Claude Opus 5 etwa 25 statt 5 US-Dollar je Million Tokens. Ausführliche Antworten und lange Denkschritte von Reasoning-Modellen treiben die Rechnung, ohne dass es auffällt.
- Zu viel Kontext. Eine schlecht eingestellte Dokumentensuche (RAG) schickt pro Frage viele Seiten mit, die für die Antwort nicht nötig sind. Sehr lange Eingaben können zusätzlich teurer werden: OpenAI berechnet für lange Kontexte den doppelten Eingabepreis, Google bei Gemini 3.1 Pro Preview oberhalb von 200.000 Tokens 4 statt 2 US-Dollar Eingabe und 18 statt 12 US-Dollar Ausgabe. Anthropic rechnet das Kontextfenster von einer Million Tokens zum Normaltarif ab.
- Agenten ohne Abbruchkriterium. Ohne Grenze für Durchläufe und Tokens je Vorgang läuft ein Agent weiter, auch wenn das Ergebnis längst genügt.
- Nutzung ohne Zuordnung. Im Bericht von Mavvrik und Benchmarkit erfassen nur 36 % der Organisationen ihre agentischen Anwendungen im Kostenreporting und nur 42 % ihre KI-Werkzeuge für Entwickler. Private Konten und Einzelabos tauchen gar nicht auf. Mehr dazu im Beitrag zu Schatten-KI.
Nicht jede Überraschung liegt beim Modell: Die häufigste Quelle unerwarteter KI-Kosten waren im selben Bericht Mehrkosten bei Datenplattformen (47 %), knapp vor den Token-Kosten der Sprachmodelle (43 %).
Was kosten KI-Modelle im September 2026?
Die Preise reichen von 0,20 bis 10 US-Dollar je Million Eingabe-Tokens, also um den Faktor 50. Die Tabelle zeigt ausgewählte Modelle der drei großen Anbieter nach Preisklassen, Stand 14. September 2026.
| Preisklasse | Modell | Eingabe | Zwischengespeicherte Eingabe | Ausgabe |
|---|---|---|---|---|
| Spitzenklasse | Claude Fable 5.1 (Anthropic) | 10,00 $ | 0,25 $ | 50,00 $ |
| Spitzenklasse | GPT-6 Astra (OpenAI) | 10,00 $ | 1,00 $ | 50,00 $ |
| Spitzenklasse | Claude Opus 5 (Anthropic) | 5,00 $ | 0,50 $ | 25,00 $ |
| Mittelklasse | GPT-5.6 Sol (OpenAI) | 4,00 $ | 0,40 $ | 20,00 $ |
| Mittelklasse | GPT-5.6 Terra (OpenAI) | 2,00 $ | 0,20 $ | 12,00 $ |
| Mittelklasse | Claude Sonnet 5 (Anthropic) | 2,00 $ | 0,20 $ | 10,00 $ |
| Schnell und günstig | Claude Haiku 4.5 (Anthropic) | 1,00 $ | 0,10 $ | 5,00 $ |
| Schnell und günstig | Gemini 3.8 Flash (Google, Preis bis 31.12.2026) | 0,75 $ | 0,075 $ | 3,75 $ |
| Schnell und günstig | GPT-5.6 Luna (OpenAI) | 0,20 $ | 0,02 $ | 1,20 $ |
US-Dollar je Million Tokens, Standardtarif, Stand 14.09.2026. Quellen: Anthropic, OpenAI, Google. Batch-Verarbeitung kostet bei allen drei Anbietern 50 % weniger. Bei Google kann für gespeicherten Kontext eine Speichergebühr hinzukommen. Preise ändern sich häufig, prüfen Sie vor jeder Planung die Preislisten.
Vier Beobachtungen sind für die Planung wichtig:
- Der Preisabstand zwischen den Klassen ist groß. Bei OpenAI liegt zwischen GPT-5.6 Luna und GPT-6 Astra ein Faktor 50 bei der Eingabe, bei Anthropic zwischen Claude Haiku 4.5 und Claude Fable 5.1 ein Faktor 10. Für Klassifizieren, Extrahieren oder kurze Zusammenfassungen reicht oft ein Modell der günstigen Klasse. Prüfen Sie das mit eigenen Testfällen.
- Zwischengespeicherte Eingaben kosten rund 10 % des Normalpreises, bei Claude Fable 5.1 sogar nur 2,5 %.
- Preise sind nicht dauerhaft. Google verdoppelt den Preis von Gemini 3.8 Flash zum 1. Januar 2027. Anthropic hat dagegen den Einführungspreis von Claude Sonnet 5 zum Standardpreis gemacht und die für den 1. September 2026 angekündigte Erhöhung gestrichen.
- Datenresidenz kann Aufschläge kosten. Regionale Endpunkte für Claude-Modelle kosten bei Amazon Bedrock und Google Cloud 10 % mehr als globale Endpunkte. Kalkulieren Sie den Verarbeitungsort mit.
Welches Modell für welche Aufgabe passt, vergleicht der LLM-Vergleich 2026.
Mit welchen sieben Hebeln senken Sie Token-Kosten?
Die wirksamsten Hebel setzen an Kontext, Modellwahl und Antwortlänge an. Die folgende Reihenfolge berücksichtigt Aufwand und Wirkung.
-
1
Prompt Caching nutzen
Aufwand niedrigWiederkehrende Teile einer Anfrage wie Systemanweisungen, Beispiele und Standarddokumente werden zwischengespeichert. Treffer kosten rund 10 % des Eingabepreises. Bei Anthropic kostet das Schreiben in den kurzlebigen Zwischenspeicher das 1,25-Fache des Normalpreises und rechnet sich schon ab dem ersten Treffer. Voraussetzung ist ein gleichbleibender Anfang der Anfrage.
-
2
Batch-Verarbeitung für alles, was warten kann
Aufwand mittelAnthropic, OpenAI und Google berechnen für asynchron verarbeitete Anfragen 50 % weniger. Das passt für nächtliche Auswertungen, Massenklassifizierung oder Berichte. Bei Anthropic lässt sich der Rabatt mit Prompt Caching kombinieren.
-
3
Modell je Aufgabe wählen
Aufwand mittelEinfache Aufgaben laufen auf günstigen Modellen, anspruchsvolle auf der Spitzenklasse. Im Rechenbeispiel oben senkt ein Modellmix die Kosten um rund 82 %. Voraussetzung ist ein Testset mit eigenen Fällen, damit die Qualität nicht unbemerkt sinkt.
-
4
Wiederholte Fragen abfangen
Aufwand mittelEin semantischer Zwischenspeicher erkennt Fragen, die inhaltlich schon beantwortet wurden, und liefert die gespeicherte Antwort. Werkzeuge dafür sind etwa die Vektorsuche von Redis, GPTCache oder der Cache von LangChain. Die Wirkung hängt davon ab, wie oft sich Fragen wiederholen.
-
5
Antworten kurz und strukturiert halten
Aufwand niedrigWeil Ausgabe-Tokens das Fünf- bis Sechsfache kosten, lohnen eine Obergrenze für die Antwortlänge, feste Formate statt Fließtext und klare Anweisungen zur Kürze.
-
6
Kontext begrenzen
Aufwand hochPassende Abschnittsgrößen, Sortierung nach Relevanz und eine variable Zahl mitgeschickter Dokumente senken die Eingabe-Tokens. Das braucht ein Messverfahren für die Antwortqualität, wirkt aber bei jedem Wissensassistenten.
-
7
Budgets für Agenten setzen
Aufwand niedrigJeder Agent erhält eine Obergrenze für Tokens und Durchläufe je Vorgang sowie einen festgelegten Übergang an einen Menschen. Das schützt vor Ausreißern, die bei einem vier- bis fünfzehnfachen Tokenverbrauch gegenüber einem Chat schnell teuer werden.
Wie Sie die Qualität messen, während Sie Modelle und Kontext verändern, beschreibt der Leitfaden zu KI-Evaluation und Beobachtbarkeit. Wie viele Modelle Sie überhaupt brauchen, klärt der Beitrag zur Multi-Modell-Strategie.
Wo steht Ihr Unternehmen bei der KI-Kostensteuerung?
Die Steuerung von KI-Kosten reift in vier Stufen, von fehlender Sicht auf Tokens bis zu KI-Kosten als Geschäftskennzahl. Die FinOps Foundation arbeitet mit drei Reifegraden (Crawl, Walk, Run). Für KI-Kosten lässt sich daraus eine Einteilung in vier Stufen ableiten, die eine ehrliche Standortbestimmung erlaubt.
| Stufe | Merkmale | Was fehlt | Nächster Schritt |
|---|---|---|---|
| 1 · Ohne Token-Sicht | Pauschale Lizenzen, keine Auswertung je Anwendungsfall, die Rechnung kommt als Überraschung | Sichtbarkeit, Zuordnung, Verantwortung | Token-Erfassung je Anwendungsfall einführen |
| 2 · Token-Sicht | Aufrufe werden erfasst, Monatsberichte existieren, es wird aber nicht optimiert | Zwischenspeicher, Modellwahl, Obergrenzen | Hebel 1 bis 3 umsetzen |
| 3 · Optimiert | Caching aktiv, Modelle je Aufgabe, Budgets je Anwendungsfall, Prognose je Quartal | Verrechnung an Bereiche, testgestützte Modellwechsel | FinOps-Verantwortung fest verankern |
| 4 · Strategisch | KI-Kosten sind Kennzahl je Prozess oder Produkt, Einsparungen finanzieren den Ausbau | Das Niveau halten, weil sich Modelle und Preise laufend ändern | Architektur quartalsweise überprüfen |
Der schwierigste Schritt ist der von Stufe 2 zu Stufe 3. Bis dahin genügt ein Bericht. Ab Stufe 3 müssen Entscheidungen auf Basis der Daten fallen. Dafür braucht es eine verantwortliche Person, Testfälle je Anwendungsfall und eine Kostenprognose vor jeder größeren Änderung.
Welche fünf KPIs braucht die Steuerung von KI-Kosten?
Fünf Kennzahlen reichen, um KI-Kosten verständlich zu steuern: Kosten je Anfrage, Kosten je Ergebnis, Cache-Trefferquote, Modellmix und Prognosegenauigkeit. Zielwerte legen Sie je Anwendungsfall fest, nicht pauschal.
| KPI | Was sie misst | Worauf Sie achten sollten |
|---|---|---|
| Kosten je Anfrage | Durchschnittliche Modellkosten je Aufruf, getrennt nach Modell und Anwendungsfall | Sollte sinken, wenn Caching und Modellwahl greifen |
| Kosten je Ergebnis | KI-Kosten je gelöstem Servicefall, erstelltem Bericht oder bearbeitetem Dokument | Lässt sich direkt mit manueller Bearbeitung vergleichen. Wie, zeigt der Leitfaden KI-ROI berechnen |
| Cache-Trefferquote | Anteil der Eingabe-Tokens, die aus dem Zwischenspeicher kommen | Sinkt sie, steigen die Kosten bei gleicher Nutzung |
| Modellmix | Verteilung der Anfragen auf günstige, mittlere und Spitzenmodelle | Ein hoher Anteil der Spitzenklasse braucht eine Begründung aus Testergebnissen |
| Prognosegenauigkeit | Abweichung zwischen geplanter und tatsächlicher Monatsrechnung | ±10 % ist anspruchsvoll: Nur 11 % der Organisationen erreichen das laut Mavvrik und Benchmarkit |
Bericht an die Geschäftsführung in einem Satz
„Anwendungsfall X kostet heute A € KI-Kosten je Vorgang statt B € bei manueller Bearbeitung. Die Prognose lag im letzten Quartal C % neben der Rechnung.“ Diese Form versteht jede Geschäftsführung, anders als eine Zahl verbrauchter Tokens.
Der 90-Tage-Plan für FinOps für KI
In 90 Tagen kommen Sie von fehlender Sicht zu einer Kostensteuerung mit ersten Einsparungen: 30 Tage messen, 30 Tage die einfachen Hebel umsetzen, 30 Tage die Verantwortung verankern. Der Plan ist eine Arbeitsweise, kein Werkzeugkauf. Die meisten Schritte gelingen mit den Funktionen der KI-Plattform oder mit offenen Werkzeugen.
Tage 1 bis 30
Sichtbarkeit schaffen
- Token-Erfassung je Aufruf aktivieren, über die Plattform oder offene Werkzeuge wie Langfuse und OpenTelemetry
- Kennzeichnung nach Nutzer, Team, Anwendungsfall und Modell
- Ausgangsbericht mit den zehn teuersten Anwendungsfällen
- Obergrenzen für technische Zugänge
- Erste Analyse: Wo entsteht der größte Teil der Kosten?
Tage 31 bis 60
Einfache Hebel umsetzen
- Prompt Caching für die drei größten Anwendungsfälle
- Batch-Verarbeitung für Massenaufgaben
- Obergrenzen für Antwortlängen
- Modellwahl je Aufgabe: günstig zuerst, Spitzenklasse bei Bedarf
- Warnschwellen je Team
Tage 61 bis 90
Verantwortung verankern
- Kostenprognose vor jeder größeren Änderung
- Quartalsweise Überprüfung mit Testfällen
- Kosten an die Bereiche berichten oder verrechnen
- Verantwortliche Person zwischen IT und Finanzen benennen
- Erster Bericht mit Kosten je Ergebnis
Pexon Consulting nennt 20 bis 40 % Kostensenkung im ersten Quartal als typisches Ergebnis aus Projekten, in denen Kosten zugeordnet und Zwischenspeicher genutzt werden (Mai 2026). Die Größenordnung hängt vom Ausgangszustand ab. Wer ohne Messung direkt optimiert, sieht den Effekt nicht in den eigenen Zahlen.
Was bei der Einführung häufig schiefgeht:
- Erst ausrollen, später messen. Wer die Erfassung nachrüstet, kann nicht mehr nachvollziehen, wohin das Geld der ersten Monate geflossen ist.
- Alles auf das Spitzenmodell. Ein Team wählt das stärkste Modell, weil die Vorführung überzeugt hat, und prüft nie, ob ein günstigeres genügt.
- Caching als späte Optimierung. Ob sich Anfragen zwischenspeichern lassen, entscheidet der Aufbau der Anweisungen. Ein nachträglicher Umbau kostet doppelt.
- Agenten ohne Budget. Ein neuer Agent geht ohne Obergrenze in den Betrieb und läuft beim ersten Sonderfall in eine teure Schleife.
- Berichte nur an die IT. Laut State of FinOps 2026 berichten 78 % der FinOps-Teams an CTO oder CIO. Sieht die Geschäftsführung die Kosten nur auf der Rechnung, fehlt die Verbindung zum Nutzen.
Was hat FinOps für KI mit Governance zu tun?
Die KI-Verordnung verlangt keine Kostenkontrolle. Kosten- und Compliance-Steuerung brauchen aber dieselbe Grundlage: ein Verzeichnis aller KI-Anwendungsfälle. Wer ohnehin ein solches Register für Risiken und Pflichten führt, erfasst Kosten mit denselben Kennungen und spart sich eine zweite Inventur.
Praktisch heißt das: Das Plattformteam liefert die Erfassung, die Finanzabteilung Zuordnung und Prognose, die für KI verantwortliche Stelle das Register und die Risikoeinstufung. Alle arbeiten mit einer gemeinsamen Liste. Wie Sie Regeln und Zuständigkeiten festhalten, zeigt der Beitrag zur KI-Richtlinie im Unternehmen.
Wie Plotdesk die Kostensteuerung unterstützt
Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand. Kostensteuerung ist dabei Teil der Plattform und kein nachträglich angebautes Werkzeug.
- Modelle je Team steuern. Plotdesk bindet mehr als 100 Modellvarianten aus zehn Provider-Typen an, von Spitzenmodellen bis zu offenen Modellen mit Inferenz in der EU. Welche Modelle ein Team nutzen darf, legen Sie zentral fest. So bleibt der Alltag auf günstigen Modellen, während ein Fachbereich für anspruchsvolle Analysen die Spitzenklasse erhält.
- Kosten sichtbar machen. Nutzungs- und Kostenanalysen zeigen, was je Team, Bereich und Modell anfällt, und die Kosten lassen sich pro Team steuern. Die Sicht, die Stufe 2 des Reifegrads verlangt, ist damit von Beginn an vorhanden.
- Anfragen standardisieren. Presets (Vorlagen mit Variablen) und Instructions (Verhaltensregeln je Organisation oder Team) helfen, Anweisungen einheitlich und Antworten kurz und strukturiert zu halten.
- Wissen gezielt anbinden. Silos als Wissensspeicher und Plotdesk Connect für ERP, Fileserver und Altsysteme liefern den passenden Kontext, statt ganze Ablagen in jede Anfrage zu kopieren.
- Betrieb mit klaren Regeln. Jedes Unternehmen erhält eine dedizierte Instanz in der EU oder im eigenen Tenant, mit DSGVO-konformem AVV, Single Sign-On, Rollen mit mehr als 40 Berechtigungen und Audit-Logs.
Plotdesk ersetzt kein Spezialwerkzeug für Entwicklerteams wie Langfuse und kein Cloud-Kostenmanagement. Die Plattform sorgt aber dafür, dass Modellwahl, Kosten und Rechte an einer Stelle zusammenlaufen. Das Umsetzungsteam baut die ersten Anwendungsfälle so auf, dass die Kosten je Ergebnis von Anfang an messbar sind. Die Grundlage dafür sind 1.200+ Use Cases in 15 Branchen.
Häufige Fragen zu FinOps für KI
Was ist FinOps für KI?
Wie berechne ich Token-Kosten?
Wie senke ich Token-Kosten am schnellsten?
Sind Token-Preise verschiedener Anbieter direkt vergleichbar?
Wer sollte FinOps für KI im Unternehmen verantworten?
Lohnt sich FinOps für KI auch für kleinere Unternehmen?
Fazit: Erst messen, dann steuern
FinOps für KI ist keine Disziplin nur für Konzerne. Sobald KI im Betrieb läuft, entstehen Kosten bei jeder Anfrage, und sie wachsen mit Nutzung, Kontext und Agenten. Drei Punkte zum Mitnehmen:
- Messen Sie ab dem ersten Tag, je Team, Anwendungsfall und Modell. Ohne diese Sicht bleibt jede Optimierung eine Vermutung.
- Nutzen Sie die dokumentierten Hebel. Caching, Batch-Verarbeitung, passende Modellwahl und kurze Antworten senken die Rechnung laut Pexon Consulting im ersten Quartal typischerweise um 20 bis 40 %.
- Berichten Sie in Ergebnissen, nicht in Tokens. Die Kosten je Vorgang im Vergleich zur manuellen Bearbeitung sind die Zahl, die Entscheidungen möglich macht.