Methodik: Wie der Rechner rechnet
Der Rechner läuft vollständig in Ihrem Browser, bewertet jede Zeile Ihres Nutzungsexports zu Listenpreisen mit Stand 17.09.2026 und rechnet vier Maßnahmen durch. Das Ergebnis ist ein Szenario, kein Nachweis. Die Engine (calc.js, prices.js) ist unverschleiertes JavaScript im Seitenquelltext.
Eingaben
Gelesen werden CSV-Dateien mit Komma, Semikolon oder Tabulator, deutsche und englische Zahlen- und Datumsformate (auch Unix-Zeitstempel) sowie Titelzeilen vor der Kopfzeile. Drei Formate: Tokenspalten je Zeile (OpenAI Usage-Export nach Modell und Batch, Anthropic Console und Admin API), Langformat mit Nutzungsart und Tokenanzahl (Anthropic Console) sowie Kostenexporte ohne Tokenzahlen (OpenAI Costs), die nur als gekennzeichnete Schätzung ohne Modellupdate ausgewertet werden.
Spalten werden über die Kopfzeile erkannt: Modell, Input-, Output-, Cache-Lese- und Cache-Schreib-Tokens, Batch-Kennzeichen (batch, is_batch, service_tier), Anfragen, Datum, Kosten; sonst erscheint ein Dialog zur manuellen Zuordnung. Modellnamen werden normalisiert, auch Bedrock-Präfixe wie eu.anthropic.claude-sonnet-4-5-20250929-v1:0. Ein Modell ohne hinterlegten Preis wird nicht geraten, sondern als nicht bewertet ausgewiesen.
Cache-Tokens bei OpenAI und Anthropic
Bei OpenAI sind gecachte Tokens (input_cached_tokens) eine Teilmenge der Input-Tokens. Bei Anthropic enthält input_tokens nur den ungecachten Anteil; cache_read_input_tokens und cache_creation_input_tokens kommen hinzu. Der Rechner erkennt das Anthropic-Schema an Spaltennamen oder Anbieter und addiert die Cache-Tokens auf den Input, so dass beide Anbieter intern gleich behandelt werden. Übersteigen Cache-Tokens die Input-Tokens, erscheint ein Hinweis zur Cache-Semantik.
Kosten je Zeile = ungecachter Input mal Inputpreis plus Cache-Lesen mal Cache-Lesepreis plus Cache-Schreiben mal Cache-Schreibpreis plus Output mal Outputpreis, je Million Tokens; Batch-Zeilen mit Faktor 0,5, Modelle ohne Batch-Angebot (GPT-5.5 Pro, o3-pro, o1-pro) zum vollen Preis.
Zeitraum
Alle Summen werden auf 30 Tage normiert. Zeitraum = letzter Tag minus erster Tag plus Bucket-Breite; die Breite ist ein Tag, bei gleichmäßigen Abständen von sieben oder 28 bis 31 Tagen die Wochen- oder Monatsbreite (fünf Wochenbuckets ergeben 35 Tage). Doppelte Tage zählen einmal. Ohne Datumsspalte gelten 30 Tage; das Feld „Zeitraum der Daten in Tagen“ überschreibt beides.
Die vier Hebel
Je Modell in fester Reihenfolge; jeder Hebel rechnet auf dem Rest des vorherigen.
1. Modellupdate
Hat ein Modell einen hinterlegten Nachfolger gleicher oder besserer Stufe (Sonnet 4.6 auf Sonnet 5, GPT-5.5 auf GPT-5.6 Sol), wird jede Zeile mit dessen Preisen neu bewertet, inklusive Batch-Kennzeichen: Ersparnis = heutige Kosten minus Kosten beim Nachfolger. Ist der Nachfolger teurer, bleibt das Modell und die Mehrkosten werden gemeldet. Claude 4.7 und neuer (Sonnet 5, Opus 5, Fable 5) nutzen einen neuen Tokenizer, der laut Anthropic für denselben Text bis zu 35 Prozent mehr Tokens erzeugen kann; beim Wechsel von einem älteren Claude-Modell rechnet der Rechner deshalb mit Faktor 1,2 auf alle Tokens. Beispiel: 1 Mio. Input- und 0,2 Mio. Output-Tokens kosten auf Sonnet 4.6 6,00 USD, auf Sonnet 5 4,00 USD mal 1,2 = 4,80 USD; ausgewiesen werden 1,20 USD (20 Prozent), nicht ein Drittel. Den echten Faktor messen wir vor der Umstellung mit count_tokens an Ihren Prompts.
2. Batch
Ersparnis = Kosten der Zeilen, die heute nicht über Batch laufen (kostengewichtet, also ihre tatsächlichen Kosten statt ihres Tokenanteils; nach einem Update anteilig verringert) mal Batch-Anteil mal 0,5.
3. Prompt-Caching
Vom noch ungecachten Input gilt der eingestellte Anteil als cachefähig; davon zählen 85 Prozent als Cache-Treffer, 15 Prozent als Schreibvorgänge. Ersparnis = Treffer mal (Inputpreis minus Cache-Lesepreis) minus Schreibvorgänge mal Schreibaufschlag. Der Aufschlag ist Cache-Schreibpreis minus Inputpreis: bei Anthropic, GPT-6 Astra und GPT-5.6 das 1,25-fache des Inputpreises, bei älteren OpenAI-Modellen null. Danach die Batch-Überschneidung: Tokens, die bereits im Batch laufen, zählen mit 0,5, die übrigen mit 1 minus Batch-Anteil mal 0,5, weil ein Cache-Treffer in einer halbierten Batch-Anfrage nur die Hälfte spart.
4. Routing
Hat ein Modell eine hinterlegte kleinere Stufe (Opus 5 auf Sonnet 5, Sonnet 5 auf Haiku 4.5, GPT-5.6 Sol auf Terra): Ersparnis = Rest nach Update, Batch und Caching mal Routing-Anteil mal (1 minus Preisverhältnis). Das Preisverhältnis bewertet den echten Mix des Modells aus ungecachtem Input, Cache-Lesen, Cache-Schreiben und Output zu den Preisen der kleineren Stufe, geteilt durch dieselbe Bewertung zu heutigen Preisen, bei Tokenizer-Wechsel mal 1,2. Nur ohne Tokenmengen gilt ein Verhältnis von vier Input- zu einem Output-Token.
Summe und konservativer Wert
Rechnerische Ersparnis je Monat = Summe der vier Hebel; der konservative Wert ist die Hälfte, weil nicht jede Maßnahme den Regressionslauf besteht oder vollständig umgesetzt wird. Jahreswerte sind das Zwölffache zu heutigen Preisen; die Honorarzeile zeigt 30 Prozent dieser Spanne, abgerechnet wird nur nach der Nachweisregel unten. Unter 3.000 USD Monatskosten weist der Rechner darauf hin, dass eine begleitete Prüfung meist nicht lohnt.
Annahmen und Regler
- Anteil der Anfragen ohne Echtzeitbedarf: Startwert 30 Prozent, Regler.
- Cachefähiger Anteil des ungecachten Inputs: Startwert 40 Prozent, Regler.
- Anteil der Anfragen, die eine Stufe kleiner reicht: Startwert 25 Prozent, Regler.
- Fest: Cache-Trefferquote 85 Prozent, Batch-Faktor 0,5, Tokenizer-Faktor 1,2, konservativer Faktor 0,5.
Die Startwerte sind Erfahrungswerte für Integrationen mit System-Prompt, Tool-Definitionen und wiederkehrenden Dokumenten, keine Messung Ihres Systems; im Bericht ersetzen wir sie durch Ihre Angaben zu Latenzbedarf, Promptgröße und Evaluierungsset.
Preisrisiken und Hinweise
- GPT-5.6 Sol läuft mit Aktionspreis (4 / 0,40 / 20 statt 5 / 0,50 / 30 USD), von OpenAI mindestens bis 21.11.2026 zugesagt, ein Ende ist nicht angekündigt. Der Rechner zeigt die Mehrkosten bei Rückkehr des früheren Preises und bei einem Update auf Sol den Anteil der Ersparnis, der am Aktionspreis hängt; für GPT-5.5 ist das die gesamte Update-Ersparnis, weil der frühere Sol-Preis dem GPT-5.5-Preis entspricht.
- GPT-5, GPT-5 mini, GPT-5 nano und o3 werden am 11.12.2026 abgeschaltet. Ein teurerer Nachfolger wird als Migrationsrisiko mit Betrag gemeldet, nicht als Ersparnis.
- Claude Sonnet 3.5, Sonnet 3.7 und Opus 3 sind abgeschaltet; solche Zeilen gelten als Pflichtmigration.
- Tokenizer-Wechsel, Cache-Semantik, unbekannte Modelle und Kostenexporte ohne Tokens erzeugen je einen eigenen Hinweis.
Was der Rechner nicht ist
Ein Szenario zu heutigen Listenpreisen. Modellwechsel werden mit gleicher Tokenmenge gerechnet, nicht mit gleichem Text oder gleicher Qualität; ob ein anderes Modell Ihre Aufgabe gleich gut löst, zeigt nur ein Regressionslauf auf mindestens 200 echten Fällen aus Ihrem System. Individuelle Rabatte, Commitments und Long-Context-Aufschläge kennt er nicht. Jahres- und Honorarwerte sind Rechenbeispiele, keine Preisprognose und keine Abrechnungsgrundlage. Ihre Datei verlässt den Browser nicht; nur Summenwerte gehen mit dem Formular an uns.
Nachweisregel aus dem Vertrag
Abgerechnet wird nur die nach § 5 des Vertrags auf der Anbieterrechnung nachgewiesene Ersparnis. Basismonat ist der Durchschnitt der drei vollen Kalendermonate vor der ersten Umstellung. Einheit ist die Zahl der Anfragen je Anbieter, ersatzweise die Summe der Input- und Output-Tokens. Basiskosten je Einheit = Kosten des Basismonats zu dessen Listenpreisen geteilt durch dessen Einheiten; aktuelle Kosten je Einheit = Nutzung des Abrechnungsmonats zu den Listenpreisen des Basismonats geteilt durch die Einheiten des Abrechnungsmonats. Ersparnis = (Basiskosten je Einheit minus aktuelle Kosten je Einheit) mal Einheiten des Abrechnungsmonats; negative Werte gelten als null und werden nicht vorgetragen. Preisänderungen der Anbieter und Volumenänderungen bleiben so ohne Einfluss; individuelle Rabatte werden mit den rabattierten Preisen des Basismonats angesetzt; Ersparnisse allein durch abgeschaltete Funktionen oder gesunkene Nutzung zählen nicht.
Rechenbeispiel aus Anlage 1: Basismonat 40.000 USD bei 2.000.000 Anfragen = 0,0200 USD je Anfrage. November nach Umstellung (Batch für Nachtläufe, Caching des System-Prompts, Sonnet 4.6 auf Sonnet 5): 30.000 USD zu Basismonatspreisen bei 2.400.000 Anfragen = 0,0125 USD je Anfrage. Ersparnis = (0,0200 minus 0,0125) mal 2.400.000 = 18.000 USD; Honorar 30 Prozent = 5.400 USD, umgerechnet zum EZB-Referenzkurs am Rechnungstag, zuzüglich Umsatzsteuer. Eine Preiserhöhung um 20 Prozent im November änderte daran nichts; bei nur 1.000.000 Anfragen betrüge die Ersparnis 7.500 USD.
Preistabelle, Stand 17.09.2026
USD je 1 Mio. Tokens, Listenpreise ohne Rabatte; Batch halbiert alle Preise außer bei den gekennzeichneten Pro-Modellen. „wie Input“: kein eigener Schreibpreis, das Anlegen des Caches kostet den Inputpreis. Anthropic-Preise gegen die Referenz vom 24.06.2026 geprüft, am 17.09.2026 unverändert. Abgleich vierteljährlich.
| Modell | Input | Cache-Lesen | Cache-Schreiben | Output | Hinweis |
|---|---|---|---|---|---|
| GPT-6 Astra | 10,00 | 1,00 | 12,50 | 50,00 | |
| GPT-5.6 Sol | 4,00 | 0,40 | 5,00 | 20,00 | Aktionspreis mindestens bis 21.11.2026, vorher 5,00 / 0,50 / 6,25 / 30,00 |
| GPT-5.6 Terra | 2,00 | 0,20 | 2,50 | 12,00 | |
| GPT-5.6 Luna | 0,20 | 0,02 | 0,25 | 1,20 | |
| GPT-5.5 | 5,00 | 0,50 | wie Input | 30,00 | |
| GPT-5.5 Pro | 30,00 | 3,00 | wie Input | 180,00 | kein Batch |
| GPT-5.4 | 2,50 | 0,25 | wie Input | 15,00 | |
| GPT-5.4 mini | 0,75 | 0,075 | wie Input | 4,50 | |
| GPT-5.4 nano | 0,20 | 0,02 | wie Input | 1,25 | |
| GPT-5 | 1,25 | 0,125 | wie Input | 10,00 | Abschaltung 11.12.2026 |
| GPT-5 mini | 0,25 | 0,025 | wie Input | 2,00 | Abschaltung 11.12.2026 |
| GPT-5 nano | 0,05 | 0,005 | wie Input | 0,40 | Abschaltung 11.12.2026 |
| o3 | 2,00 | 0,50 | wie Input | 8,00 | Abschaltung 11.12.2026 |
| o3-pro | 20,00 | 2,00 | wie Input | 80,00 | kein Batch |
| o3-mini | 1,10 | 0,55 | wie Input | 4,40 | |
| o4-mini | 1,10 | 0,275 | wie Input | 4,40 | |
| o1 | 15,00 | 7,50 | wie Input | 60,00 | |
| o1-mini | 1,10 | 0,55 | wie Input | 4,40 | |
| o1-pro | 150,00 | 150,00 | wie Input | 600,00 | kein Batch |
| GPT-4.1 | 2,00 | 0,50 | wie Input | 8,00 | |
| GPT-4.1 mini | 0,40 | 0,10 | wie Input | 1,60 | |
| GPT-4.1 nano | 0,10 | 0,025 | wie Input | 0,40 | |
| GPT-4o | 2,50 | 1,25 | wie Input | 10,00 | |
| GPT-4o mini | 0,15 | 0,075 | wie Input | 0,60 | |
| GPT-4 Turbo | 10,00 | 10,00 | wie Input | 30,00 | |
| Claude Fable 5.1 | 10,00 | 0,25 | 12,50 | 50,00 | neuer Tokenizer |
| Claude Fable 5 | 10,00 | 1,00 | 12,50 | 50,00 | neuer Tokenizer |
| Claude Opus 5 | 5,00 | 0,50 | 6,25 | 25,00 | neuer Tokenizer |
| Claude Opus 4.8 | 5,00 | 0,50 | 6,25 | 25,00 | neuer Tokenizer |
| Claude Opus 4.7 | 5,00 | 0,50 | 6,25 | 25,00 | neuer Tokenizer |
| Claude Opus 4.6 | 5,00 | 0,50 | 6,25 | 25,00 | |
| Claude Opus 4.5 | 5,00 | 0,50 | 6,25 | 25,00 | |
| Claude Opus 4.1 | 15,00 | 1,50 | 18,75 | 75,00 | |
| Claude Opus 4 | 15,00 | 1,50 | 18,75 | 75,00 | |
| Claude Opus 3 | 15,00 | 1,50 | 18,75 | 75,00 | abgeschaltet seit 05.01.2026 |
| Claude Sonnet 5 | 2,00 | 0,20 | 2,50 | 10,00 | neuer Tokenizer |
| Claude Sonnet 4.6 | 3,00 | 0,30 | 3,75 | 15,00 | |
| Claude Sonnet 4.5 | 3,00 | 0,30 | 3,75 | 15,00 | |
| Claude Sonnet 4 | 3,00 | 0,30 | 3,75 | 15,00 | |
| Claude Sonnet 3.7 | 3,00 | 0,30 | 3,75 | 15,00 | abgeschaltet seit 19.02.2026 |
| Claude Sonnet 3.5 | 3,00 | 0,30 | 3,75 | 15,00 | abgeschaltet seit 22.10.2025 |
| Claude Haiku 4.5 | 1,00 | 0,10 | 1,25 | 5,00 | |
| Claude Haiku 3.5 | 0,80 | 0,08 | 1,00 | 4,00 | |
| Claude Haiku 3 | 0,25 | 0,03 | 0,30 | 1,25 |
Quellen
- OpenAI, API-Preise: https://openai.com/api/pricing/ und https://platform.openai.com/docs/pricing (Stand September 2026)
- OpenAI, Abschaltungen: https://platform.openai.com/docs/deprecations
- OpenAI, Batch API und Prompt Caching: https://platform.openai.com/docs/guides/batch und https://platform.openai.com/docs/guides/prompt-caching
- Anthropic, Preise: https://www.anthropic.com/pricing und https://docs.anthropic.com/en/docs/about-claude/pricing (Referenz 24.06.2026, geprüft 17.09.2026)
- Anthropic, Prompt Caching und Batch-Verarbeitung: https://docs.anthropic.com/en/docs/build-with-claude/prompt-caching und https://docs.anthropic.com/en/docs/build-with-claude/batch-processing
- Anthropic, Modellübersicht (Tokenizer ab Claude 4.7) und Token-Zählung: https://docs.anthropic.com/en/docs/about-claude/models/overview und https://docs.anthropic.com/en/docs/build-with-claude/token-counting
- Anthropic, Modellabschaltungen: https://docs.anthropic.com/en/docs/about-claude/model-deprecations
- Destiny Deutschland, Vertrag über die Prüfung und Optimierung von KI-API-Kosten, § 5 und Anlage 1 (Stand 17.09.2026)
- TokenCheck, Engine und Preistabelle: calc.js und prices.js im Seitenquelltext