Tokens: warum Kosten und Kontingent nicht an Wörtern hängen
Gemeinsame Methoden · Gemeinsame Methode; die verlinkten Tool-Anleitungen erklären die genauen Schritte.
Diese Seite behandelt andere Tools als deine Auswahl. Du kannst sie weiterhin lesen. Passende Anleitungen finden
Die Einheit, in der alles abgerechnet und rationiert wird. Es sind keine Wörter, und diese Lücke ist der Grund, warum Kopfrechnen hier scheitert.
Alles, was Sie senden, und alles, was zurückkommt, wird in Tokens gezählt. Nicht in Wörtern, nicht in Zeichen, nicht in Nachrichten. Wer sein Gefühl für Kosten oder Kontingent auf einer dieser drei Grössen aufbaut, liegt auf eine Weise daneben, die im Alltag spürbar wird.
Ein Token ist ein Textstück. Häufige Wörter sind oft ein Token; längere oder seltene Wörter zerfallen in mehrere. Code, Satzzeichen, lange Bezeichner und nicht-englischer Text kosten pro sichtbarem Zeichen mehr Tokens als gewöhnliche englische Prosa.
Zwei Dinge, die das sofort erklärt
Warum eine kurze Frage teuer sein kann. Gezählt wird nicht die Frage. In jeder Runde liest das Modell die gesamte Unterhaltung erneut: die Systemanweisungen, jede frühere Nachricht, jede angehängte Datei, jedes Werkzeugergebnis. Eine Rückfrage aus drei Wörtern in einer langen Unterhaltung mit vier PDFs kostet das alles noch einmal. Die drei Wörter sind ein Rundungsfehler.
Warum Deutsch mehr kostet. Komposita, Umlaute und lange Zusammensetzungen zerfallen in mehr Tokens pro Wort als englischer Text. Dasselbe Dokument kostet übersetzt nicht dasselbe. Wer viel auf Deutsch arbeitet, erreicht Limits früher als eine Faustregel aus englischen Quellen vermuten lässt.
Eingabe und Ausgabe kosten nicht gleich
Ausgabe-Tokens kosten bei jedem aktuellen Modell ein Mehrfaches der Eingabe-Tokens. Bei der API steht das als Position in der Modellmatrix. Im Abo ist es unsichtbar, aber genauso real: Ein vollständig neu geschriebenes Dokument verbraucht mehr vom Kontingent als die Frage, welche drei Absätze geändert werden müssen.
Das ist die billigste verfügbare Optimierung, und fast niemand nutzt sie. Fragen Sie nach der Änderung, nicht nach dem Dokument.
Zum Ausprobieren
Nehmen Sie eine Unterhaltung, die Sie für typisch halten, und zählen Sie, was tatsächlich im Bündel steckt: wie viele frühere Runden, wie viele Anhänge, wie gross diese sind. Fragen Sie dann, wie viel davon die aktuelle Frage braucht. Die Differenz ist Ihr laufender Verlust, und er wird in jeder einzelnen Runde bezahlt.
Was schiefgeht
Schätzen anhand der Nachrichtenzahl. „Ich habe nur zwanzig Nachrichten geschrieben“ sagt nichts. Zwanzig kurze Nachrichten in einer frischen Unterhaltung und zwanzig in einer mit einem 50-seitigen PDF unterscheiden sich um Grössenordnungen.
Anhänge für einmalige Kosten halten. Eine angehängte Datei bleibt für den Rest der Unterhaltung Teil des Bündels.
Am Prompt feilen und den Verlauf ignorieren. Man ringt zwanzig Minuten um eine Formulierung und sendet nebenbei Tausende Tokens veralteten Kontext erneut.
Ganze Dokumente zurückverlangen. Ausgabe ist die teure Richtung.
So prüfst du das Ergebnis
Beobachten Sie Einstellungen → Nutzung über zwei Tage mit bewusst kürzeren Unterhaltungen und weniger Anhängen. Sinkt der Verbrauch spürbar, waren die Kontextgewohnheiten der Kostentreiber. Sinkt er nicht, ist die Arbeit tatsächlich gross, und die Antwort ist ein anderer Plan oder ein kleineres Modell, nicht mehr Disziplin.
Quellen
- Effective context engineering for AI agents — Anthropic Tier 1 2026-08-31
- What is the Max plan? — Anthropic Help Center Tier 1 2026-08-31
Stimmt etwas auf dieser Seite nicht?
Schreib, was du erwartet hast und was passiert ist. Das ist meist der kürzeste Weg zu einer Korrektur, und es landet im öffentlichen Issue-Tracker, damit die Änderung nachvollziehbar bleibt.