Dev

Claude Haiku 5.5 und GPT-6 Luna kosten gleich viel, bis der Prompt lang wird

Identische Preislisten, zwei verschiedene Kanten. Bei langen Prompts trennen sich die Modelle: Das eine rechnet über 100.000 Tokens den ganzen Request zum höheren Tarif ab, das andere erst über 272.000. Für einen Subagent, der Dateien liest, entscheidet diese Grenze die Rechnung stärker als der Tarif.

Anthropic hat Claude Haiku 5.5 am 7. Oktober veröffentlicht, und die Tokenpreise für kurze Prompts stimmen mit OpenAIs GPT-6 Luna auf den Cent überein: 0,10 $ pro Million Input-Tokens, 0,50 $ Output, 0,01 $ für einen Cache-Read, 0,125 $ für einen Cache-Write. Am selben Tag hat Claude Code v2.1.293 seinen Alias haiku auf der Anthropic API auf das neue Modell umgestellt.

Gleiche Preisliste also. Der Unterschied liegt darin, wo sie jeweils aufhört zu gelten, und für einen Subagent, der Dateien liest, ist genau diese Grenze am Ende der Preis.

Ab wann ändert sich der Preis von Claude Haiku 5.5?

Über 100.000 Prompt-Tokens, und die Änderung gilt für den ganzen Request. Anthropics Preistabelle hat für Haiku 5.5 zwei Zeilen, "for prompts up to 100,000 tokens" und "for prompts over 100,000 tokens", und jede Spalte springt: Input auf 0,50 $, Output auf 2,50 $, Cache-Reads auf 0,05 $, Cache-Writes auf 0,625 $. Das ist das Fünffache des kurzen Tarifs, Output eingeschlossen.

GPT-6 Luna hat auch eine Grenze, über 272.000 Input-Tokens. Darüber verlangt OpenAI das Doppelte für Input und Cache und das 1,5-Fache für Output, "for the full request": 0,20 $ rein, 0,75 $ raus. Selbst der gleich teure Cache-Write ist nicht ganz dasselbe Produkt: Bei Anthropic kaufen die 0,125 $ fünf Minuten, OpenAI hält einen gecachten Präfix ab GPT-5.6 mindestens 30 Minuten.

Was kosten Claude Haiku 5.5 und GPT-6 Luna pro Request?

Bis 100k gleich viel, zwischen 100k und 272k Faktor fünf auseinander, darüber ungefähr Faktor zweieinhalb. Ungecachter Prompt, 2.000 Output-Tokens (Thinking eingeschlossen):

PromptClaude Haiku 5.5GPT-6 Luna
90.000 Tokens0,010 $0,010 $
110.000 Tokens0,060 $0,012 $
300.000 Tokens0,155 $0,062 $

Die Kante ist der Teil, den ich im Auge behalten würde. Ein Prompt mit 99.000 Tokens kostet rund einen Cent Input, bei 101.000 sind es fünf. Dateiinhalte, Logs und Tool-Definitionen können den Prompt eines Subagents über diese Grenze schieben. Große Tool-Kataloge verbrauchen schon Kontext, bevor der Agent den Request liest, bei Haiku 5.5 können sie auch deine Preisstufe bestimmen.

Was setzt Anthropics "75 % günstiger" für Claude Haiku 5.5 voraus?

Einen Traffic-Mix, der aussieht wie der von Haiku 4.5. Laut Fußnote ist Haiku 5.5 bis 100k 90 % günstiger als Haiku 4.5 und darüber 50 % günstiger. Dieselbe Fußnote sagt, dass rund 90 % der Haiku-4.5-Requests unter 100k lagen und dass der Durchschnitt den neuen Tokenizer berücksichtigt.

Meine Einschätzung: Der Mix ist die Schwachstelle. Haiku 4.5 hatte ein Kontextfenster von 200k, sein Topf "über 100k" konnte also nur Prompts zwischen 100k und 200k enthalten. Haiku 5.5 hat 1M. Der Durchschnitt wurde auf Traffic berechnet, der die Long-Context-Jobs, zu denen das neue Fenster einlädt, gar nicht enthalten konnte. Für kurze Klassifikation und Routing ist das fair. Für Agent-Arbeit, die ein Repository liest, rechne selbst nach.

Lies die Grenze auch andersherum. Die 100k werden im neuen Tokenizer gezählt, der für denselben Text etwa 30 % mehr Tokens erzeugt, sie liegen also bei ungefähr 77k Haiku-4.5-Tokens. Ein Prompt, der auf Haiku 4.5 bei 80k lag, landet auf 5.5 über der Grenze, ohne dass sich auf deiner Seite etwas geändert hat. Die Fußnote sagt nicht, in welchem Tokenizer ihre "90 % unter 100k" gezählt wurden.

Bei festen 2.000 Output-Tokens kostet ein 110k-Prompt immer noch weniger als derselbe Text auf Haiku 4.5 (dort etwa 85k Tokens): 0,060 $ gegen rund 0,095 $. Verstecktes Thinking kann das pro Request ändern.

Was lassen die Docs zu Claude Haiku 5.5 und GPT-6 Luna offen?

Zwei Dinge. Oberhalb der Grenze werden gecachte Tokens zum höheren Tarif abgerechnet, diese Zeile ist veröffentlicht. Ob sie beim Überschreiten der Grenze mitzählen, steht für Haiku 5.5 nirgends. Anthropics Caching-Docs definieren den gesamten Input als ungecacht plus Cache-Reads plus Cache-Writes, was auf Ja hindeutet. Falls ja, zahlt ein Agent mit großem gecachtem Präfix aus Anweisungen und Tools bei jedem Aufruf die hohe Stufe. Prüf usage an einem bekannten Prompt, bevor du einen Router darauf baust.

Und "gleicher Preis" heißt pro Token, nicht pro Aufgabe. Anthropic dokumentiert die 30 % gegenüber Haiku 4.5, OpenAIs Modellseite sagt nicht, wie sich Lunas Tokenizer im Vergleich verhält. Zähl deine echten Prompts auf beiden, bevor du der gleichen Preisliste traust:

python
n = client.messages.count_tokens(
    model="claude-haiku-5-5",
    system=system_prompt,
    tools=tools,
    messages=messages,
).input_tokens

Das funktioniert für Requests mit Client-Tools. Die meisten Server-Tools und der MCP-Connector werden nicht unterstützt, und die Zählung ist eine Schätzung. In der Nähe von 100k verlass dich deshalb auf das abgerechnete usage.

Welcher Code für Claude Haiku 4.5 bricht auf Claude Haiku 5.5?

Die lauten Fehler kommen als 400 zurück: temperature, top_p oder top_k setzen (alle drei weglassen, ein Klassifikator mit temperature 0 scheitert beim ersten Aufruf), ein Assistant-Prefill, budget_tokens, computer_20250124 auf der Claude API und Google Cloud, und Thinking zurückschicken, nachdem frühere Turns bearbeitet wurden. Die melden sich von selbst, wie schon bei Opus 5.5.

Die leisen kommen als 200. Adaptive Thinking ist standardmäßig mit Effort medium an, das Thinking zählt zu max_tokens, und ein kleines Limit, das für Haiku 4.5 eingestellt war, kann nach einem Thinking-Block ganz ohne Text enden. Auf der Anthropic API wechselt ein Claude-Code-Subagent, der dem Standard-Alias haiku folgt, das Modell, ohne dass jemand seine Definition anfasst. Thinking-Blöcke funktionieren nur im erzeugenden Account oder einem verknüpften, dieselbe Regel, die das Reasoning von Sonnet 5.5 bei einem Wechsel verwirft. Priority Tier wird auf Haiku 5.5 nicht unterstützt. Für Refusals gibt es auch keinen serverseitigen Fallback.

Welcher Subagent ist günstiger, Claude Haiku 5.5 oder GPT-6 Luna?

Bis 100k keiner: Pro Token kosten beide gleich viel, und in Anthropics eigener Tabelle liegt Haiku 5.5 bei jedem Benchmark, in dem beide vorkommen, vor Luna. Einen Preisgrund, dort zu wechseln, gibt es also nicht. Zwischen 100k und 272k ist Luna pro Token fünfmal günstiger.

Also zuerst nach Prompt-Länge auswählen und dann nach Anbieter, und das in Tokens messen, nicht in Requests. Neunzig Aufrufe mit 50k und zehn mit 150k: Die zehn sind ein Viertel der Input-Tokens und über 60 % der Input-Rechnung. Ist dieser Anteil klein, bringt dir ein zweiter Anbieter eine zweite Rechnung und einen zweiten Cache, den du warm halten musst. Ist er groß, kürz den Kontext oder schieb diese Jobs zu Luna. Sonnet 5.5 hat keine Long-Context-Stufe, und mit seinen am selben Tag auf 0,10 $ gesenkten Cache-Reads kostet ein langer gecachter Präfix dort doppelt so viel wie bei Haiku über der Grenze. Das ist ein fairer Preis, wenn der Job das stärkere Modell ohnehin gebraucht hat. Zähl deine Tokens auf beiden Tokenizern und finde den Anteil über 100k. Diese Zahl wählt den Anbieter, nicht die gleiche Preisliste.

Diskussion

Hier gibt es keine Kommentarspalte. Diskussionen laufen auf X.

Max Nardit

Max Nardit

@mnardit

Weitere Artikel

Claude-Code-Permission-Regeln: zehn Umgehungen, geschlossen in drei Releases

Die Hälfte der zehn Fixes betrifft Garantien, die die Dokumentation gibt, nicht die Grenzen, die sie ohnehin einräumt. Zwei weitere sind Komponenten, die offen versagt haben, und für ein PreToolUse-Hook-Skript, das abstürzt oder hängt, ist offenes Versagen weiterhin das dokumentierte Verhalten.