Claude Haiku 5.5 と GPT-6 Luna は、プロンプトが長くなるまでは同じ価格です
料金表はまったく同じで、崖の位置だけが違います。長いプロンプトで 2 つのモデルは分かれます。一方は 100,000 トークンを超えるとリクエスト全体を高い料金で計算し、もう一方は 272,000 トークンを超えてからです。ファイルを読むサブエージェントにとっては、単価よりもこの境界線のほうが請求額を左右します。
Anthropic は 10 月 7 日に Claude Haiku 5.5 をリリースしました。短いプロンプトでのトークン単価は OpenAI の GPT-6 Luna と 1 セント単位まで一致しています。100 万入力トークンあたり $0.10、出力 $0.50、キャッシュ読み取り $0.01、キャッシュ書き込み $0.125 です。同じ日に Claude Code v2.1.293 は、Anthropic API 上の haiku エイリアスを新しいモデルに切り替えました。
つまり料金表は同じです。違うのは、それぞれの料金表がどこで適用されなくなるかで、ファイルを読むサブエージェントにとっては、その境界線が結局のところ価格になります。
Claude Haiku 5.5 の料金はどこで変わるのか
プロンプトが 100,000 トークンを超えたところで、変更はリクエスト全体に適用されます。Anthropic の料金表には Haiku 5.5 の行が 2 つあり、"for prompts up to 100,000 tokens" と "for prompts over 100,000 tokens" です。すべての列が切り替わります。入力は $0.50、出力は $2.50、キャッシュ読み取りは $0.05、キャッシュ書き込みは $0.625 になります。短いプロンプトの料金の 5 倍で、出力も含みます。
GPT-6 Luna にも境界線があり、入力 272,000 トークンを超えたところです。それを超えると OpenAI は "for the full request" で入力とキャッシュを 2 倍、出力を 1.5 倍にします。入力 $0.20、出力 $0.75 です。同じ価格のキャッシュ書き込みでさえ、まったく同じ商品ではありません。Anthropic の $0.125 で買えるのは 5 分間ですが、OpenAI は GPT-5.6 以降のモデルで、キャッシュされたプレフィックスを最低 30 分保持します。
Claude Haiku 5.5 と GPT-6 Luna の 1 リクエストあたりのコストは
100k までは同じ、100k から 272k までは 5 倍の差、それを超えるとおよそ 2.5 倍の差です。キャッシュなしのプロンプト、出力 2,000 トークン(thinking を含む)の場合:
| プロンプト | Claude Haiku 5.5 | GPT-6 Luna |
|---|---|---|
| 90,000 トークン | $0.010 | $0.010 |
| 110,000 トークン | $0.060 | $0.012 |
| 300,000 トークン | $0.155 | $0.062 |
個人的に注意して見ているのは境界の部分です。99,000 トークンのプロンプトの入力コストは約 1 セントですが、101,000 トークンでは 5 セントになります。ファイルの内容、ログ、ツール定義はサブエージェントのプロンプトをこの線の向こうへ押し出すことがあります。大きなツールカタログはエージェントがリクエストを読む前からコンテキストを消費していますが、Haiku 5.5 ではさらに料金ティアまで決めてしまうことがあります。
Claude Haiku 5.5 の「75% 安い」は何を前提にしているのか
Haiku 4.5 と同じようなトラフィックの構成です。脚注によると、Haiku 5.5 は 100k までは Haiku 4.5 より 90% 安く、それを超えると 50% 安くなります。Haiku 4.5 のリクエストの約 90% は 100k 未満で、平均は新しいトークナイザーを考慮に入れているとのことです。
個人的には、弱点はこの構成だと見ています。Haiku 4.5 のコンテキストウィンドウは 200k だったので、「100k 超」の区分に入るのは 100k から 200k のプロンプトだけでした。Haiku 5.5 は 1M あります。新しいウィンドウが呼び込むロングコンテキストの処理を、そもそも含みようがなかったトラフィックで平均が計算されています。短い分類やルーティングならこれで妥当です。リポジトリを読むエージェントの処理なら、自分で計算してください。
この線は逆からも読めます。100k は新しいトークナイザーで数えられ、同じテキストでトークン数が約 30% 増えるので、Haiku 4.5 のトークンに換算すると約 77k になります。Haiku 4.5 で 80k だったプロンプトは、こちら側で何も変えていなくても 5.5 では線を越えます。脚注は「90% が 100k 未満」をどちらのトークナイザーで数えたのかを書いていません。
出力を 2,000 トークンに固定すると、110k のプロンプトは、同じテキストを Haiku 4.5 で送る場合(そちらでは約 85k トークン)よりまだ安く済みます。$0.060 に対して約 $0.095 です。見えない thinking によって、リクエストごとにこの結果は変わりえます。
Claude Haiku 5.5 と GPT-6 Luna のドキュメントで決着していないこと
2 つあります。線より上では、キャッシュされたトークンは高い料金で課金されます。この行は公開されています。ただ、それが線を越えるかどうかの計算に含まれるのかは、Haiku 5.5 については書かれていません。Anthropic のキャッシュのドキュメントは、入力の合計をキャッシュなしの分、キャッシュ読み取り、キャッシュ書き込みの合計として定義しており、含まれると考えるのが自然です。そうだとすると、指示とツールからなる大きなキャッシュ済みプレフィックスを持つエージェントは、呼び出しのたびに高いティアを払うことになります。それを前提にルーターを組む前に、内容のわかっているプロンプトで usage を確認してください。
もう 1 つ、「同じ価格」はトークンあたりの話で、タスクあたりではありません。Anthropic は Haiku 4.5 に対する 30% を文書化していますが、OpenAI のモデルページは Luna のトークナイザーがどう違うかを書いていません。同じ料金表を信用する前に、実際のプロンプトを両方で数えてください:
n = client.messages.count_tokens(
model="claude-haiku-5-5",
system=system_prompt,
tools=tools,
messages=messages,
).input_tokensこれはクライアントツールを使うリクエストでは動きます。ほとんどのサーバーツールと MCP コネクタには対応しておらず、数値も推定値なので、100k 付近では課金された usage を信用してください。
Claude Haiku 4.5 のどのコードが Claude Haiku 5.5 で壊れるのか
目に見える失敗は 400 で返ってきます。temperature、top_p、top_k の指定(3 つとも省略してください。temperature 0 に固定した分類器は最初の呼び出しで失敗します)、アシスタントのプリフィル、budget_tokens、Claude API と Google Cloud での computer_20250124、そして過去のターンを編集したあとで thinking を送り返すことです。これらは Opus 5.5 のときと同じく、自分から存在を知らせてくれます。
静かなほうは 200 で返ってきます。adaptive thinking はデフォルトで有効、effort は medium で、thinking は max_tokens に含まれます。Haiku 4.5 向けに調整した小さな上限だと、thinking ブロックのあとにテキストがまったくないまま止まることがあります。Anthropic API では、デフォルトの haiku エイリアスに従う Claude Code のサブエージェントは、誰も定義を編集しないままモデルが変わります。thinking ブロックは、それを生成したアカウントかリンクされたアカウントでしか使えません。切り替え時に Sonnet 5.5 の推論が失われるのと同じルールです。Haiku 5.5 では Priority Tier に対応していません。拒否応答に対するサーバー側のフォールバックもありません。
Claude Haiku 5.5 と GPT-6 Luna、サブエージェントとして安いのはどちらか
100k まではどちらでもありません。トークンあたりの価格は同じで、Anthropic 自身の表では両方が載っているすべてのベンチマークで Haiku 5.5 が Luna を上回っているので、そこで乗り換える価格上の理由はありません。100k から 272k の間では、Luna のほうがトークンあたり 5 倍安くなります。
ですから、まずプロンプトの長さで選び、ベンダーはその次です。そして測るのはリクエスト数ではなくトークン数です。50k の呼び出しが 90 回、150k が 10 回なら、その 10 回は入力トークンの 4 分の 1 ですが、入力の請求額の 60% 以上を占めます。その割合が小さければ、2 つ目のベンダーを入れても請求書と温めておくべきキャッシュが 1 つずつ増えるだけです。大きければ、コンテキストを削るか、その処理を Luna に移してください。Sonnet 5.5 にはロングコンテキストのティアがなく、同じ日にキャッシュ読み取りが $0.10 に下がったので、長いキャッシュ済みプレフィックスを読むコストは、線を越えた Haiku の料金の 2 倍になります。その処理にもともと強いモデルが必要だったのなら、妥当な価格です。両方のトークナイザーでトークンを数え、100k を超える割合を出してください。ベンダーを決めるのはその数字で、同じ料金表ではありません。