Claude Haiku 5.5 は、Anthropic が 2026 年 10 月 7 日に公開した、Claude で最も速く最も安いモデルです1 。設計や長時間の作業は Opus 5.5・Sonnet 5.5 に任せ、Haiku 5.5 は Claude Code のサブエージェントと、API での分類・抽出・仕分けの一括処理に使う のが基本です。料金は 100 万トークンあたり入力 $0.10・出力 $0.50 からで、Haiku 4.5 の 10 分の 1 です(10 万トークン以下のプロンプトの場合)2 。コンテキスト長は上位モデルと同じ 1M トークンです3 。この記事では、公式の数字だけで Opus 5.5・Sonnet 5.5 との違いを整理します。そのうえで、Claude Code のサブエージェントに model: haiku を指定する方法と、Batch API とプロンプトキャッシュで大量の仕事を安く回すコードを載せます(2026 年 10 月時点の情報です)。
Claude Haiku 5.5 は、Claude 5.5 世代の小型モデルです。公式ドキュメントは「分類・抽出・ルーティングのように、量が多く待ち時間に敏感な仕事向け」と説明しています3 。発表では、要約・会話の圧縮・データベースへの問い合わせ・分類に加え、Opus 5.5 や Sonnet 5.5 と組ませるサブエージェント の用途がはっきり挙げられています1 。
主な仕様を、Claude Platform のドキュメントの値でまとめます3 。
項目 Haiku 5.5 Sonnet 5.5 Opus 5.5 API のモデル ID claude-haiku-5-5claude-sonnet-5-5claude-opus-5-5料金(入力 / 出力、100 万トークンあたり) $0.10 / $0.50 から $2 / $10 $4 / $20 相対的な待ち時間 Fastest(最速) Fast Moderate コンテキスト長 1M トークン 1M トークン 1M トークン 最大出力(同期 API) 128K トークン 128K トークン 128K トークン 思考(thinking) 適応型 適応型 適応型(常にオン) API の既定の effort mediumhighmedium信頼できる知識の期限 2026 年 6 月 2026 年 6 月 2026 年 6 月
表のとおり、文脈の長さと出力の上限は上位モデルと同じで、違うのは料金と速さ です。Haiku 4.5 のコンテキストは 200K、最大出力は 64K だったので、大きく広がりました4 。
もう 1 つの変化が effort(エフォート)です。effort は、モデルがどれだけ考えて検証するかを決める設定です。Haiku 5.5 は Haiku 系で初めて effort に対応し、low から max までの 5 段階で費用と賢さを調整できます1 。
メインの会話は Opus 5.5 / Sonnet 5.5 が担い、範囲のはっきりした作業を Haiku 5.5 のサブエージェントに、同じ形の大量の作業を Haiku 5.5 + Batch API に回し、結果だけが戻る構成図 図: 筆者作成(Anthropic の発表と Claude Platform Docs をもとに作図)
注目される理由は、Haiku 4.5 より 1 桁安いのに、性能が大きく上がった からです。Anthropic は Haiku 5.5 を「これまでで最も安く、最も速く、最も有能な小型モデル」と呼んでいます1 。平均の費用は Haiku 4.5 より約 75% 低く、10 万トークン以下の依頼では 90% 低いと説明しています1 。
開発者の関心も高く、発表ページは Hacker News で 844 ポイントを集めました(2026-10-08 時点)5 。
性能は、発表ページの比較表で確かめられます。開発とエージェント作業に関係する項目を抜き出しました。
Claude Haiku 5.5 発表時のベンチマーク(%) データを表で見る Claude Haiku 5.5 発表時のベンチマーク(%) ベンチマーク Haiku 5.5(%) Haiku 4.5(%) Sonnet 5.5(%) OSWorld 2.1 72.4 15.7 83.9 Terminal-Bench 4.0 39.2 0 70.6 Humanity's Last Exam(ツールあり) 57.4 18.7 64.5 Chartography 46.4 6.4 61.6
出典: Anthropic「Claude Haiku 5.5」発表ページ(2026-10-07)の比較表。OSWorld 2.1 はオフラインのサブセット、Chartography はツールなし
読み方のポイントは 2 つです。
Haiku 4.5 からの伸びが大きい : 画面操作の OSWorld 2.1 は 15.7% から 72.4% に、エージェント的なコーディングの Terminal-Bench 4.0 は 0.0% から 39.2% に上がりました1
複雑なコーディングでは Sonnet 5.5 に届かない : Terminal-Bench 4.0 では Sonnet 5.5 の 70.6% と大きな差があります。Anthropic 自身も、複雑なエージェント的コーディングには Sonnet 5.5 と Opus 5.5 のほうが向いており、Haiku 5.5 は範囲の狭い仕事に向くと書いています1
つまり「Haiku に何でも任せる」のではなく、「範囲を切った仕事を Haiku に回す」使い方が前提です。
Haiku 5.5 の料金は、プロンプトが 10 万トークン以下か超えるかで 5 倍変わります 2 。ほかの 5.5 世代のモデルは 1M トークンの範囲すべてが同じ単価なので、ここが Haiku 5.5 だけの特徴です2 。
Claude API の料金(USD / 100 万トークン、標準の速度) データを表で見る Claude API の料金(USD / 100 万トークン、標準の速度) モデル 入力($) 出力($) Haiku 5.5(10 万以下) 0.1 0.5 Haiku 5.5(10 万超) 0.5 2.5 Haiku 4.5 1 5 Sonnet 5.5 2 10 Opus 5.5 4 20
出典: Anthropic, Claude Platform Docs「Pricing」(2026-10-08 参照)
キャッシュと Batch API の単価も、公式の料金表で確かめます2 。
項目(100 万トークンあたり) Haiku 5.5(10 万以下) Haiku 5.5(10 万超) Sonnet 5.5 Opus 5.5 5 分キャッシュの書き込み $0.125 $0.625 $2.50 $5 1 時間キャッシュの書き込み $0.20 $1 $4 $8 キャッシュ読み取り $0.01 $0.05 $0.10 $0.20 Batch API(入力 / 出力) $0.05 / $0.25 $0.25 / $1.25 $1 / $5 $2 / $10
境目は 1 回の依頼のプロンプトの長さ : 10 万トークンを超えた依頼は、入力だけでなく出力・キャッシュも高い方の単価になります3
Batch API とキャッシュの割引は重ねられる : Batch API は入出力とも 50% 引きで、キャッシュの割引と併用できます6
Sonnet 5.5 のキャッシュ読み取りも値下げ : Haiku 5.5 の発表と同時に、Sonnet 5.5 のキャッシュ読み取りは $0.20 から $0.10 に下がりました1 。Opus 5.5 と Sonnet 5.5 の違い を書いた時点(2026-10-05)の値から変わっています
1 件あたり入力 2,000 トークン・出力 300 トークンの分類を、1 万件流す場合を計算しました。式は「件数 ×(入力トークン × 入力単価 + 出力トークン × 出力単価)÷ 100 万」です。
Claude Code のバージョンと Haiku を指定したサブエージェントの定義を確かめ、公式単価で 1 万件の分類の費用を計算した実行結果 筆者が macOS・Claude Code v2.1.294 で実行した出力
モデル 通常 Batch API Haiku 5.5 $3.50 $1.75 Haiku 4.5 $35.00 $17.50 Sonnet 5.5 $70.00 $35.00 Opus 5.5 $140.00 $70.00
ただし、これは同じトークン数で比べた概算です。Haiku 5.5 は Claude 4.7 以降と同じ新しいトークナイザーを使うため、同じ文章が Haiku 4.5 より約 30% 多いトークンになります 4 。また、思考(thinking)のトークンは出力として数えられます4 。実際の費用は、少量を流して usage の値から見積もり直してください。
Claude Code では、メインの会話は Opus 5.5 / Sonnet 5.5 のまま、サブエージェントだけを Haiku 5.5 にする のがいちばん効果的です。公式ドキュメントも、簡単なサブエージェントの作業には model: haiku を指定するよう勧めています7 。サブエージェントは、別のコンテキストで作業して要約だけを返す助手です。基本は Claude Code サブエージェントの作り方と使い分け で説明しています。
Haiku 5.5 には Claude Code v2.1.293 以降が必要です8 。v2.1.293 から、Anthropic API ではエイリアス(別名)の haiku が Haiku 5.5 を指すようになりました8 。
claude --version
claude update
注意点として、haiku が指すモデルは提供元によって違います 。Amazon Bedrock・Google Cloud・Microsoft Foundry・Claude Platform on AWS では、2026 年 10 月時点で haiku は Haiku 4.5 を指します8 。これらの環境で Haiku 5.5 を使うときは、ANTHROPIC_DEFAULT_HAIKU_MODEL に、その提供元での Haiku 5.5 のモデル ID を設定してください8 。
.claude/ agents/ に Markdown のファイルを置き、frontmatter(先頭の --- で囲んだ設定)の model に haiku を書きます7 。次は、レビューの前に差分を仕分けるサブエージェントの例です。
---
name: diff-triage
description: 変更差分を読んで、レビューで重点的に見るべきファイルを仕分ける。PR レビューの前に使う。
tools: Bash, Read, Grep, Glob
model: haiku
effort: low
---
あなたはレビュー前の仕分け担当です。`git diff main...HEAD --stat` と差分を読み、
ファイルごとに「要注意 / 通常 / 機械的な変更」のどれかを付けてください。
要注意にする基準: 認証・権限・お金・データ削除・マイグレーション・並行処理。
報告は表 1 つと、要注意の理由を 1 行ずつ。コードは書き換えないこと。
model には haiku のほか、claude-haiku-5-5 のようなフルネームも書けます7
effort はこのサブエージェントが動くときの effort です。セッションの設定より優先されます7
動いているサブエージェントのモデルは / tasks で確かめられます(v2.1.242 以降)7
使うときは「diff-triage で差分を仕分けて」と頼みます。仕分けの結果を見て、要注意のファイルだけをメインの Opus 5.5 / Sonnet 5.5 でじっくりレビューします。こうすると、高いモデルが読む量を減らせます。
サブエージェントのモデルは、次の順で決まります7 。
Claude が呼び出すときに渡す model パラメータ
サブエージェントの定義の model(inherit ならメインの会話と同じ)
環境変数 CLAUDE_CODE_SUBAGENT_MODEL
メインの会話のモデル
CLAUDE_CODE_SUBAGENT_MODEL は既定値なので、定義や呼び出し時の指定があればそちらが勝ちます。すべてのサブエージェントを強制的に Haiku にしたいとき は、CLAUDE_CODE_SUBAGENT_MODEL_FORCE も設定します(v2.1.257 以降)7 。
{
"env" : {
"CLAUDE_CODE_SUBAGENT_MODEL" : "haiku" ,
"CLAUDE_CODE_SUBAGENT_MODEL_FORCE" : "1"
}
}
これは公式ドキュメントの例そのままです7 。settings.json の env に書きます。強制すると、定義の model も呼び出し時の指定も無視されます。例外はフォーク(会話を複製したサブエージェント)と、model: inherit のスキルだけです7 。設計の調査のように重いサブエージェントがあるなら、手順 2 のように個別に指定するほうが安全です。
組み込みのサブエージェント Explore(コードベースの調査役)は、既定ではメインの会話と同じモデル で動きます7 。Haiku で動かしたいときは、プロジェクトかユーザーの .claude/ agents/ に Explore という名前のサブエージェントを作り、model: haiku を書きます。同じ名前の定義が組み込みより優先されます7 。
軽い作業だけのセッションなら、メインの会話を Haiku 5.5 にもできます8 。
/model claude-haiku-5-5 # セッション中に切り替え
claude --model claude-haiku-5-5 # 起動時に指定
Claude Code の Haiku 5.5 は、どのプランでも 1M トークンの文脈で動き、既定では約 967K トークンで自動圧縮されます8 。ここで注意したいのが 10 万トークンの境目です。Claude Code は会話の履歴を毎回送るので、長いセッションではすぐに 10 万トークンを超え、単価が 5 倍になります 8 。メインで使うなら、こまめに / clear するか、自動圧縮の窓を小さくしてください。
API では、Haiku 5.5 + 構造化出力 + Batch API + プロンプトキャッシュ の組み合わせが基本形です。急がない大量の仕事は、この形にすると最も安くなります。
用途 例 組み合わせ 分類 Issue・問い合わせ・レビューコメントのラベル付け 構造化出力 + Batch API 抽出 文書から金額・日付・担当者を取り出す 構造化出力 + キャッシュ ルーティング 難しい依頼だけ Sonnet 5.5 / Opus 5.5 に回す 同期 API + effort: low 要約 ログ・長い議事録の要約 Batch API
発表では、金融調査の Rogo が、上位モデルが作る資料のために、10-K(米国の年次報告書)から事業セグメント別の売上を取り出すサブエージェントとして Haiku 5.5 を使っている例が紹介されています1 。
分類や抽出では、返事の形を JSON Schema で固定する構造化出力(structured outputs)を使います。output_config.format に JSON Schema を渡すと、返事がその形になります。Haiku 5.5 も対象モデルです9 。
次の Python のコードは、GitHub の Issue をまとめて分類します。構造化出力・Batch API・1 時間のプロンプトキャッシュを組み合わせています。
import json
import sys
import anthropic
client = anthropic.Anthropic()
SYSTEM = [{
"type" : "text" ,
"text" : open ("triage_rules.md" , encoding="utf-8" ).read(),
"cache_control" : {"type" : "ephemeral" , "ttl" : "1h" },
}]
SCHEMA = {
"type" : "object" ,
"properties" : {
"category" : {"type" : "string" , "enum" : ["bug" , "feature" , "question" , "docs" ]},
"priority" : {"type" : "string" , "enum" : ["p0" , "p1" , "p2" ]},
"needs_human" : {"type" : "boolean" },
"reason" : {"type" : "string" },
},
"required" : ["category" , "priority" , "needs_human" , "reason" ],
"additionalProperties" : False ,
}
def build (issue: dict ) -> dict :
return {
"custom_id" : f"issue-{issue['number' ]} " ,
"params" : {
"model" : "claude-haiku-5-5" ,
"max_tokens" : 2000 ,
"system" : SYSTEM,
"output_config" : {
"effort" : "low" ,
"format" : {"type" : "json_schema" , "schema" : SCHEMA},
},
"messages" : [{
"role" : "user" ,
"content" : f"# {issue['title' ]} \n\n{issue['body' ]} " ,
}],
},
}
issues = json.load(open (sys.argv[1 ], encoding="utf-8" ))
batch = client.messages.batches.create(requests=[build(i) for i in issues])
print (batch.id , batch.processing_status)
このコードは anthropic Python SDK 1.12.1 で、ダミーのキーを使って動かしました。リクエストが組み立てられて API まで届き、認証エラー(401)で止まるところまで確かめています。書き方のポイントは次のとおりです。
キャッシュは 1 時間にする : バッチは 5 分以上かかることがあるため、公式ドキュメントは共通部分に 1 時間のキャッシュを使うよう勧めています6 。ただしバッチでのキャッシュのヒットは保証されず、ヒット率は 30〜98% 程度とされています6
共通の指示は 512 トークン以上に : Haiku 5.5 でキャッシュできる最小の長さは 512 トークンです。Haiku 4.5 の 4,096 トークンから大きく下がりました10
max_tokens は余裕を持たせる : 思考のトークンも max_tokens に含まれます。小さすぎると、思考だけで止まって答えが返らないことがあります4
custom_id は 1〜64 文字の英数字・ハイフン・アンダースコア です6
バッチの多くは 1 時間以内に終わり、24 時間以内に終わらないと期限切れになります。結果は作成から 29 日間取り出せます。1 つのバッチには 10 万件か 256 MB のどちらか先に達するまで入れられます6 。結果の受け取りは、公式ドキュメントの例をもとに次のように書けます。
import json
import anthropic
client = anthropic.Anthropic()
for result in client.messages.batches.results("msgbatch_xxxxxxxx" ):
if result.result.type != "succeeded" :
print (result.custom_id, result.result.type )
continue
msg = result.result.message
label = json.loads(next (b.text for b in msg.content if b.type == "text" ))
if label["needs_human" ]:
print ("要確認:" , result.custom_id, label["reason" ])
返事の先頭には思考のブロックが来ることがあるので、content[0] ではなく type で text のブロックを選びます4 。needs_human が付いたものだけを、Sonnet 5.5 / Opus 5.5 か人が見る流れにすると、費用の大半を Haiku 5.5 の単価に抑えられます。
使い分けは「判断が要る仕事は上位モデル、形が決まった仕事を大量に回すなら Haiku 5.5 」です。迷ったら、まず Haiku 5.5 で少量を試し、正解率が足りなければ effort を上げるか Sonnet 5.5 に替えます。
仕事 選ぶモデル 理由 分類・抽出・ルーティング(大量) Haiku 5.5 + Batch API 公式が想定する用途3 。Batch で $0.05 / $0.25 サブエージェントの調べもの・要約・仕分け Haiku 5.5 サブエージェント用途を明記1 チャットサポートなど待ち時間が大事な用途 Haiku 5.5(low〜medium) 速さが Fastest と分類3 範囲のはっきりした機能追加・バグ修正 Sonnet 5.5 Terminal-Bench 4.0 で大きな差1 長時間のエージェント作業・設計判断 Opus 5.5 複雑な作業は上位モデルが向くと明記1 10 万トークンを超える文書を毎回読む処理 単価を比べて決める Haiku 5.5 は 10 万超で 5 倍2
Opus 5.5 と Sonnet 5.5 の使い分けそのものは、Opus 5.5 と Sonnet 5.5 の違い:使い分けと料金 で詳しく比べています。Claude Code そのものの機能は Claude Code のツールページ にもまとめています。
Haiku 4.5 のコードをそのまま Haiku 5.5 に向けると、エラーになる変更があります4 。
変更点 対処 thinking の budget_tokens(手動の思考)400 エラー。適応型の思考と effort に置き換える temperature・top_p・top_k を既定以外にする400 エラー。指定を外す3 assistant のメッセージで返事の書き出しを指定する(プレフィル) エラー。messages を user の発言で終える computer use の computer_20250124 Claude API と Google Cloud では computer_toolset_20260801 に置き換える 返事の先頭が思考のブロックになりうる type でブロックを選ぶ安全のための分類器が依頼を断ることがある stop_reason: "refusal" を処理する同じ文章のトークン数が約 30% 増える max_tokens と費用の見積もりを数え直す
思考は API では既定でオンです。high 以下の effort なら thinking: {"type": "disabled"} で止められますが、公式は effort で調整するほうを勧めています4 。一方、Claude Code では Haiku 5.5 の思考はオフにできません8 。
つまずきやすい点もまとめます。
Bedrock などで haiku が Haiku 4.5 になる : 提供元ごとのエイリアスの違いです。ANTHROPIC_DEFAULT_HAIKU_MODEL でモデル ID を固定します8
費用が想定より高い : 10 万トークンを超えた依頼が混ざっていないか、usage.input_tokens で確かめます2
分類の正解率が足りない : effort を low から medium 以上に上げるか、判断の基準をシステムプロンプトに具体的に書きます。それでも足りない仕事は Sonnet 5.5 に回します
Claude Haiku 5.5(2026-10-07)は Claude で最速・最安のモデル。$0.10 / $0.50 から、文脈 1M トークン、最大出力 128K
10 万トークンを超えるプロンプトは単価が 5 倍。Claude Code のメインの会話で使うときは特に注意する
Claude Code では、メインは Opus 5.5 / Sonnet 5.5 のまま、サブエージェントに model: haiku を書くのが効果的
API では構造化出力・Batch API・1 時間キャッシュを組み合わせ、迷うものだけ上位モデルに回す
Haiku 4.5 から移るときは、temperature・budget_tokens・プレフィルを外し、トークン数を数え直す
次にやることは、claude update で v2.1.293 以降にし、調べものや仕分けのサブエージェントを 1 つ model: haiku で作って / tasks でモデルを確かめることです。
100 万トークンあたり、10 万トークン以下のプロンプトは入力 $0.10・出力 $0.50、10 万トークンを超えると入力 $0.50・出力 $2.50 です2 。Batch API を使うと入出力とも 50% 引きになります(2026 年 10 月時点)。
1M トークンで、最大出力は 128K トークンです3 。Batch API ではベータのヘッダー output-300k-2026-03-24 を付けると最大 300K トークンまで出力できます3 。
.claude/ agents/ のサブエージェントの定義に model: haiku を書きます7 。すべてのサブエージェントを Haiku にするなら、settings.json の env に CLAUDE_CODE_SUBAGENT_MODEL を haiku、CLAUDE_CODE_SUBAGENT_MODEL_FORCE を 1 と設定します。どちらも Claude Code v2.1.293 以降が前提です8 。
分類・抽出・要約・仕分けのように範囲がはっきりした大量の仕事は Haiku 5.5、コーディングのように判断が続く仕事は Sonnet 5.5 です。Terminal-Bench 4.0 では Haiku 5.5 が 39.2%、Sonnet 5.5 が 70.6% と差があります1 。
動かない場合があります。temperature などのサンプリング設定、budget_tokens による手動の思考、assistant のプレフィルは Haiku 5.5 ではエラーになります4 。同じ文章のトークン数も約 30% 増えるので、max_tokens と費用の見積もりを見直してください。
使えます。Bedrock では anthropic.claude-haiku-5-5、Google Cloud と Microsoft Foundry では claude-haiku-5-5 です3 。ただし Claude Code の haiku エイリアスはこれらの環境では Haiku 4.5 を指すため、ANTHROPIC_DEFAULT_HAIKU_MODEL で指定します8 。