Haiku 5.5 的 100K 分段是整段 prompt 都按高價算,還是只有超出的部分?
依我查到的報導,描述是「超過 100K token 的 prompt,輸入 $0.50、輸出 $2.50」,語氣像是整個請求歸入較高檔,而不是只對超出部分加價。但這是從報導的措辭推算,我沒有看到官方定價頁的逐字說明。
上線前請以官方定價頁為準,並用一筆 110K token 的實際請求,對照帳單明細驗證。
要不要把現有的 Haiku 4.5 流量全部換成 Haiku 5.5?
不一定。短上下文、固定格式的分類與摘要,換過去通常划算;但如果你的請求長度常落在 77K 到 270K 之間,新 tokenizer 加上 $0.50 檔位會讓省幅縮小,甚至輸給其他模型的牌價。
比較穩妥的做法是先抽樣一週的真實請求,按 1.3 倍估算 token 後分成兩檔計價,再決定哪些路由換、哪些留著。
舊程式傳了自訂的 temperature,換模型會怎樣?
依報導,Haiku 5.5 收到非預設的 temperature、top_p 或 top_k 會回 400 錯誤,也就是請求直接失敗,而不是被忽略。
如果你的服務有重試或降級邏輯,要確認它不會把這個 400 當成暫時性錯誤無限重試;最乾淨的做法是在切換前先移除這些參數。
基準測試上 Haiku 5.5 贏過 GPT-6 Luna,可以直接當選型依據嗎?
不建議。這些數字是 Anthropic 自己公布、經媒體轉述的,題目集與設定也是廠商挑的,而且 Sonnet 5.5 在每一項都更高。
選型最可靠的依據是拿你自己的任務與提示跑一小批對照測試,把品質與每千次請求的實際成本一起比,而不是只看排行榜上的百分比。
Anthropic 在 2026 年 10 月 7 日推出 Claude Haiku 5.5(模型 ID claude-haiku-5-5),官方定位是「迄今最便宜、最快的小型模型」,適合摘要、Claude Code 的上下文壓縮、分類與 subagent 任務。同週 Claude Code v2.1.293 已把它設為 Anthropic API 上的預設 Haiku 模型。
Haiku 5.5 支援 1M token 上下文、最多 128K 輸出(批次作業在 beta 下可到 300K),輸入為文字與圖片,知識截止日為 2026 年 6 月。價格分兩段:prompt 在 100K token 以內,輸入 $0.10、輸出 $0.50(每百萬 token);超過 100K,輸入 $0.50、輸出 $2.50。快取讀取 $0.01,5 分鐘快取寫入 $0.125,批次處理再打五折。作為對照,Haiku 4.5 是 $1/$5。它也是第一個可調整 effort 的 Haiku 級模型,預設為 medium,adaptive thinking 預設開啟;若傳入非預設的 temperature、top_p 或 top_k,API 會直接回 400 錯誤。
依媒體整理的官方資料,短上下文下 Haiku 5.5 比 Haiku 4.5 便宜 90%。Anthropic 表示約 90% 的 Haiku 4.5 請求都在 100K 以內,而新 tokenizer 對同樣文字大約多算 30% 的 token,扣掉這點後平均約便宜 75%。這裡有一個容易漏算的細節:舊模型 77K token 的 prompt,換成新 tokenizer 約變成 100K,剛好踩線。以 Haiku 4.5 上 100K token 的 prompt 為例,成本是 $0.10;在 Haiku 5.5 上它約 130K token,整段按 $0.50 計價(依報導的分段描述推算),約 $0.065,省幅從 90% 縮到約 35%。反過來,Haiku 4.5 上 50K token 的 prompt 約變成 65K,成本從 $0.05 降到約 $0.0065,省幅約 87%。
Anthropic 公布的數字顯示:OSWorld 2.1(離線子集)Haiku 5.5 為 72.4%,GPT-6 Luna 為 48.9%,Haiku 4.5 為 15.7%;Terminal-Bench 4.0 為 39.2%,對 Luna 的 16.4% 與 Haiku 4.5 的 0.0%。Humanity's Last Exam 無工具 45.9%、有工具 57.4%。需要注意這些都是廠商自報數字,且 Sonnet 5.5 在每一項都領先(Terminal-Bench 4.0 為 70.6%)。Anthropic 自己也建議複雜的 agentic coding 仍用 Sonnet 5.5 或 Opus 5.5,Haiku 5.5 定位是它們底下的 subagent。價格方面,GPT-6 Luna 的短上下文定價同為 $0.10/$0.50,但其較高價位要到 272K 輸入才開始($0.20/$0.75),所以在 150K token 這種區間,Luna 的牌價比 Haiku 5.5 低。Haiku 5.5 已在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 與 Claude Platform on AWS 全面開放。
遷移前先用你自己的流量算兩件事:第一,把現有請求的 token 數乘以 1.3,看有多少比例會越過 100K;第二,確認有沒有程式在傳自訂的 temperature,那會直接變成 400 錯誤。如果你的工作負載大多是短上下文的分類、摘要或 subagent 呼叫,省下的錢很可觀;如果大量請求落在 100K 到 270K 之間,就要拿 Haiku 5.5 的 $0.50 檔位去跟其他模型的牌價逐一比較,不要只看那個 $0.10 的標題數字。