トークンはAI言語モデルがテキストを処理するための基本単位ですが、日常的に使う「単語」や「文字」と完全に等しいわけではありません。現代のLLMは通常BPE(Byte Pair Encoding)などのアルゴリズムを使用してテキストを「サブワード」単位に分割します。
言語別のトークン効率:英語は平均して約3/4語/トークン。中国語の文字は通常1〜2トークン。コードのトークン効率は言語によって異なります。
直感的な量感:Claudeの200,000トークンのコンテキストウィンドウは英語の400ページの小説に相当します。ほとんどの日常タスクはこの制限の遠く手前で済みます。
Tokenizerツール:AnthropicはオンラインのTokenizerツールを提供しており、テキストを貼り付けてトークン数を確認できます。
APIのトークンコストはどのように計算されますか?実用的なトークン節約方法は何ですか?
コスト計算(Claude Sonnet 4.5の例):入力トークン約$3/1M;出力トークン約$15/1M。出力トークンは入力の5倍高価です。
各APIコールのトークンの主なソース:System Prompt(毎回のコールで転送、固定コスト);会話履歴(マルチターン蓄積、時間とともに増加);現在のユーザー入力。
効果的なトークン節約方法:System Promptの簡潔化;会話履歴の管理(無制限に蓄積しない);Prompt Cachingの有効化(System Promptが1,024トークンを超えるとき);出力長の明示的な指定。
同じコンテンツでもトークン数が大きく異なることがあるのはなぜですか?推定するためのルールはありますか?
トークン数はいくつかの要因に影響されます:
言語の違い:英語のトークン効率は通常中国語より低い。句読点と空白もトークンを消費します。
実用的な推定ルール:英語テキストは1,000語あたり約750トークン;中国語テキストは1,000文字あたり約1,000〜1,500トークン;コードは1,000文字あたり約250〜500トークン。
最も正確な方法はAnthropicのTokenizerツールを使って直接計算することです。
トークン、コンテキストウィンドウ、メモリの3つの概念はよく混同されます——その関係は何ですか?
トークン:AIがテキストを処理するための基本単位——測定単位です。「センチメートル」が長さの単位であるように、トークンはテキスト長の単位です。
コンテキストウィンドウ:1回の会話でAIが見ることができるテキストの最大量(トークン単位で測定)。
メモリ:AIが会話をまたいで保存・使用する個人化された情報(あなたの名前、好み、背景)。コンテキストウィンドウとは完全に異なります:コンテキストウィンドウは「この会話内の短期記憶」;メモリは「会話をまたぐ長期記憶」。
三者の関係:各会話の開始時に、メモリはコンテキストウィンドウに関連するメモリの概要をロードし、一部のトークンを消費します。
マーケティングディレクターがClaude APIを使って顧客メール返信ツールを構築しました。月次APIの請求が予想より40%高く、理由を理解して費用を削減したいと思っています。
トークンの視点から請求を分析:
問題1:System Promptが長すぎる。3,200トークンのSystem Prompt、500回/日のコール = System Promptだけで1日160万トークン。改善:コアな800トークンに簡潔化。月約$180のコスト削減。
問題2:Prompt Cachingが有効になっていない。固定の顧客背景データを追加して1,024トークンを超えるようにし、Prompt Cachingを有効化——85%のキャッシュヒット率で入力コストが約30%削減。
問題3:max_tokensの設定が大きすぎる。「返信は150字以内で」という指示を追加後、平均出力が300から180トークンに減少。
3つの改善を合わせると、月費用が$420から$195に、54%の削減。
トークン課金モデルのコアなトレードオフ:柔軟性 vs 予測可能性。トークン単位の課金は実際の使用量とコストを正確に対応させます——短いQ&Aはほとんどコストがかからず、複雑な長文分析はより多くかかります。しかし、これはコストの完全な予測が難しいことも意味します。コストの予測可能性が高く求められるアプリケーションには、追加の制御メカニズムが必要です:ユーザー入力の最大長の制限、ユーザーごとの日次トークン割り当ての設定、異常に高い使用リクエストの監視。