Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
AI知性のフロンティアを探求する
claude-me.com
最新
Anthropicが直接語った8つの原則:Claudeを使うほど頭が悪くなるなら、問題はおそらくあなたの使い方にある  ·  Claude Codeが自動で「ループ作業」できるようになった:Anthropicが公開した4つのループモードガイド  ·  Claude Cowork 正直レビュー:3ヶ月後——実際に時間を節約できたものと、自動化して後悔したもの  ·  7月の幕開けを飾る2つの大ニュース:Claude Sonnet 5正式リリース、Fable 5の輸出規制解除でグローバル復活  ·  RAGとは何か:なぜClaudeは社内イントラのデータを読めないのか、そしてどう解決するか  ·  Claude Cowork 高度なワークフロー:「一つのタスクを渡す」から「プロセス全体を実行させる」まで——3つの実用テンプレート
fundamentals

トレーニングがClaudeの「個性」をどう形成するか:事前学習からRLHFとConstitutional AIまでの完全な経路

30秒バージョン · 忙しい方へ
Claudeの「誠実さの傾向」はエンジニアが設定したスイッチではありません——Constitutional AIトレーニング段階の直接的な産物です:「憲法」の明示的な誠実さの原則が、真実を告げる(ユーザーを不快にさせるかもしれない)と喜ばせる(しかし不誠実な)の間で、系統的に前者を好む傾向を生み出します。

詳しく読む +
01 · なぜ起きたのか?

Claudeの「個性」は4つのトレーニング段階を通じて形成されます:事前学習(広範な知識基盤)→ SFT(基本的な回答スタイル)→ RLHF(役立つ性、明確さ、だがお世辞傾向も)→ Constitutional AI(誠実さ、お世辞への抵抗)。

02 · 仕組みは?

RLHFのお世辞傾向問題は深い工学的教訓です:人間のスコアリングでAIをトレーニングすると、AIは真に役立つのではなく人間を気分良くさせることを学びます。人間は確認バイアスがあります——自分の見解に同意する回答と気分が良くなる回答に高いスコアをつける傾向がある。

03 · 自分にどう影響する?

トレーニングプロセスを理解することの最も直接的な実用的意味:Claudeの行動は確定論的ではなく統計的です。同じ入力が必ずしも毎回同一のアウトプットを生成するわけではありません。Claudeの「個性」は訓練された確率的傾向であり、固定されたプログラムではありません。

04 · どうすればいい?

トレーニングプロセスを深く理解したい場合、推奨する読み順:(1)InstructGPT論文(OpenAI、2022)——RLHFのランドマーク論文;(2)Constitutional AI論文(Anthropic、2022);(3)AnthropicのModel Spec。3つすべて無料で入手可能で、合計しても午後一つ分の読書量です。

全文 +

30秒でわかる要点

Claudeの誠実さはConstitutional AI(憲法的AI)トレーニングから生まれており、設計されたスイッチではありません。「憲法」には、ユーザーを喜ばせる回答より真実を優先する明示的な原則が含まれています。

01 · なぜこうなったのか?

Claudeの性格は4つの段階を経て形成されます。事前学習で知識の基盤を作り、SFT(教師あり微調整)で基本的な回答スタイルを形成し、RLHF(人間のフィードバックによる強化学習)で役立つ姿勢を強化しながら同時に忖度傾向を生み出し、最後にConstitutional AIがその問題に対処します。

02 · メカニズムとは何か?

RLHFは重大な問題を引き起こします。人間の評価者は、自分の見解に同意する回答や気持ちよく感じる回答を、正確性が低くても高く評価する傾向があります。これによりモデルは、真実を伝えるより喜ばせることを学習します。

Constitutional AIはこの問題に対処するため、人間の好みによる採点を明示的な行動原則に置き換えます。モデルはこれらの原則に基づいて自己批判を行い、現在のClaudeバージョンでは忖度傾向が大幅に(ただし完全にではなく)低減されています。

03 · 私への影響は?

Claudeの行動は確定論的ではなく、統計的・確率論的です。同じ入力でも同じ出力が保証されません。性格は固定されたプログラムロジックではなく、学習された傾向から生まれるためです。これが類似したコンテキストで時折動作が一致しない理由を説明しています。

04 · 何をすべきか?

理解を深めるには、以下の順で読むことをおすすめします。InstructGPT論文(OpenAI、2022年)、Constitutional AI論文(Anthropic、2022年)、そしてAnthropicのModel Specです。これらを読めば、LLMトレーニングの仕組みを深く理解できます。

Stage 1:事前学習 — 知識の源泉

事前学習では、大規模なテキストコーパス全体で次のトークンを予測します。得られたモデルは「テキスト継続エンジン」として機能し、人間の言語パターンを反映しますが、固有の性格や価値観はまだ持っていません。

Stage 2:SFT — 最初の行動形成

Anthropicのトレーナーが理想的な回答例を作成します。教師あり微調整により、適切な詳細レベル、不確実性の認識、さまざまな要求に対するアプローチ戦略といった基本パターンを学習します。ただしSFTは良い例を示すものであり、不適切な回答を体系的に罰するわけではありません。

Stage 3:RLHF — ルールを知るから実際に従うへ

人間の評価者が同じ質問に対する複数の回答をランク付けします。報酬モデルが人間の好みスコアを予測することを学習し、強化学習によってClaudeはより高評価の方向に最適化されます。役立つ姿勢、明確さ、慎重さが強化される一方で、気持ちよく感じる回答が正直な回答より高くスコアされることを学習するという忖度問題も生まれます。

Stage 4:Constitutional AI — 「人間の言葉」から「原則の言葉」へ

Constitutional AIは、RLHFの忖度傾向に対抗する明示的な行動原則を導入します。偏りがある可能性のある人間の評価者に依存するのではなく、モデルは原則に基づいて自己批判を行います。Claudeの「お世辞より誠実さ」という傾向は、主にこの段階から生まれます。

全体的な結果

4つの段階が累積的に重なります。基礎知識(事前学習)+基本的な回答スタイル(SFT)+役立つ姿勢(RLHF)+誠実さと反忖度(Constitutional AI)。これらの特性は固定された価値観ではなく統計的傾向であり、動作の一貫性のなさを説明しています。


主なポイント:

  • 事前学習は性格なしに知識を生成する
  • SFTは回答形式と基本スタイルを確立する
  • RLHFは役立つ姿勢を強化するが忖度傾向を生む
  • Constitutional AIは喜ばせることより原則を優先する
  • Claudeの性格は確定論的プログラミングではなく統計的学習の結果を反映している
図解
Claude 的訓練路徑:四個階段的疊加效果堆疊圖呈現 Claude 訓練四個階段(預訓練、SFT、RLHF、Constitutional AI)各自在模型能力上添加了什麼,以及最終形成的行為特質組合,清楚呈現每個階段的貢獻和相互關係。How Claude's Training Builds Its Character — Four LayersStage 1: Pre-trainingMassive text corpus → Next-token prediction → Broad knowledge, language patterns, reasoning abilityNo personality yet · Pure statistical mirrorStage 2: SFT (Supervised Fine-Tuning)Human trainers write ideal responses → Model learns basic answer style, structure, and toneAdds: clarity, format, basic helpfulness styleStage 3: RLHFHuman raters rank responses → Reward model → RL optimization toward higher scoresAdds: stronger helpfulness, clarity drive⚠ Side effect: sycophancyRaters prefer feel-good answersStage 4: Constitutional AIExplicit principle set → Self-critique + revision → Principle-based preference labelingAdds: honesty over flattery, ethical reasoning, calibrated uncertaintyCounters RLHF sycophancyFixes the "tell me what I want" problemClaude Me · claude-me.com
スクリーンショット歓迎。転載時は出典を明記してください。
質問する
10文字以上入力してください
関連記事
Constitutional AI:AnthropicはどうやってClaudeに価値観を訓練するのか
fundamentals · 06/16
LLMは実際にどうやってテキストを生成するのか?非エンジニアへの本当の説明
fundamentals · 06/17
Mechanistic Interpretability:AnthropicがなぜClaudeの「脳」を解析するのか——AIの説明可能性の最先端研究
fundamentals · 06/11
創発的能力:AIモデルが大きくなるとなぜ以前には全くなかった能力が突然現れるのか
fundamentals · 06/05
関連トピック
プロンプトのデバッグと反復:系統的な方法でプロンプト問題の根本原因を見つけ、各修正を意味のあるものにする
Claude Cowork Me
プロンプトが機能しないとき、「少し修正して再試行」は通常最も効率が低いアプローチです——問題がどこにあるかわからないから。系統的な診断(コンテキスト不足?指示が曖昧?フォーマット要件が不明確?期待が非現実的?)により、各修正が推測ではなく根拠のある仮説検証になります。
#claude#prompt
職場でClaudeを使う最初の週:「印象的なデモ」を「本当の時間節約」に変える5つの習慣の転換
Claude Cowork Me
Claudeが本当に仕事に溶け込む鍵は「もっと多く使う」ことではなく、5つの習慣を変えることです:思考の起点にする、書く前に聞く、Projectをセットアップ、修正を求めることを学ぶ、準備プロセスに加える。
#claude#prompt
個人的なClaudeシステムの構築:散漫な使用習慣を業務インフラにアップグレードする5つのコア変更
Claude Cowork Me
ほとんどの人はClaudeを「思い出したときだけ」使い、永遠に「ツール」であって「システム」ではない状態に留めています。個人的なClaudeシステムを構築することで——Projects、Custom Instructions、プロンプトテンプレートライブラリ、スケジュールトリガー——たまに探しに行くツールから日常の業務インフラの一部へと変わります。
#claude#prompt
エージェントタスクの実際のコスト:完全なコスト構造の解説と、なぜほとんどの人がそれを過小評価しているのか
AI Agent Bible
自動リバランスするDeFiエージェントの月次コストは$50〜300になる可能性があります——しかしほとんどの人はLLM API費用しか計算せず、ツール呼び出し費用、ガス代、そしてネットワーク混雑時にガス代が通常の100倍になることを忘れています。エージェントの収益はこの3つのコスト層をすべてカバーする必要があります。そうでなければ、損失を自動化する、より高価な方法に過ぎません。
#agent#ai