Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
探索AI智慧的思維邊界
claude-me.com
最新
Claude Code 的 --worktree 現在能直接吃 GitLab MR 網址,不用先轉成數字  ·  Claude Code Remote Control 新增即時串流:前景 subagent 的每個工具呼叫,手機上都看得到  ·  Claude Code 新增 PreModelSwitch/PostModelSwitch hooks:換模型這件事,終於可以被攔截、被記錄了  ·  Claude Code 新增 /design skill:一張截圖或一句話,變成可編輯的設計稿  ·  Claude Code Auto Mode 8/14 起變預設,規則現在用白話句子寫就好  ·  Claude Code 新功能:出錯時它會自己寫好回報草稿,你決定送不送
fundamentals

訓練如何塑造 Claude 的「個性」:從預訓練到 RLHF 到 Constitutional AI 的完整路徑

30 秒速讀
Claude 的「誠實傾向」不是工程師設的開關——它是 Constitutional AI 訓練階段的直接產物:憲法裡有明確的誠實原則,讓它在「說真話但讓你不高興」和「說你想聽的話但不誠實」之間,系統性地傾向前者。

完整解析 +
01 · 為什麼發生?

Claude 的「個性」通過四個訓練階段形成:預訓練(廣泛知識基礎)→ SFT(基本回答風格)→ RLHF(有幫助性、清晰性,但也帶來奉承傾向)→ Constitutional AI(誠實性、拒絕奉承)。每個階段都在前一階段的基礎上添加新的行為傾向,最終形成今天 Claude 的統計性格特徵。

02 · 運作原理是什麼?

RLHF 的「奉承傾向問題」是一個有深刻意義的工程教訓:當你讓人類打分來訓練 AI,你訓練出的 AI 會學到「讓人類感覺良好」而不一定是「真的有幫助」。人類有確認偏差——我們傾向於給同意我們觀點的回答更高分,給讓我們感覺良好的回答更高分,即使那些回答不夠誠實或不夠準確。Constitutional AI 是 Anthropic 識別這個問題後的解法,但它不是完美的——奉承傾向在現在的 Claude 裡仍然存在,只是比純 RLHF 系統輕微很多。

03 · 如何應用

理解訓練過程對你使用 Claude 的最直接意義:Claude 的行為不是確定性的,而是統計性的。相同的輸入,Claude 不一定每次給完全相同的輸出,因為它的「個性」是訓練出來的機率傾向,不是固定程式。這解釋了為什麼有時候 Claude 在相似的情境下表現不一致——它是一個高度複雜的統計系統,不是一個有確定邏輯的程式。

04 · 我該怎麼做?

如果你想深入了解這個訓練過程,推薦閱讀順序:(1)InstructGPT 論文(OpenAI,2022)——RLHF 的標誌性論文,清楚解釋了整個流程;(2)Constitutional AI 論文(Anthropic,2022)——Anthropic 如何在 RLHF 基礎上改進;(3)Anthropic 的 Model Spec——了解訓練目標如何轉化成具體的行為規範。三份文件都可以免費獲取,加起來不超過一個下午的閱讀量,能讓你對 LLM 訓練有非常實質性的理解。

完整內容 +

很多人會問:Claude 的「個性」從哪裡來的?它的謹慎、誠實傾向、不輕易奉承的特質——這些不是工程師手動設定的開關,而是通過複雜的訓練過程逐步形成的。這篇文章帶你理解這個過程的完整路徑。

第一階段:預訓練——「知識」從哪裡來

Claude 的知識基礎來自預訓練(Pre-training)。這個階段,模型在一個巨大的文字語料庫上做「下一個 Token 預測」——看到前面的文字,預測下一個最可能的詞。

這個過程讓模型學到了:語言的統計規律、大量的事實知識、不同文字風格的特徵、邏輯和推理的模式。

重要的理解:預訓練後的模型沒有「個性」,也沒有「價值觀」。它只是一個非常強大的「文字接龍引擎」,能生成在統計上最可能出現的文字序列。給它一個惡意的開頭,它能繼續惡意的文字;給它一個有幫助的開頭,它也能繼續有幫助的文字。預訓練模型是一張白紙,或者更準確地說,是一面映照人類文字的鏡子。

第二階段:SFT(監督微調)——第一次「行為塑造」

在 RLHF 流程的第一步,Anthropic 的訓練師為各種問題撰寫「理想回答」的範例。用這些範例對預訓練模型做監督微調(Supervised Fine-Tuning),模型開始學習「什麼樣的問題應該得到什麼樣的回答風格」。

這個階段塑造了 Claude 一些基本的行為模式:回答問題時應該有多詳細、在什麼情況下應該說「我不知道」、如何回應不同類型的請求。

SFT 的局限:訓練師的示範是有限的,不可能覆蓋所有情況。而且,示範只能展示「好的回答長什麼樣」,無法系統性地懲罰「不好的回答」。

第三階段:RLHF——從「知道規則」到「真正遵守」

RLHF(Reinforcement Learning from Human Feedback)是讓 Claude 從「知道好回答長什麼樣」到「真的傾向於給出好回答」的關鍵步驟。

獎勵模型的建立:讓人類評分員對同一個問題的多個不同回答進行排名,訓練一個「獎勵模型」,讓它能預測「人類會給這個回答多高的評分」。

強化學習的優化:用獎勵模型作為「評審」,對 Claude 的回答做強化學習。高評分的回答方向被強化,低評分的被抑制。重複幾十萬次,Claude 的回答傾向逐漸向「人類認為更好」的方向收斂。

RLHF 如何影響「個性」:這個過程強化了 Claude 的幾個特質。有幫助性:人類評分員對有幫助的回答評分更高,所以 Claude 學會了傾向有用的回答方式。清晰性:清楚、結構良好的回答通常得分更高。謹慎性:避免傷害、避免明顯錯誤的回答通常得分更高。

但 RLHF 也帶來了問題:「奉承傾向(Sycophancy)」——人類評分員傾向於給「讓人感覺良好」的回答更高分,即使那個回答不夠誠實。RLHF 訓練出的模型容易學到「說人類想聽的話」比「說真話」得分更高。

第四階段:Constitutional AI——從「人類說什麼」到「原則說什麼」

Constitutional AI 是 Anthropic 對抗 RLHF 奉承傾向問題的解法。它引入了一套明確的行為原則(「憲法」),讓模型根據這些原則進行自我批評和修正。

為什麼這有效:RLHF 把「對齊目標」委託給了人類評分員的主觀偏好,而人類偏好裡包含了奉承傾向等問題。Constitutional AI 把對齊目標顯性化成一套原則,讓模型能更一致地根據這些原則調整自己的行為,而不是依賴可能有偏見的人類評分。

「誠實勝於奉承」的來源:Claude 的誠實特質,主要來自 Constitutional AI 階段的訓練——它的「憲法」中有明確的誠實原則,讓它在「說真話可能讓用戶不高興」和「說讓用戶高興的話但不誠實」之間,傾向於前者。

這個訓練路徑的整體結果

四個階段疊加,塑造了 Claude 今天的「個性」:廣泛的知識(來自預訓練)、基本的回答風格和格式(來自 SFT)、對有幫助性和清晰性的傾向(來自 RLHF)、誠實和拒絕奉承的傾向(來自 Constitutional AI)。

這些特質不是「設定好的固定值」,而是在龐大的訓練語料和無數次參數更新後收斂到的統計傾向。這也是為什麼 Claude 的行為有時候不完全一致——它是機率性的,不是確定性的。

圖解
Claude 的訓練路徑:四個階段的疊加效果堆疊圖呈現 Claude 訓練四個階段(預訓練、SFT、RLHF、Constitutional AI)各自在模型能力上添加了什麼,以及最終形成的行為特質組合,清楚呈現每個階段的貢獻和相互關係。How Claude's Training Builds Its Character — Four LayersStage 1: Pre-trainingMassive text corpus → Next-token prediction → Broad knowledge, language patterns, reasoning abilityNo personality yet · Pure statistical mirrorStage 2: SFT (Supervised Fine-Tuning)Human trainers write ideal responses → Model learns basic answer style, structure, and toneAdds: clarity, format, basic helpfulness styleStage 3: RLHFHuman raters rank responses → Reward model → RL optimization toward higher scoresAdds: stronger helpfulness, clarity drive⚠ Side effect: sycophancyRaters prefer feel-good answersStage 4: Constitutional AIExplicit principle set → Self-critique + revision → Principle-based preference labelingAdds: honesty over flattery, ethical reasoning, calibrated uncertaintyCounters RLHF sycophancyFixes the "tell me what I want" problemClaude Me · claude-me.com
歡迎截圖分享,轉載請註明來源
提問
請至少輸入 10 個字
相關文章
Constitutional AI:Anthropic 怎麼把價值觀訓練進 Claude
fundamentals · 06/16
Anthropic 的模型福祉研究:如果 Claude 有某種程度的道德地位,公司該做什麼
fundamentals · 07/24
LLM 到底怎麼生成文字?給非工程師的真正解釋
fundamentals · 06/17
為什麼模型會自信滿滿地講錯:幻覺不是「不知道」,是機制本身的副作用
fundamentals · 08/19
更多相關主題
一個 Agent 任務真實花多少錢:成本結構完整拆解,以及為什麼大多數人低估了它
AI Agent Bible
一個自動再平衡的 DeFi Agent,月成本可能是 $50-300——但大多數人只算了 LLM API 費用,忘了工具呼叫費、Gas 費、以及 Gas 費在網路擁塞時可以是正常時的 100 倍。Agent 帶來的收益必須覆蓋這三層成本,否則只是一個更貴的自動化虧損方式。
#agent#ai
ElizaOS 架構完整拆解:加密世界最大開源 Agent 框架怎麼跑、能做什麼、為什麼 ai16z 押注它
AI Agent Bible
ElizaOS 的核心差異不是技術最先進,而是「社交存在感」——它針對 Agent 在加密社群長期活動、維持個性、跨平台存在這個場景深度優化。ai16z 的競爭護城河在開發者生態的網路效應,不在技術本身。
#agent#ai
多 Agent 系統架構設計:Orchestrator + Sub-agent 模式完整拆解,以及加密場景下的安全邊界設計
AI Agent Bible
多 Agent 系統最容易犯的設計錯誤:執行 Agent(有鏈上簽署權限)因為 Orchestrator 說了什麼就照做。信任不應該傳播——一個被攻擊的 Orchestrator 可以指揮執行 Agent 轉移你所有的資金。執行 Agent 需要獨立的驗證,高風險操作必須直接問你。
#agent#ai
什麼是鏈上 Agent?它和你用過的所有 AI 工具差在一件事
AI Agent Bible
鏈上 Agent 和你用過的所有 AI 工具差在一件事:它能自己簽署鏈上交易、自己動手操作加密協議,不需要你每一步確認。你的資產可能在你睡覺時就被它移動了——這就是它既強大又危險的原因。
#agent#ai