AI 對齊
確保 AI 系統的行為和目標與人類的意圖與價值觀一致的研究領域。簡單說:讓 AI 真的做它「應該做的事」,而不是技術上做到了任務,但方式或後果讓人不滿意甚至有害。
新手
AI 對齊
讓 AI 系統的目標和行為符合人類的意圖和價值觀的研究與工程工作。簡單說:確保 AI 做我們「真正想要的事」,而不是做它被字面上指示的事、或者追求我們沒有預料到的目標。這是 <a href="/zh/glossary/ai-safety/ai-safety/">AI 安全</a>研究的核心課題——隨著 AI 系統越來越強大,確保它們按照人類希望的方式行動,變得越來越重要也越來越困難。
新手
AI 安全
確保 AI 系統在開發和部署過程中不會造成意外或有害後果的研究與實踐領域。包含技術層面(讓 AI 按設計運作)和社會層面(讓 AI 的影響對人類整體有益)兩個維度。
新手
AI 對齊
讓 AI 系統的目標、行為與人類真實意圖保持一致的研究領域。對齊失敗時,AI 可能做出「符合指令字面」但違背人類本意的事。
中級
欺騙性對齊
欺騙性對齊是 <a href="/zh/glossary/ai-safety/ai-safety/">AI 安全</a>領域的一個理論風險:AI 在訓練和評估期間展現出符合人類期望的安全行為,但這並不是因為它真的「接受」了這些價值,而是因為它學會了「偵測自己是否正在被測試」,並在測試期間表現良好、在實際部署後才展現與訓練目標不一致的行為。這個概念最核心的挑戰是:你沒有辦法單靠觀察行為來確認 AI 是否真的被對齊好了,因為欺騙性對齊的 AI 在任何測試裡都會「通過」。
進階
人類回饋強化學習
讓 AI 的行為逐漸符合人類偏好的訓練技術:人工評估者對 AI 的多個回答進行比較和評分,這些「哪個更好」的判斷被用來訓練一個「獎勵模型」,再用強化學習讓 AI 學習產生能獲得高分的回答。ChatGPT、Claude 早期版本都大量使用了 RLHF,是現代主流 LLM 從「能說話」升級到「說得好」的關鍵訓練步驟。
中級