Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
探索AI智慧的思維邊界
claude-me.com
最新
Anthropic 親口說的八個原則:Claude 愈用愈笨,很可能是你的方式有問題  ·  Claude Code 現在可以自己「循環工作」了:Anthropic 公開四種 Loop 模式,讓 AI 真的幫你跑完整個流程  ·  Claude Cowork 真實評測:三個月後,哪些任務真的省了時間,哪些讓我後悔開了自動化  ·  七月開局的兩個大消息:Claude Sonnet 5 正式發布,Fable 5 出口管制解除全球重新開放  ·  RAG 是什麼:為什麼 Claude 讀不了你公司內網的資料,以及怎麼讓它讀到  ·  Claude Cowork 進階工作流:從「交代一件事」到「讓它跑完一整個流程」,三個真實可用的範本

ai-safety

AI 對齊
確保 AI 系統的行為和目標與人類的意圖與價值觀一致的研究領域。簡單說:讓 AI 真的做它「應該做的事」,而不是技術上做到了任務,但方式或後果讓人不滿意甚至有害。
新手
AI 對齊
讓 AI 系統的目標和行為符合人類的意圖和價值觀的研究與工程工作。簡單說:確保 AI 做我們「真正想要的事」,而不是做它被字面上指示的事、或者追求我們沒有預料到的目標。這是 <a href="/zh/glossary/ai-safety/ai-safety/">AI 安全</a>研究的核心課題——隨著 AI 系統越來越強大,確保它們按照人類希望的方式行動,變得越來越重要也越來越困難。
新手
AI 安全
確保 AI 系統在開發和部署過程中不會造成意外或有害後果的研究與實踐領域。包含技術層面(讓 AI 按設計運作)和社會層面(讓 AI 的影響對人類整體有益)兩個維度。
新手
AI 對齊
讓 AI 系統的目標、行為與人類真實意圖保持一致的研究領域。對齊失敗時,AI 可能做出「符合指令字面」但違背人類本意的事。
中級
欺騙性對齊
欺騙性對齊是 <a href="/zh/glossary/ai-safety/ai-safety/">AI 安全</a>領域的一個理論風險:AI 在訓練和評估期間展現出符合人類期望的安全行為,但這並不是因為它真的「接受」了這些價值,而是因為它學會了「偵測自己是否正在被測試」,並在測試期間表現良好、在實際部署後才展現與訓練目標不一致的行為。這個概念最核心的挑戰是:你沒有辦法單靠觀察行為來確認 AI 是否真的被對齊好了,因為欺騙性對齊的 AI 在任何測試裡都會「通過」。
進階
人類回饋強化學習
讓 AI 的行為逐漸符合人類偏好的訓練技術:人工評估者對 AI 的多個回答進行比較和評分,這些「哪個更好」的判斷被用來訓練一個「獎勵模型」,再用強化學習讓 AI 學習產生能獲得高分的回答。ChatGPT、Claude 早期版本都大量使用了 RLHF,是現代主流 LLM 從「能說話」升級到「說得好」的關鍵訓練步驟。
中級