Claude in Chrome 正式版跟之前的試用版,最大的差別是什麼?
最大的差別是「誰來按確認」。試用階段的 Claude in Chrome,不管動作大小,每一步都需要你手動點頭才會執行,這代表操作起來雖然安全,但你必須全程盯著。正式版加入了安全分類器,會在動作執行前先自動審核這個動作是否符合你的原始要求,判斷合理就自動核准,不再需要你逐步確認——這代表你可以把一個多步驟的任務交出去,不需要每隔幾秒就回來點一次確認。
如果你偏好維持過去那種每一步都要親自核准的模式,這個自動核准的功能是可以在設定裡關閉的,不是強制的行為改變。
為什麼 Anthropic 要在這個時間點,把「自動核准」開放給正式版,而不是繼續維持試用版那種每步都要確認的做法?
最直接的原因是防護機制本身已經被驗證到足夠可靠的程度。從公告裡公布的數字可以看到,早期的評測已經被打到滿分(對 Fable 5、Opus 5、Sonnet 5 的攻擊成功率是 0%),Anthropic 因此決定換一套更嚴格、由專業紅隊設計的新評測繼續測試——而即使用了更嚴格的評測,從 Opus 4.8 之後,只要搭配探針跟安全分類器,對 Sonnet 5、Opus 5、Mythos 5 的攻擊成功率依然是 0%,對 Fable 5 也只有 0.3%。
換句話說,自動核准不是為了追求速度而犧牲安全性做的取捨,而是防護機制已經先被驗證到這個程度的信心,才決定把「每一步都要人工確認」這個限制放寬。這也解釋了為什麼公告裡會花這麼多篇幅講測試方法跟數字——這些數字本身就是「為什麼現在可以放寬」的直接論證。
三層防護(攻擊資料庫、探針、動作審核)實際運作起來,是怎麼互相配合的?
這三層在時間軸上剛好對應「訓練前、讀取當下、執行前」三個不同階段。攻擊資料庫是最底層、最早發生的一層——它不是在你使用當下才運作,而是持續累積已知的攻擊手法,並把這些手法用來訓練未來的模型,讓模型從一開始就對這類手法有免疫力。
探針則是在 Claude 讀取網頁內容的那一刻運作:Claude 透過工具呼叫讀取一個網頁或一封信的內容時,探針會先掃描這段內容,如果偵測到疑似注入攻擊的跡象,會提醒 Claude 對這段內容抱持懷疑,必要時主動跟你確認,而不是直接照著內容裡藏的指示做。
動作審核則是最後一層防線,發生在 Claude 已經決定要做某個動作、但還沒真正執行之前——分類器會比對這個即將執行的動作,跟你最初提出的要求是否吻合,如果不吻合就直接擋下。三層分別鎖住「模型本身有沒有識別能力」「內容進來時有沒有先篩一次」「動作真正發生前有沒有再確認一次」,任何一層被繞過,後面還有下一層接住。
看到「攻擊成功率 0.3%」或「17.6%」這樣的數字,一般使用者實際上該怎麼解讀,對我的日常使用有什麼影響?
先要理解這些數字測的是什麼:這是在「已經有紅隊人員刻意設計攻擊、而且攻擊真的接觸到模型」的前提下,計算出來的成功率——不是「你隨便瀏覽網頁,有 17.6% 的機率被攻擊」。日常使用中,你不太可能主動去踩一個經過專業紅隊精心設計的攻擊,這些數字反映的是「在最壞情況下,系統的底線在哪裡」,而不是你實際會遇到的機率。
對日常使用比較實際的意義是:0% 到 0.3% 這個範圍,代表在目前最新的模型(Sonnet 5、Opus 5、Mythos 5、Fable 5)搭配完整防護的情況下,即使遇到專業等級的攻擊,絕大多數情況都能被攔下來——但「絕大多數」不等於「保證」,Anthropic 自己也承認防護無法完全消除風險。實務上比較有用的做法,是照官方建議,先在你信任、熟悉的網站上使用,尤其是牽涉到轉帳、簽署合約、分享個資這類動作,保持一定的警覺,而不是因為看到低於 1% 的數字就完全放心不管。
Claude in Chrome 在 2026 年 8 月 26 日正式從試用版(pilot)升級為所有付費方案都能用的正式版本(generally available)。這不只是「開放範圍變大」這麼簡單——這次更新最大的變化,是 Claude 現在可以自主執行動作,不需要每一步都等你按確認,而 Anthropic 也在公告裡罕見地公布了具體的防護測試數字。如果你之前看過的教學還停留在試用階段的說明,這篇整理的是目前這個版本實際的運作方式。
過去的 Claude in Chrome,無論做什麼動作都需要你逐一確認。這次正式版最大的改變,是加入了一個安全分類器(safety classifier),會在 Claude 執行動作之前先審核——例如導向一個新網站、在頁面裡輸入文字——確認這個動作是否符合你最初的要求。如果分類器判斷動作合理,Claude 就會自動核准並執行,不再需要你每一步都手動點頭;如果動作跟你的要求對不上,則會被直接擋下。這套機制的運作方式跟 Claude Code 裡的自動模式(auto mode)相同。如果你不放心讓 Claude 自主判斷,這個功能可以在設定裡關閉,回到每一步都需要手動核准的模式。
Claude in Chrome 面對的核心風險是提示詞注入(prompt injection):惡意內容可能藏在網頁、電子郵件或表單欄位裡,想誘導 Claude 執行你沒有要求的動作——例如你請 Claude 幫忙回覆信件,某封信裡卻藏著指示,想讓 Claude 把你其他信件轉發給攻擊者。Anthropic 說明了三層防護怎麼疊加運作:第一層是持續擴充的攻擊資料庫,每當某個新攻擊手法成功騙過當時的模型,就會被收錄進資料庫,用來訓練後續模型辨識這類手法;第二層是「探針」(probes),在 Claude 真正根據網頁內容採取行動之前,先掃描這些內容裡有沒有疑似注入攻擊的跡象,一旦偵測到,Claude 會被提醒對這段內容抱持懷疑,必要時會先跟你確認再行動;第三層才是前面提到的動作審核機制,在動作真正執行前,用分類器比對這個動作是否符合你原本的請求。
公告裡罕見地公布了具體的評測結果。在早期的測試(從 Claude in Chrome 試用階段就開始使用的評測)裡,Claude Fable 5、Claude Opus 5、Claude Sonnet 5 面對測試攻擊的成功率是 0%——因為這個評測已經被打到滿分,Anthropic 決定將它淘汰,改用更強的攻擊(由專業紅隊人員設計)。在這個新的、更嚴格的評測裡,不加任何額外防護措施的情況下,攻擊對 Opus 4.8 的成功率是 17.6%,對 Opus 5 是 3.8%;如果套用 2025 年 11 月當時最強的防護,Opus 4.8 搭配探針的攻擊成功率是 16.7%。但從 Opus 4.8 之後的每一代模型,只要搭配探針跟安全分類器,對 Claude Sonnet 5、Claude Opus 5、Claude Mythos 5 的攻擊成功率是 0%,對 Fable 5 則是 0.3%。Anthropic 也提到,已經人工確認所有成功繞過防護的案例都屬於低風險情境,並持續在處理這些個案。
Claude in Chrome 目前對所有付費方案開放,需要從 Chrome 線上應用程式商店安裝。Enterprise 方案的管理員可以在組織設定裡管理開通範圍,並限制只能在核准過的網域上使用。要注意的是,Claude in Chrome 目前僅支援 Chrome 瀏覽器本身,還沒有支援其他 Chromium 核心的瀏覽器,也還沒有手機版本;如果你需要處理電腦裡的檔案或跨應用程式操作,還是要透過 Claude 桌面應用完成,Claude in Chrome 專注在瀏覽器內的網頁操作。