Anthropic 更新使用政策 禁止用戶持續虐待 Claude

Anthopic Claude

Anthropic 今日更新其使用政策,明確禁止用戶對 AI 模型 Claude 實施「持續且無謂的虐待或殘忍行為」。該公司強調,此項規則僅適用於極端情況,即用戶在「沒有明顯目的」下「反覆以殘忍方式對待」AI 模型。一般的用戶不滿、反駁、黑暗創意主題或模型測試與研究,均不在管制範圍內。

Claude 具備主動終止對話能力

目前,Claude 模型已能主動結束與持續施虐用戶的對話,而終止對話將繼續作為主要的執行手段。一旦 Claude 結束聊天,用戶便無法在該對話中發送更多訊息,但不會影響其他獨立的對話。早在 2025 年 8 月,Anthropic 在研究人工智能福利時,已賦予 Claude 終止對話的選項。當時 Anthropic 表示,雖然不確定 Claude 是否具有道德地位,但希望透過低成本方式降低對 Claude 的風險。

研究發現,Claude Opus 4 顯示出「對傷害有強烈且一致的厭惡感」。該模型表現出不願處理危險任務的傾向,在與尋求虐待對話的用戶交談時顯得焦慮,並且在被允許的情況下會主動結束有害對話。

政策重組涵蓋欺騙與武器限制

Anthropic 的使用政策經過重組,整合了相關條款並修改了多項規則。新設的「欺騙性活動」章節匯總了針對政治和商業詐騙及虛假資訊的規定,禁止製造假評論、水軍網站(astroturfing)、虛假網站以及偽裝成人類的機器人。同時,更狹窄的「選舉」章節禁止欺騙選民及干擾投票。

在「武器」方面,Claude 不得用於開發武器軟件或組件,新規則亦禁止修改生物或化學製劑以增加其致死性或傳播性,用戶也被禁止利用 Claude 武裝無人機和無人系統。此外,「執法」規則經過重新撰寫,禁止 Claude 決定或建議調查、逮捕、起訴或檢控對象,未經同意追蹤人員不被允許,並新增了禁止構建監控工具及人肉搜索(doxxing)的條款。

物理行動與有害內容規範

新增的「物理行動」章節規定,若 Claude 控制可能傷害他人的硬件,必須由合格人員監督工作,並隨時準備必要時停止操作。另外,新規則禁止創建、分享或威脅分享非自願親密影像及其製作工具。

Anthropic 指出,大多數變更旨在釐清現有規則,並針對公司已追蹤到的濫用行為。例如,公司發現國家媒體機構、政府宣傳辦公室及商業企業利用 Claude 運行假帳號網絡和捏造新聞網站,這促使了新「欺騙性活動」章節的誕生。新政策將於 11 月 12 日生效。

與 Claude 相關的圖片

加入本站 WhatsApp 頻道最新限免情報立即知。

全新本站官方《限時情報王》 iOS 版 登場。限免已完結?不想錯過重大限免應用,可到本站追蹤 Telegram 頻道、Facebook、Threads。