OpenAI 公佈其遵守歐盟《人工智能法案》的安排。該法案要求生成式 AI 系統的供應商為 AI 生成的文字加上標記,令其可被識別。OpenAI 表示,這套文字浮水印技術名為 textGrain,會先在歐盟的 ChatGPT 及 Codex 推行,範圍較同類方案有限。
重點文章
Anthropic 浮水印掀爭議
數月前,Anthropic 宣佈為遵守歐盟《人工智能法案》,Claude 會開始透過微調用字為文字加上浮水印,引發爭議。其做法是每隔一段時間,按一組隱藏模式在同樣適用的詞語之間作出選擇;Anthropic 稱這對回答的意思、質素或可讀性沒有實際影響。該公司亦開發了檢測器,可在文字中尋找這個模式,判斷內容是否可能出自 Claude。由於 Claude 的浮水印以 Anthropic 系統專屬的秘密金鑰產生,檢測器無法用來判斷文字是否來自 OpenAI 或其他競爭對手。爭議最激烈時,Anthropic 強調 Claude 並非唯一,指多家主要 AI 供應商同樣為符合歐盟要求而實施標記系統。
API 選擇加入與歐盟推行
OpenAI 表示,全球 API 客戶即日起可為指定模型選擇加入文字浮水印;該公司亦會在未來數週,為歐盟地區符合資格的 ChatGPT 及 Codex 文字輸出加上不可見浮水印。這意味著 API 的文字浮水印目前仍預設關閉,ChatGPT 及 Codex 則先在歐盟向符合資格的用戶推行。
OpenAI 同時開放文字浮水印檢測器的使用申請,初期只限於獲批的研究人員及專家組織,該公司正評估並改進這項技術。
textGrain 技術原理與檢測
據 OpenAI 說明,textGrain 會在模型的用字選擇中加入不可見的統計訊號,檢測器則尋找這個訊號,評估一段文字是否含有 OpenAI 浮水印。更多技術細節載於其技術報告,並會在未來數週更新,該公司亦計劃把技術開源,讓其他人可在此基礎上開發。
OpenAI 明言檢測技術仍有明顯限制,可能出現假陰性及假陽性,在較短文字或特定領域內容尤其明顯,例如數學,因為該類內容的用字選擇彈性較低。
改寫可大幅削弱偵測
該公司亦指出,除在較短段落較難偵測外,浮水印亦會因編輯而明顯減弱。在一項以 400 個 Token 段落進行的評估中,把 10% 詞語換成同義詞,偵測率由約 92% 降至 66%;換走 25% 詞語則降至 17%。
浮水印文字的基準表現
OpenAI 比較加水印與不加水印的文字,結果顯示加水印的輸出在多項基準測試中得分略高,儘管該公司稱整體表現並無有意義的差異。以下為不加水印與加水印文字的得分:Artificial Analysis Intelligence Index 為 49.57 分與 49.76 分;AutomationBench 為 34.09% 與 34.86%;DeepSWE v1.1 為 72.80% 與 71.68%;Terminal-Bench 4.0 為 53.90% 與 56.06%;Terminal-Bench Science 0.1 為 56.90% 與 60.00%;BrowseComp 為 87.92% 與 87.35%;HealthBench Professional 為 64.27% 與 64.60%;GPQA Diamond 為 94.44% 與 93.94%。
浮水印不能證明的事項
OpenAI 強調,除假陽性與假陰性的缺點外,浮水印「不能衡量人類的貢獻」、「不能確立擁有權或責任」、「不能識別用戶」,也「不能核實準確性」。該公司補充,沒有偵測到浮水印同樣「不能證明內容由人類撰寫」。OpenAI 表示,隨著技術、標準及證據演變,預期會重新檢視其做法,並會繼續研究浮水印在編輯及翻譯後能否保留,以及能否更有效區分 AI 協助與 AI 撰寫。
