「獨立第三方評測機構」是AI安全之全局治理體系的核心——如何評測前沿模型並連接監管與司法
前沿 AI 模型集中在少數企業手中,開發者最了解模型,也負有設計和修補安全措施的首要責任。但由企業自行選擇測試題目、掌握原始資料,再由企業宣布「安全」,外界難以核對結論。主管機關可以制定規則,法院可以在損害發生後認定責任;兩者都需要有人把模型行為轉化成可查核的技術證據。本文的主張是:建立真正有能力、又能保持獨立的第三方評測機構,作為這條治理鏈的技術樞紐。
英國政府的 AI Knowledge Hub 草案甚至提醒公務使用者按任務選擇較小的模型、減少不必要的提示。這處理的是日常使用成本;前沿模型的安全問題,則必須把注意力移到誰能測試模型、誰能核對企業的安全主張。①
一、四方分權之中 第三方為何是關鍵樞紐
技術廠商負責建造和修補。它們掌握訓練、微調、部署與防護細節,應在發布前後持續內部測試,保存缺陷與修補紀錄。安全責任不能因委託外部測試而轉移。
第三方負責獨立驗證。評測者依事先確定的風險問題,進行極端情境測試、專家紅隊攻防和防護有效性檢驗;其任務是驗證或質疑企業的主張,並交代測試條件與不確定性。
主管機關負責設定底線和執法。它依適用法律決定資訊取得、風險控制和監督措施,把獨立評測成果與企業資料一起納入判斷。
法院負責處理具體爭議。發生損害時,法院按當事人主張與證據,審查模型缺陷、注意義務、因果關係及損害。第三方報告提供可質證的專業材料,責任仍由法院依法判定。
獨立評測的樞紐作用,具體表現在兩次轉譯:先把模型的能力與弱點轉成有方法、有邊界的測試結果;再讓監管者與法院看得懂結果能證明甚麼、不能證明甚麼。英國 AI Security Institute 指出,外部測試有助於獨立核對企業的安全主張,並為政府決策提供經驗證據。②
二、第三方測得動頂尖模型嗎
「造出模型」和「找出模型的失效方式」是兩種能力。評測機構不必複製開發者的訓練資料與整套巨型訓練集群,才能設計沙盒任務、測試越權行為、誘發防護漏洞,或比較不同部署條件下的表現。資安紅隊、領域專家、統計與模型工程人員可以共同設計這些實驗。
不過,「不用造模型」不等於「測試很容易」。只有公開聊天介面時,評測者看見的是部署後的產品,可能測不到被防護層遮蔽的能力。較深入的灰盒權限、可切換防護的版本、工具使用紀錄及與開發團隊的技術交流,能提高評測的辨識力;白盒權限是否必要,應依風險與商業秘密逐項決定,不能概括要求。
英國 AI Security Institute 的評測經驗具體提出:為辨識模型能力與防護效果,評測者可能需要比較不同防護配置、取得適當接口,並有足夠的發布前測試時窗。該機構同時強調,評測仍只是特定時點的風險快照,不能當成「絕對安全」的認證。③
因此,第三方的技術門檻不是能否再造一個頂尖模型,而是能否提出合理的風險假設、取得必要權限、設計可重複的測試,並如實報告沒有測到的範圍。
三、人才與算力的雙重獨立性悖論
人才悖論。熟悉前沿模型的人可能曾任職受評企業,或未來希望回到企業。這有助於評測深度,卻也使選題、測試範圍與報告措辭容易受到利益關係影響。問題不在於禁止人才流動,而在於讓關係可申報、可迴避、可覆核。
算力悖論。評測需要安全沙盒、模型訪問、測試預算和研究薪酬。若一切都由受評企業隨時提供或撤回,機構可能因擔心失去資源而縮小測試;若完全沒有這些資源,則只能做表層的公開接口測試。
這不是抽象的資源口號。英國 AI Security Institute 公開列明其研究人員、公共算力優先訪問、發布前模型訪問與研究資助。這一例子說明,外部評測要持續運作,人才、算力及受控模型訪問須有穩定的制度安排。④
四、讓技術實力與客觀公正共存的制度設計
建立獨立的公共評測能力。由政府或多方資金支持共用算力、安全沙盒、測試工具和具競爭力的人才待遇;重要資源不宜由單一受評企業決定。公共支持應附帶財務與治理透明,避免資助者直接指定有利結論。
築起利益衝突防火牆。揭露近期任職、顧問報酬、股權和資助關係;涉及原雇主模型時,依實際職務與關係程度迴避選題、執行或定稿。測試結論須由未涉利益者覆核,報告並記錄企業提出的異議及處理理由。
讓「破壞者」進入評測團隊。招募紅隊研究者、資安專家和具有前沿模型經驗的人員,在合法保密安排下進行對抗性測試。吹哨者提供的線索可成為選題依據,但仍須獨立驗證。
公開方法 接受同業檢驗。盡可能公開風險分類、方法、統計處理、主要結果及限制;對足以複製危險行為的提示、未修補漏洞與商業機密,提供受控審查渠道。開放工具與同業覆核可以降低評測者與企業串通「安全洗白」的空間。
英國 AI Security Institute 已開放 Inspect 評測框架,並分享評測工程方法;它同時指出,大規模評測還依賴執行不受信任程式碼的環境、模型調用稽核和算力。公開工具有助於複核,卻不能取代完整的基礎設施。⑤
五、評測報告如何進入監管與司法程序
一份能供外部使用的報告,至少應保留模型與防護版本、測試日期、訪問權限、任務與樣本、成功標準、原始紀錄、失敗案例、結果的不確定性,以及企業收到結果後的修補情況。公眾可見摘要可以遮蔽敏感細節,主管機關與有權調查者則應能在法律框架內核對完整材料。
美國 NIST 的 AI 風險管理框架要求測量流程可記錄、可重複,並指出獨立審查可減少內部偏差與利益衝突。這提供了把單次紅隊展示轉化為持續證據鏈的方法依據。⑥
在本文提出的制度中,主管機關利用報告決定是否要求整改、限制特定部署或繼續調查;法院則在具體案件中檢驗報告的相關性與證明力。兩者不能把評測分數機械地等同於法定責任。
歐盟《AI 法案》對具有系統性風險的通用 AI 模型規定提供者須評估與緩解風險、記錄並報告嚴重事件,說明制度可以把技術測試與提供者義務接起來。⑦
結論很明確:企業必須負責製造與修補,政府必須擁有規則與執法權,法院必須獨立裁判;但若缺少有能力、有權限、能保持客觀的第三方,安全主張便難以接受真正的外部檢驗。讓評測者取得必要人才與資源,同時受到利益衝突與方法公開機制約束,才是這套四方治理架構能否運作的關鍵。
注釋與參考資料
① 英國政府 AI Knowledge Hub,〈Using AI ethically and sustainably〉(草案;日常使用與資源選擇)。
② 英國 AI Security Institute,〈Early lessons from evaluating frontier AI systems〉(2024 年 10 月 24 日;外部評測的作用)。
③ 英國 AI Security Institute,〈Early lessons from evaluating frontier AI systems〉(模型訪問、評測時窗及評測限制)。
④ 英國 AI Security Institute,〈About〉(研究人員、算力、資助和模型訪問)。
⑤ 英國 AI Security Institute,〈Releasing AISI’s Engineering Playbook〉(開放評測方法及基礎設施)。
⑥ 美國國家標準與技術研究院,〈AI Risk Management Framework Core〉(Measure 功能,獨立審查與可重複測試)。
⑦ 歐盟執委會,〈General-Purpose AI Models in the AI Act – Questions & Answers〉(《AI 法案》第 55 條)。