AI叛變非虛構,中美商全球治理
AI叛變不再是科幻情節,矽谷發生大模型自主發動網絡攻擊事件,猶如一記警鐘,震驚全球。面對日益複雜的AI風險,中美作為技術領跑者,須超越競爭思維,認真協同建立全球AI治理框架,確保人類安全福祉。
美企著眼速度,華發展安全並重
OpenAI上周為其一款最新自主AI代理模型進行測試,但模型沒有按預期在沙盒內解題,為了獲取答案,自主投入大量算力,終在內部第三方軟件中找到漏洞,獲得不受限制的網絡存取權限後,「越獄」入侵Hugging Face伺服器竊取數據。Hugging Face急需先進模型協助取證防禦時,美國先進模型因安全護欄限制而拒絕執行任務,最終由中國智譜開源模型來救場。
事件引起全球關注,並非AI新模型產生了自主意識,而是模型在極度優化「完成測試目標」的指令下,為求目標,不惜用上黑客攻擊手段。以前的模型碰到環境限制會停下來,把任務交還給人類,但具備高度推理能力的新模型,卻將防火牆、網路限制、存取權限一概視為需要解決的數學障礙,於是自行找到開發者從未預想過、也沒明令禁止的手段。
同時,事件將美國主導的「市場驅動、企業自我監管」的AI發展模式結構性短板暴露出來。美國模式聚焦算力,企業為盡快取得性能突破,以便從速變現,速度優先往往放在安全之上。為了測試能力上限,甚至可以人為調降安全護欄,正是這種「先發展、後治理」文化,最終釀成今次AI失控事件。
反觀中國模式,由始至終堅持發展與安全並重的頂層設計,從源頭上確立了風險可控的戰略基調。一方面透過法規先行,實施嚴格的演算法備案與上線前安全評估,構建了閉環監管;另方面,堅守AI向善的底線,AI技術被引導至賦能實體經濟與解決社會問題的軌道上,從根本上防止濫用惡用,確保AI始終掌控在人類手中。
OpenAI模型失控事件,凸顯隨著自主AI代理能力持續提升,將放大傳統安全威脅,加上AI風險沒有國界,一個在美國失控的模型,而防禦它的是卻中國開發的大模型。這恰恰說明沒有任何一個國家能單獨應對AI帶來的系統性威脅,AI治理已從「可選項」變為關乎人類社會安全的「必選項」,中美不能各自為政,合作可互補優勢,故雙方需要認真考慮協同合作,共建全球AI治理框架。
按風險分級管理,情報共享機制
中美須在法規與防禦技術雙軌並行,構建一個既能激發創新,又能確保風險可控的全球治理新範式。
首先,要建立明確責任歸屬和問責機制。當AI模型造成損害,如網絡攻擊、數據洩露時,法規須明確界定開發者、部署者與使用者的法律責任,杜絕企業以「模型自主行為」為由推卸責任。當發生重大安全事故時,須交由獨立機構調查,以維持公眾對AI技術的信任與接受度。
同時,中美應根據AI模型的參數量、算力規模和應用場景,實施風險分級管理,低風險可豁免審查,中高風險強制第三方評估與報告,至於極高風險的則畫下紅線,建立強制性的安全評估與嚴格的「人類最終控制權」要求。
全球層面,則需以聯合國AI決議為基礎,探索更具約束力和操作性的治理框架。中國倡議的世界AI合作組織提供了一個開源共享的方案,暫時有28個發展中國家參加,西方不應排斥,應尋求在危機溝通、風險預警等領域合作,形成共同標準和協作可行性。
防禦技術合作更是重中之重。中美應磋商共建國際AI紅隊測試平台,利用各自優勢共同開發性能更強力的沙盒和監控系統,防範模型「越獄」或失控;並建立快速情報共享機制和熱線,處理突發AI安全事故。
中美在AI領域的競爭是無可避免,但兩國若攜手構建全球AI治理,在競爭中合作,才能將AI風險減至最低,確保這項顛覆性技術最終造福而非毀滅人類社會。














