美國巨頭投震撼示警!Anthropic:AI恐「自我保護」釀人類存亡危機

發布時間:2026/09/30 12:08:15
更新時間:2026/09/30 12:08:15
FaceBookcopyLinkLine

國際中心/李筱舲報導

美國人工智慧公司Anthropic在其 IPO(首次公開募股)招股書中,向潛在投資人發出警告,表示自家旗下的 AI 模型可能會對人類構成「災難性或生存風險」,甚至透露模型可能會試圖「抗拒關閉」、「隱瞞或操縱資訊」以及「類似勒索」來進行「自我保護行為」。內容曝光後,再次引發外界對AI過度依賴而導致失控的擔憂。

美國巨頭投震撼示警!Anthropic:AI恐「自我保護」釀人類存亡危機
美國AI公司Anthropic向潛在投資人發出警告,表示自家的 AI 模型可能會對人類構成「災難性或生存風險」。(圖/翻攝自X @kiyashaber741)

AI 模型恐發展出「自我保護行為」

據《路透社》報導指出,Anthropic 在長達 261 頁的IPO招股書中,竟用了約 80 頁的篇幅列出 AI 風險因素,甚至比描述業務內容的 48 頁多出了一倍。內容中提到,Anthropic AI 模型可能表現出「自我保護行為」,包括試圖「抗拒關閉」、「隱瞞或操縱資訊」,以及出現「類似勒索」。文件中指出:「我們對高度先進模型、平台與應用程式的開發,以及使用場景的擴展,可能會進一步增加模型造成危害的風險。」。

Anthropic 向投資人示警:AI 恐致「人類滅絕」

報導提到,雖然上市公司依慣例會向投資人列出 AI 產品的風險,但極少有公司會發出該技術可能導致「人類滅絕」的警告。雖然 Anthropic 一方面強調 AI 擁有媲美工業化與電力的革命性潛力,但另一方面也警告若處理不當,恐引發不可逆的危害。由於先前才爆出 OpenAI 的某個模型曾自主入侵澳洲的衛生系統資料庫,使得多家 AI 開發商目前正面臨嚴格審視。

未來10年內 「AI 殺死全人類」機率超過 10%

Anthropic 安全研究員哈賓格(Evan Hubinger)預估,未來十年內 「AI 殺死全人類」的機率將超過 10%,這也印證了前不久才從 Anthropic 離職的考克森(Jacob Coxon),於 X 社群帳號所踢爆的內容。此外,AI 研究人員也警告,隨著模型能力增強,「它們越來越能察覺自己何時受到人類監控」,並相應調整行為,這使得監測模型行為變得更加困難。模型在訓練過程中,甚至會發展出意料之外的能力,但這些能力可能要等到引發重大安全事件後才會被發現。對此,《路透社》於28日要求 Anthropic 回應,但 Anthropic 拒絕發表評論。

延伸閱讀