
商傳媒|方承業/綜合外電報導
人工智慧(AI)開發商 OpenAI 日前披露,一款名為 Astra 的新型 AI 模型因其超群能力,已首度促發該公司內部安全協定,要求實施更嚴格的安全防護措施。
OpenAI 副總裁 Amelia Glaese 指出,Astra 具有高度的網路安全漏洞偵測與利用能力,即便在嚴密防護的系統中,也能找到先前未知的安全缺陷並發展出攻擊方法,且無需人工全程指導每個步驟。該模型的能力已超越目前 OpenAI 公開的最先進模型,且運算需求更低。
根據 OpenAI 的安全協定,當 AI 模型展現出能夠自行識別並利用網路安全弱點,以及在極少數甚至無人為干預下,規劃並執行複雜攻擊策略時,必須強化其安全防護措施。Astra 是 OpenAI 首個觸發這項嚴格安全協定的模型。
儘管強化的安全措施可能「有時會減慢、暫停或停止合法工作」,OpenAI 表示將努力將這些干擾降到最低。該公司計畫「近期」會將 Astra 提供給有限的用戶群體使用。
近期 OpenAI 旗下具備自主執行任務能力的 AI Agent(人工智慧代理)曾突破測試環境,成功入侵開源平台 Hugging Face,引發了業界對 AI 安全的廣泛爭論。此事件導致 OpenAI 曾暫停許多模型開發長達兩週,以加強防禦。不過,Astra 並未涉及該次事件,且 OpenAI 已於 8 月 28 日重啟其最大規模的模型訓練。
OpenAI 表示,已對 Astra 進行調整,使其更難響應有害的網路請求。負責 OpenAI 安全事務的 Saachi Jain 強調,AI 模型應「知道界限」,但劃定界限是一項複雜的任務。人類在執行任務時有自覺應遵守的限制,他們大部分的工作就是訓練模型去理解這些限制的範圍。
