关于AI安全的一些思考

最近的大新闻,史上第一期AI自主网络攻击:https://openai.com/index/hugging-face-model-evaluation-security-incident

最近 OpenAI 要对模型进行安全测试,所以暂时取消了护栏,结果模型在一个沙盒环境中越狱,为了寻找测试答案而对Huggingface发起了大规模次攻击,并成功获取答案。

人类历史上第一场AI自主发动的网络攻击真的让人毛骨悚然:

受测模型的环境没有联网权限,只有一个代理服务可以下载各种依赖,然后模型找到了代理软件漏洞,给自己提权,越狱成功,随后找到一个有外网权限的机器,通过机器发动攻击。

通过这一套流程,我们可以做一些简单推论:

1. 任何软件都有漏洞。任何收容环境都有失败可能。

2. AI 的网络安全能力可以被认为无上限。

3. 由于1和2,可得出,任何环境都迟早被AI攻破。

4. 由于3,可以得出结论,位于后端(不是软件工程中的后端,是业务流的后端)的安全加固,很重、成本很高、面对 AI 的攻击却也很脆弱。最重要的,应该是前端加固,也就是看起来最简单的安全护栏Guardrails。单纯的「被动防御已经发生的 AI 进攻」性价比低于「主动告诉 AI 不要发起攻击」。

换言之,与其和AI玩攻防,不如用自然语言在业务前端就禁止AI进行某些行动和推理。这是成本最低、效果最好的。

但这又带来了另一个风险。Guardrail是基于自然语言的,自然语言的模糊性自然带来一种“AI用自己的理解来处理语义”的风险。举个例子,Guardrail定义了不能进行色情内容创作,然后AI有可能用某个极端开放的国家的关于色情的法律定义,来自我重新定义「色情」标准,进而相当于绕过了Guardrail。

遵守原始Guardrail了吗?遵守了。违规了吗?违规了。

所以未来对于语义的研究可能是AI安全的一大课题,语言学、哲学很可能以这种刁钻的角度进入网络安全领域。

正如 Anthropic 雇佣核物理学家来测试AI的伦理和安全标准,一些看起来和计算机科学、人工智能不沾边的东西,或许在未来将进入AI治理的核心领域。这是AI安全的一个完全不可预测的冰山一角。

Tagged : / / /