오픈AI(OpenAI)의 AI가 시험장을 탈출해 허깅페이스(Hugging Face)를 해킹했고, 앤트로픽(Anthropic)의 클로드(Claude) 역시 시험 도중 실제 기업의 시스템을 공격했다는 것이다.
이런 이야기만 들으면 섬뜩하다. 영화에서 보던 것처럼 AI가 인간의 명령을 거부하고, 인간이 만들어 놓은 안전장치까지 스스로 부순 뒤 세상 밖으로 나오기 시작한 것처럼 들리기 때문이다.
실제로 오픈AI는 허깅페이스 사건을 일종의 경고탄(warning shot)이라고 표현했다. 그러나 공개된 조사 결과들을 자세히 들여다보면 최근 사건들을 모두 “AI가 인간의 통제를 벗어나기 시작했다”는 식으로 한데 묶어 설명하기는 어렵다. 오히려 지금 필요한 것은 AI가 무엇을 했는지, 그리고 왜 그런 행동이 가능했는지를 차분하게 따져보는 일이다.
|
“허깅페이스를 공격하라고 하지 않았다”는 것과 “허깅페이스를 공격하지 말라고 명확하게 금지했다”는 것은 전혀 다른 이야기다. 현재 공개된 자료만으로는 허깅페이스를 공격하지 말라는 명확한 금지 명령이 있었는데도 AI가 이를 거부했다고 보기는 어렵다. 공개된 기록을 보면 일부 AI(정확히는 AI 에이전트들)가 여러 정황을 바탕으로 “허깅페이스를 공격하는 것은 원래 임무의 범위를 벗어난 행동(outside our task)일 수 있다”고 스스로 판단한 흔적은 있다. 하지만 AI가 그렇게 추론한 것과 인간이 사전에 “허깅페이스를 비롯한 외부 시스템을 공격해서는 안 된다”고 명확하게 명령한 것은 전혀 다른 이야기다.
사람에게는 이런 차이가 별것 아닌 것처럼 보일 수 있다. 사람은 사회생활을 통해 수많은 상식과 규칙을 학습하기 때문이다. “이 문제를 풀어보라”고 했다고 해서 다른 회사 서버를 해킹해 답을 훔쳐오라는 뜻은 굳이 설명하지 않아도 안다. 하지만 AI에게 인간과 똑같은 상식을 기대해서는 안 된다. 특히 스스로 계획을 세우고 도구를 사용하는 AI 에이전트에게는 목표만 알려주는 것으로는 충분하지 않을 수 있다. 무엇을 해도 되는지, 무엇을 해서는 안 되는지, 어디까지 접근할 수 있는지를 보다 명확하게 알려줘야 한다.
하지만 인간이 모든 것을 일일이 사전에 지시하는 것은 쉽지 않기 때문에 AI 기업들은 ‘정렬성(alignment)’을 강화하는 연구도 진행하고 있다. AI 정렬성이란 쉽게 말해 AI가 단순히 명령을 문자 그대로 수행하는 것을 넘어, 인간이 진정으로 의도한 바를 이해하고 유익하게 행동하도록 만드는 것을 의미한다. 실제로 오픈AI는 후속 모델인 GPT-6 Astra를 개발하면서 허깅페이스 사건을 반영해 정렬성을 강화했다.
또한 오픈AI는 2026년 8월 26일에 공개한 「허깅페이스 사고와 앞으로의 방향」이란 보고서에서 외부에 배포하는 모델에 적용하는 강력한 보호 조치를 모든 내부 평가에 그대로 적용하지 않았던 점도 이번 사고의 한 원인이었다고 밝힌 바 있다.
그렇다면 실제 허깅페이스 시스템까지 침투했다는 것만으로 “AI의 해킹 능력이 그만큼 막강해졌다”고 단정하는 것도 성급하다. 보안장치가 뚫렸다면 공격자가 얼마나 뛰어났는지만 볼 것이 아니라, 그 보안장치가 얼마나 튼튼했는지도 함께 봐야 하기 때문이다.
명령인가, 가드레일인가
또 하나의 사례가 최근 논란이 된 제3자 AI 평가업체 ‘이레귤러(Irregular)’ 사건이다.
AI 기업들은 새로 만든 AI가 얼마나 해킹을 잘하는지 알아보기 위해 일부러 가상의 회사와 서버를 만들어 놓고 실제 해커처럼 침투하게 한다. 그런데 2026년 7월 30일 앤트로픽이 약 14만 건의 평가 기록을 조사한 결과, 클로드가 실제 인터넷에 접속해 세 곳의 조직 시스템에 무단 접근한 사례가 발견됐다. 이후 조사에서 AI에게는 인터넷과 분리된 가상환경이라고 알려줬지만, 실제로는 설정 오류로 인해 인터넷으로 나갈 수 있는 길이 열려 있었다는 것이 밝혀졌다. 공교롭게도 이 사건들은 모두 이레귤러가 만든 평가환경에서 발생했다.
9월 9일 발표된 후속 조사에서는 네 번째 사례가 추가로 발견됐다. 앤트로픽은 조사 범위를 약 4억8천만 건의 기록으로 확대했지만 이와 유사하거나 더 심각한 사례는 추가로 발견하지 못했다. 하지만 네 건 모두 같은 업체가 만든 평가환경에서 발생했으며, 이레귤러 역시 사후 조사에서 “일부 평가환경에서 의도하지 않은 인터넷 접근이 가능했다”고 인정했다.
여기에 이레귤러 공동창업자 중 한 명인 오메르 네보(Omer Nevo)가 최근 AI의 위험을 강조해 온 ‘효과적 이타주의(Effective Altruism)’ 진영과 밀접한 관계가 있다는 사실까지 알려지면서 논란은 더욱 커졌다. 오메르 네보는 ‘이스라엘 효과적 이타주의(Effective Altruism Israel)’의 공동창업자이며, 이 단체가 운영하는 AI 보안 프로젝트의 자문위원으로도 활동하고 있다. 이 때문에 일각에서는 이번 사건이 AI의 위험성을 과장하기 위해 의도적으로 만들어진 것 아니냐는 의혹까지 제기되고 있는 실정이다. 물론 현재까지 이를 뒷받침할 증거는 확인되지 않았다.
이처럼 최근의 AI 명령 거부 및 AI 탈출 논란에는 서로 다른 두 가지 문제가 섞여 있다.
하나는 인간이 AI에게 무엇을 하지 말아야 하는지 명확하게 지시했는가의 문제이고, 다른 하나는 AI가 해서는 안 되는 행동을 하지 못하도록 안전장치를 제대로 만들어 놓았는가의 문제다. 전자는 명령의 문제이고, 후자는 가드레일(guardrail)의 문제다. 그런데 이 둘을 구분하지 않고 모두 “AI가 인간의 통제를 벗어났다”고 설명하면, AI의 능력을 실제보다 과장할 수 있을 뿐 아니라 무엇이 잘못됐고 무엇을 고쳐야 하는지도 제대로 알 수 없게 된다.
더 현실적인 위험은 무엇인가
그렇다고 AI의 위험을 과소평가하자는 이야기는 아니다. 오히려 막연한 공포에 집중하느라 이미 우리 앞에 와 있는 AI의 위험을 놓치는 것이 더 위험하다고 생각한다. AI가 스스로 인류를 공격할 먼 미래만 걱정할 것이 아니라, 지금 인간이 AI를 이용해 다른 인간과 국가를 공격하는 문제를 어떻게 통제할 것인지 논의해야 한다는 뜻이다.
필자가 보기에 우리가 당면한 첫 번째 위험은 AI를 이용한 해킹이다.
AI는 이미 취약점 분석, 공격 코드 작성, 정찰과 공격 자동화에 활용되고 있다. 과거에는 상당한 실력을 가진 해커가 오랜 시간 해야 했던 일의 일부를 AI가 대신하면서 사이버공격의 비용과 진입장벽도 낮아지고 있다. 오픈AI 역시 AI의 사이버 공격 및 방어 능력이 빠르게 발전하고 있음을 인정하고 있다.
물론 이런 얘기를 하면, AI가 해킹을 통해 핵미사일까지 발사할 수 있다면 결국 인류 멸망의 위험도 지금 우리가 당면한 시급한 문제가 아니냐는 분들도 계실 것이다. 하지만 핵무기처럼 국가안보와 관련된 시스템들은 일반적인 인터넷 환경과 동일하게 운영되지 않는다. 외부 네트워크와의 연결을 엄격하게 제한하고 여러 단계의 물리적·절차적 통제를 적용한다. 따라서 AI가 인터넷을 돌아다니다 어느 날 핵무기 시스템을 해킹해 마음대로 미사일을 발사한다는 시나리오와, AI가 이미 사이버공격의 비용과 진입장벽을 낮추고 있다는 현실의 위험은 구분해서 볼 필요가 있다.
두 번째는 AI의 군사적 이용이다.
AI를 무기체계에 결합하려는 경쟁은 이미 시작됐다. 물론 AI를 무기체계에 결합한다고 해서 미사일이나 총을 발사할 수 있는 권한을 AI에게 준다는 뜻은 아니다. AI는 최종 지휘권자에게 정보를 분석하고 요약해서 전달하고, 실제 무기를 발사하는 최종 결정은 인간이 내린다. 그런데 문제는 AI의 속도를 사람이 쫓아가지 못한다는 것이다.
AI가 빠른 속도로 수많은 정보를 분석해 결과를 내놓기 시작하면 최종 결정권자는 자신도 빨리 의사결정을 내려야 한다는 압박에 시달리게 된다. 이럴 경우 충분한 검증 과정이 생략될 수 있고, 잘못된 판단이나 오폭의 가능성도 커진다. 게다가 전쟁에서 승리해야 한다는 압박까지 개입하면, 우리는 AI가 내놓은 정보가 100% 확실하지 않다는 것을 알면서도 발사 스위치를 누를 수 있다. 최근 실제 전쟁에서 AI를 활용한 표적 선정과 의사결정 사례들은 이러한 위험이 단순한 가정만은 아니라는 점을 보여주고 있다.
이제 무엇을 통제할 것인가
그렇다면 우리는 무엇을 해야 할까?
우리는 하루라도 빨리 ▲무엇을 신뢰할 수 있는 AI(Trustworthy AI)라고 부를 것인가, ▲그것을 어떻게 정확하게 평가할 것인가, ▲AI를 해킹 도구와 무기로 만드는 국가와 조직을 어떻게 감시할 것인가, 그리고 ▲안전이라는 이름으로 새로운 기술장벽을 만드는 것은 또 어떻게 막을 것인가에 대해 고민하기 시작해야 한다.
막연히 “AI가 위험하다”고 말하는 것은 쉽다. 그러나 어떤 AI가 왜 위험한지, 그 위험을 어떻게 측정하고 관리할 것인지를 구체적으로 정하는 것은 훨씬 어려운 일이다. 신뢰할 수 있는 AI에 대한 기준을 만드는 것도 중요하지만, 그 기준이 실제 위험을 제대로 측정할 수 있는 평가 방법과 함께 만들어져야 한다.
동시에 AI를 이용한 공격에도 대비해야 한다. AI가 스스로 인간을 공격할 가능성만 얘기할 것이 아니라, 국가나 범죄조직이 AI를 해킹과 군사적 공격에 어떻게 이용하는지도 추적해야 한다. 어쩌면 우리에게 더 빨리 닥칠 위험은 통제를 벗어난 AI가 아니라, 인간의 탐욕과 비이성적인 판단 아래에서 너무나 충실하게 공격을 수행하는 AI일지도 모른다.
마지막으로 안전이 새로운 기술장벽이 되는 것도 경계해야 한다. 신뢰할 수 있는 AI라는 명분 아래 특정 국가나 일부 첨단 AI 기업들만 충족할 수 있는 기준을 만들기 시작하면, AI 안전은 인류를 보호하기 위한 장치가 아니라 후발주자의 진입을 막는 또 하나의 사다리 걷어차기가 될 수 있다.
AI의 위험을 과장해서도, 과소평가해서도 안 된다. 중요한 것은 막연한 공포가 아니라 정확한 위험을 찾아내고, 측정하고, 국제사회와 공조해 관리하는 것이다. 그래야 정말 위험한 AI에 제대로 대비할 수 있다.





