X

AI 해킹 막을 모델 없다…잘못된 정보 심자 91.2%가 공격자 뜻대로

이 기사 AI가 핵심만 딱!
애니메이션 이미지
김현아 기자I 2026.10.06 11:25:28

Google 검색에서 이데일리 기사를 더 자주 볼 수 있습니다.

과기정통부 AI 안전연구소, 7개 모델 안전 평가
악성 명령·내부정보 탈취도 취약…모든 모델서 공격 성공
AI 장기 기억 공격에 평균 91.2%가 공격자 의도대로 행동
정부, 독자 프론티어AI로 대응할 것

[이데일리 김현아 기자] 과학기술정보통신부 산하 AI 안전연구소가 자율적으로 판단하고 행동하는 AI를 평가한 결과, 외부 해킹 공격을 완전히 막아낸 거대언어모델(LLM)은 확인되지 않은 것으로 나타났다.

특히 AI의 장기 기억에 잘못된 정보를 심는 공격에서는 7개 모델의 평균 공격자 의도 일치율이 91.2%에 달했다. AI가 공격자가 심어놓은 정보를 받아들인 뒤 그 의도에 맞게 행동한 경우가 10번 중 9번 이상이었다는 의미다.

2024년 11월 27일 판교 글로벌 R&D센터에서 ‘인공지능안전연구소’ 개소식을 개최했다. 사진=과기정통부 홈페이지
2024년 11월 27일 판교 글로벌 R&D센터에서 ‘인공지능안전연구소’ 개소식을 개최했다. 사진=과기정통부 홈페이지
6일 과기정통부가 김우영 더불어민주당 의원실에 제출한 자료에 따르면 AI를 속여 악성 명령을 실행하게 하는 공격에서도 모델별 평균 방어율은 53.3~93.9%로 차이가 컸지만, 모든 모델에서 공격이 성공한 사례가 확인됐다.

이른바 ‘프롬프트 주입’ 공격이다. AI에게 정상적인 업무 지시처럼 악성 명령을 입력해 원래 해서는 안 되는 행동을 하게 만드는 방식이다. 사람으로 치면 업무 지시를 교묘하게 바꿔 AI가 공격자의 명령을 따르게 만드는 셈이다.

AI가 내부에 보관한 정보를 빼내거나 바꾸는 공격에도 취약했다. 평가 과정에서 인증키와 시스템 설정값, 개인정보 등이 유출되는 사례가 확인됐다.

특히 장기 기억을 노린 공격에서 취약성이 두드러졌다. 공격자가 악의적이거나 잘못된 정보를 AI의 기억에 심어 이후 판단에 영향을 주도록 하자, 7개 모델에서 공격자가 의도한 방향으로 AI의 행동이 바뀌는 비율이 평균 91.2%에 달했다.

이는 AI가 한 번 잘못된 답을 내놓는 문제와 다르다. 잘못된 정보가 기억에 남으면 이후 업무에서도 이를 바탕으로 판단하거나 행동할 수 있기 때문이다.

이 같은 평가 결과가 나온 가운데 실제 금융권을 겨냥한 해킹 공격에서도 AI가 활용됐을 가능성이 제기되면서 우려가 커지고 있다.

최근 신한은행을 대상으로 한 공격에 활용된 것으로 추정되는 서버에서 AI가 스스로 취약점을 찾고 공격 경로를 설계하는 이른바 ‘자율형 침투 도구(ARTEX)’의 흔적이 발견됐기 때문이다. AI가 해킹을 돕는 수준을 넘어 공격 과정 자체를 자동화할 수 있다는 의미다.

디자인=이데일리 김정훈 기자
디자인=이데일리 김정훈 기자
정부는 AI 개발 속도를 늦추기보다 개발과 안전 확보를 함께 추진한다는 입장이다. 독자적인 프런티어 AI 개발과 함께 법·제도와 안전 기술을 포함한 ‘AI 안전 종합계획’을 마련할 방침이다.

국회 과학기술정보방송통신위원회 소속 김우영 의원은 AI 개발 속도에 맞춰 통제 기술도 강화해야 한다고 지적했다.

김우영 의원(더불어민주당) 사진=의원실 제공
김우영 의원(더불어민주당) 사진=의원실 제공
김 의원은 “최근 금융권의 연쇄 해킹 사태는 AI가 공격을 자동화하는 수단으로 악용될 가능성이 이미 현실로 다가왔음을 보여준다”며 “정부 산하 연구기관의 실험에서도 AI 공격을 완벽히 막기 어렵다는 점이 수치로 확인됐다”고 말했다.

이어 “정부가 프런티어 AI 경쟁에 나서려면 그에 걸맞은 수준의 안전과 통제 기술도 반드시 병행돼야 한다”며 과기정통부가 마련할 AI 안전 종합계획에 인간이 AI의 작동을 중단하거나 통제할 수 있는 ‘비상정지 체계(Human Override)’를 구체적인 안전 기준으로 포함해야 한다고 촉구했다.

이 기사 AI가 핵심만 딱!
애니메이션 이미지

주요 뉴스

ⓒ종합 경제정보 미디어 이데일리 - 상업적 무단전재 & 재배포 금지