mallo

왜 AI는 잘 학습시키는 것만으로는 부족하고, 따로 실시간 보안 레이어가 필요하다고 할까요?

요약 듣기

0:007:18

원문 보기www.aitimes.com
요약 보기

이 발표의 출발점은 AI가 그냥 답변만 하는 모델 단계에서, 스스로 도구를 쓰고 권한 안팎에서 행동할 수 있는 에이전트 단계로, 더 나아가 현실 기기와 연결되는 피지컬 AI 단계로 넘어가고 있다는 인식이에요. 그러면 위험도 같이 바뀌어요. 채팅창 안에서 끝나는 실수와, 차나 드론, 로봇처럼 현실에 닿는 실수는 무게가 다르기 때문이에요. 그래서 에임인텔리전스는 한 번 점검하고 끝나는 보안이 아니라, 계속 지켜보면서 바로 막는 보안층이 필요하다고 주장해요.

여기서 먼저 낯선 말부터 풀어보면, 기사 맥락에서 AI 에이전트는 단순히 말을 만들어내는 모델보다 한 걸음 더 나아가 실제 행동을 수행하는 쪽에 가까워 보여요. 기업 시스템에 연결돼 권한을 쓰거나 작업을 처리할 수 있다는 뜻으로 읽으면 이해가 쉬워요. 박 CTO는 이런 환경에서 기업의 관리 역량이 도입 속도를 따라가지 못한다고 봤어요. 특히 기업이 자기 조직 안에 어떤 AI가 얼마나 돌아가는지조차 다 파악하지 못하는, 이른바 '그림자 AI 에이전트' 문제가 크다고 말해요. 회사 건물 열쇠를 누가 몇 개 가지고 있는지 목록이 없다고 생각해보면 돼요. 문을 잘 잠그는 기술이 있어도, 열쇠의 존재 자체를 모르면 통제가 비어버리죠.

박 CTO가 근거로 든 수치도 이 문제를 뒷받침하는 방향으로 쓰였어요. 그는 클라우드시큐리티얼라이언스 통계를 인용해, 기업의 약 82%가 스스로 파악하지 못한 그림자 AI 에이전트를 갖고 있고, 절반 이상은 에이전트가 권한 범위를 벗어난 행동을 한 적이 있다고 답했다고 전했어요. 여기서 중요한 건 이 수치가 발표자가 인용한 자료라는 점이에요. 그렇다고 해도 발표의 논리는 분명해요. '무슨 AI가 돌아가는지 모른다'와 '권한 밖 행동이 일어난다'가 겹치면, 사고는 기술 부족 이전에 가시성 부족에서 시작된다는 거예요.

그래서 발표는 전통적인 점검 방식의 한계를 짚어요. 체크리스트 기반 검증이나, 입력과 출력만 보는 단순 통제로는 더 이상 충분하지 않다는 거예요. 이유는 연결 구조가 자주 바뀌기 때문이라고 해요. 기사에 나온 MCP나 모델 API 같은 표현은 정확한 세부 정의까지는 원문만으로 알기 어렵지만, 적어도 AI가 다른 도구나 환경과 맞물리는 접점 정도로 이해하면 맥락이 잡혀요. 이 접점이 하나만 바뀌어도 위험 구조 전체가 달라질 수 있으니, 출시 전에 한 번 검사하는 방식이 아니라 운영 중에도 계속 취약점을 찾고 바로 방어해야 한다는 주장으로 이어져요. 비유하자면, 건물 설계도를 처음 한 번만 보고 안전하다고 끝내는 게 아니라, 실제로 배선과 출입문 구조가 바뀔 때마다 경보 장치도 함께 조정해야 한다는 이야기예요.

이 주장이 과장만은 아니라는 점을 보여주려고, 발표는 피지컬 AI에서 벌어질 수 있는 사례들을 들었어요. 자율주행 실험에서는 전체 픽셀의 0.8%에 불과한 미세 텍스트 삽입만으로 차량이 보행자를 치도록 유도했다고 했고, 드론이 역공격당해 추락하거나 오디오 공격만으로 홈 IoT 기기가 오작동하는 시나리오도 제시됐어요. 또 NASA와의 협업 과정에서 태양 탐사선 '파커'에 탑재된 AI의 취약점을 발견해 서비스를 일시 중단한 적이 있다고 소개됐고요. 이 사례들의 공통점은 작은 디지털 교란이 현실 세계의 큰 결과로 번질 수 있다는 거예요. 다만 기사에 나온 것은 발표자가 제시한 사례와 시나리오라는 점까지 함께 보고 받아들이는 게 맞아요.

발표의 또 다른 핵심은 '정렬'만으로는 부족하다는 말이에요. 여기서 정렬은 위협적 행동을 거부하도록 만드는 안전장치 정도로 이해하면 돼요. 많은 분이 '그럼 모델을 더 착하게, 더 안전하게 학습시키면 끝 아닌가?' 하고 떠올릴 수 있는데, 박 CTO는 그 생각에 선을 그어요. 최근 AGI급으로 평가받는 오픈AI의 '아스트라'조차 정렬만으로 완전히 통제되지는 않는다고 지적했어요. 즉, 모델의 성향을 미리 잘 맞춰두는 것과, 실제 운영 중에 무슨 일이 벌어지는지 감시하고 개입하는 것은 다른 문제라는 뜻이에요. 자율주행차에 비유하면, 운전자를 조심스럽게 교육하는 것만으로는 부족하고 주행 중 이상 상황을 잡아내는 센서와 제동 장치가 따로 필요한 셈이에요.

이 문제의식에 맞춰 에임인텔리전스가 내놓는 해법은 두 층으로 나뉘어요. 하나는 스팅어라는 레드팀 솔루션이고, 다른 하나는 스타포트라는 가드레일 플랫폼이에요. 스팅어는 멀티모달 공격을 실제로 시도해 보면서 모델과 에이전트의 약한 지점을 먼저 찾아내는 역할로 설명돼요. 쉽게 말해 일부러 흔들어 보며 어디가 무너지는지 보는 스트레스 테스트에 가깝죠. 그다음 스타포트가 환경별로 맞춤형 가드레일을 배치해 실시간으로 공격을 막는 구조예요. 진단과 방어를 따로 떼지 않고 이어 붙인 셈이에요. 기사에는 현재까지 스팅어가 160개 이상의 AI 모델을 진단했고, 스타포트는 10만 개가 넘는 AI 에이전트에 적용됐다고 소개돼요. 이 수치는 회사 측 설명으로 제시된 운영 현황으로 이해하면 돼요.

회사가 여기서 멈추지 않고 피지컬 AI 쪽 생태계를 넓히려는 이유도 같은 맥락이에요. 기사에 따르면 국내외 20여 개 기관과 컨소시엄을 만들었고, LG전자 로봇 '클로이' 전용 가드레일 개발, 해킹 에이전트가 스스로를 공격해 무력화되는 벤치마크와 테스트 환경 구축도 추진 중이라고 해요. 이 대목이 뜻하는 바는, 피지컬 AI 보안이 범용 원칙만으로 끝나지 않고 기기별·환경별 검증이 필요하다는 쪽에 가까워요. 로봇마다 움직임도 다르고 연결되는 센서나 명령 체계도 다를 수 있으니, 실제 현장에 가까운 시험장이 필요하다는 논리예요. 다만 이 부분은 이미 완료된 성과라기보다 추진 중인 계획과 확장 방향으로 읽어야 해요.

그럼 기업은 어디서부터 시작해야 하느냐는 질문에 대해, 박 CTO는 의외로 기본적인 답을 줘요. 먼저 자기 회사가 가진 AI 자산을 전수 조사하라는 거예요. 어떤 모델과 에이전트가 어디에 붙어 있는지, 내부 데이터가 어디로 흐르는지, 각 시스템이 어떤 권한을 갖는지, 위험이 생기면 어디서 번질 수 있는지를 보여주는 지도가 먼저 있어야 한다는 거죠. 앞에서 말한 그림자 AI 문제가 바로 이 출발점의 부재를 가리켜요. 아무리 좋은 방어 도구를 사더라도, 지킬 대상의 목록과 연결 관계가 흐리면 통제는 빈칸이 생길 수밖에 없어요. 다만 발표 전체 흐름을 보면 전수 조사가 끝이라고 말하는 건 아니고, 그 가시성을 바탕으로 지속 감시와 실시간 통제를 붙여야 한다는 것이 핵심이에요.