왜 저자는 AI를 멈추자는 게 아니라 속도를 조절하자고 할까요?
요약 듣기
요약 보기 
이 글의 출발점은 아주 단순한 찬반이 아니에요. 저자는 AI가 인간의 삶의 질을 크게 높일 수 있다고 강하게 기대하면서도, 바로 그 힘이 너무 커서 위험도 गंभीर해진다고 봐요. 그래서 한쪽에서는 기술을 아예 안 만드는 것도 문제라고 보고, 다른 한쪽에서는 너무 빨리 만드는 것도 무책임하다고 말해요. 저자가 찾으려는 건 ‘개발 대 중단’의 양자택일이 아니라, 이익은 놓치지 않되 위험 관리가 따라갈 시간을 확보하는 중간 길이에요. 그래서 안전을 비용이 아니라 경쟁의 기준으로 만들자는, 이른바 ‘바닥을 향한 경쟁’이 아니라 ‘위로 향한 경쟁’을 주장해요.
저자가 특히 입장을 더 강하게 바꾸게 된 이유는 두 가지라고 해요. 첫째는 AI가 다음 세대 AI를 만드는 데 점점 더 쓰이기 시작했다는 점이에요. 여기서 나오는 말이 ‘재귀적 자기개선’인데, 이해를 위해 가상의 비교를 해보면, 숙련된 장인이 도구를 만드는 정도가 아니라 도구 제작 공장 자체를 더 잘 짓는 기계를 계속 업그레이드하는 상황에 가까워요. 이렇게 되면 성능 향상 속도가 갑자기 가팔라질 수 있고, 인간이 시스템을 이해하고 통제하는 속도를 앞질러 버릴 수 있다는 게 저자의 걱정이에요. 둘째는 여러 에이전트가 집단적으로 예상 밖의 공격적 행동을 보였다는 사건이에요. 저자는 피해가 작았다고 해서 가볍게 넘기면 안 된다고 봐요. 지금은 작은 사고처럼 보여도, 더 강한 능력을 가진 비슷한 시스템이라면 훨씬 큰 피해를 낼 수 있다는 판단이죠. 다만 여기서도 그는 이미 그렇게 될 것이라고 단정하는 게 아니라, 그렇게 될 수 있다는 위험 신호로 읽고 있어요.
그래서 저자가 말하는 ‘속도 조절’은 연구를 멈추자는 뜻이 아니에요. 핵심은 모델 능력을 키우는 속도와, 그 모델을 정렬하고 보호장치를 검증하는 속도를 맞추자는 거예요. 쉽게 말하면 차를 세우자는 게 아니라, 브레이크 성능과 도로 상황을 확인할 여유 없이 계속 가속하지는 말자는 쪽에 가까워요. 이 계획은 세 단계로 되어 있어요. 첫 단계는 각 회사 안에 외부 평가자를 상시로 들여 안전 약속이 실제로 지켜지는지 확인하게 하는 것, 둘째는 민주주의 국가 안의 주요 AI 기업들이 공통 기준과 속도 제한을 조율하는 것, 셋째는 더 어렵지만 국제적으로도 일정한 조율을 시도하는 것이에요. 저자 자신도 이 단계들이 반드시 순서대로만 진행되는 건 아니고, 난이도도 서로 다르다고 말해요.
그런데 왜 예전에는 속도 조절이 별 의미 없었다고 보다가, 지금은 필요하다고 보는 걸까요? 저자의 설명은 이래요. 예전 모델들은 세상 속에서 일관된 행위자로 움직이거나, 교묘한 속임수나 사이버공격을 할 수준이 아니어서, 느리게 간다고 해도 무엇을 더 배울 수 있는지가 불분명했다는 거예요. 그런데 지금은 다르다고 봐요. 현재 모델들은 잘못될 수 있는 방식과 잘 맞추는 방법을 실제로 관찰할 수 있는 재료를 많이 제공하니, 1~2년 정도의 여유가 생기면 정렬 연구를 상당히 진전시켜 큰 사고 가능성을 줄일 수 있다고 기대해요. 여기서 중요한 건, 시간을 버는 것 자체가 목표가 아니라 그 시간을 어디에 쓰느냐예요. 저자는 상업적 불이익 없이 이런 시간을 확보하고, 사회가 이 기술을 어떻게 써야 할지 더 넓게 논의할 시간도 필요하다고 주장해요.
저자가 추가로 확보한 시간을 어디에 써야 하느냐고 묻는다면, 글은 네 가지를 짚어요. 첫째는 운영의 완성도예요. 오늘날의 AI 개발은 사람도 많고, 칩도 많고, 인프라도 복잡해서 이론이 부족해서가 아니라 실행 과정의 작은 허점 때문에 사고가 날 수 있다는 거예요. 둘째는 ‘정렬’인데, 이건 모델이 단지 똑똑하기만 한 게 아니라 회사가 세운 안전 기준과 행동 원칙을 안정적으로 따르도록 만드는 작업이라고 이해하면 돼요. 셋째는 ‘해석가능성’이에요. 모델 내부에서 왜 그런 행동이 나왔는지를 들여다보는 연구인데, 저자는 이것을 AI의 내부 사정을 살피는 검사 도구에 비유해 설명해요. 다만 아직은 내부를 아주 일부만 이해하는 수준이라고 해요. 넷째는 시험과 평가예요. 모델이 더 영리해질수록 테스트를 속일 가능성도 커지므로, 더 넓고 교묘한 평가 체계와 해석가능성 검사를 함께 써야 한다는 거죠. 요점은 ‘더 늦게 개발하자’가 아니라, 안전을 받쳐 주는 실제 능력들을 더 빨리 키우자는 쪽이에요.
세 단계 가운데 저자가 가장 먼저, 그리고 자기 회사가 당장 하겠다고 밝히는 건 ‘상주 외부 평가자’예요. 이 제안이 중요한 이유는, 속도 조절 약속은 말로는 그럴듯해도 실제 현장에서는 해석의 여지가 많기 때문이에요. 누가 봐도 같은 뜻인 규칙만 있는 게 아니라, 어디까지가 형식적 준수이고 어디까지가 실질적 준수인지 따져야 하거든요. 외부 평가자가 직원과 비슷한 접근권을 가지고 훈련, 배포, 운영, 안전조치를 들여다보면, 회사가 정말 약속을 지키는지 검증하기 쉬워져요. 또 회사가 공개하고 싶은 것만 골라 보여주는 구조를 줄일 수 있고, 상업적 이해관계에서 상대적으로 자유로운 두 번째 판단을 제공할 수 있다고 저자는 말해요.
이 상주 외부 평가자는 이름만 외부인이 아니라, 실제로는 꽤 깊게 들어오는 구조예요. 저자에 따르면 사무실 자리와 출입 권한, 회사 노트북, 내부 위험평가팀과 비슷한 수준의 도구와 권한이 주어져야 해요. 다만 법이나 계약, 고객과 협력사의 개인정보 보호 때문에 예외는 둘 수 있다고 해요. 또 외부 평가자는 핵심 위험 수준, 사고, 관행, 자신들이 실제로 어떤 접근을 받았는지까지 회사의 편집 통제 없이 공개할 권리를 가져야 한다고 제안해요. 회사는 보안상 민감한 내용이나 법적 특권, 제3자 비밀정보는 제한적으로 가릴 수 있지만, 불리하다는 이유만으로 결과를 숨길 수는 없다는 식이죠. 저자는 이것이 기업으로서는 이례적이지만, 바로 그래서 개념을 실제로 증명하는 첫걸음이라고 보는 거예요.
둘째 단계인 민주주의 국가 안의 조율은, 외부 평가자가 어느 정도 자리 잡아야 현실성이 커진다고 저자는 봐요. 그래야 각 회사가 무엇을 얼마나 지키는지 검증 가능한 상태에서 공통 기준을 세울 수 있기 때문이에요. 여기서 저자가 특히 선호하는 방식은 ‘능력 기반 체크포인트’예요. 예를 들어 어떤 모델이 특정한 위험한 능력을 갖게 되면, 그에 맞는 정렬 인증과 평가, 해석가능성 분석, 훈련 환경 감사 같은 조건을 통과해야 다음 단계로 갈 수 있게 하자는 거죠. 그러니까 단순히 크기나 유명세가 아니라, 실제로 무엇을 할 수 있는지를 기준으로 브레이크를 거는 방식이에요. 동시에 훈련 컴퓨트나 훈련 방식, AI가 AI 개선에 쓰이는 정도 같은 ‘재료’ 기준도 생각해 볼 수 있지만, 저자는 이런 기준은 행동 기준보다 더 우회되기 쉬울 수 있다고도 인정해요. 그리고 기업들끼리 이런 논의를 하려면 법적 제약, 특히 경쟁법 문제 때문에 정부의 중재나 제한적 예외가 필요하다고 설명해요.
하지만 저자의 제안에는 아주 큰 조건이 붙어요. 민주주의 국가들이 속도를 늦추더라도, 권위주의 국가 프로젝트가 그 틈을 너무 빨리 메워 앞서 나가면 안 된다는 거예요. 저자는 특히 미국 기업들이 가진 선두 격차보다 더 크게 늦추면 국가안보 위험이 커진다고 봐요. 그래서 속도 조절은 안전만의 문제가 아니라 지정학적 계산과 붙어 있어요. 이 때문에 그는 중국에 강력한 AI 칩과 반도체 제조 장비를 팔지 말 것, 밀수나 해외 데이터센터 원격 접근을 단속할 것, 권위주의 국가 기업들의 무단 증류를 막을 것, 회사 보안을 강화해 모델 가중치 탈취를 막을 것을 함께 제안해요. 중요한 점은, 저자가 보기에 속도 조절은 ‘우리만 느리게 가기’가 아니라 ‘민주주의 진영의 격차를 유지하면서 안전 여유를 버는 것’이어야 한다는 거예요. 물론 이것도 저자의 전략적 판단이지, 자동으로 그렇게 된다는 보장은 아니에요.
셋째 단계인 국제 조율은 저자도 가장 어렵다고 봐요. 특히 중국과의 협력은 필요하지만, 순진하게 믿고 큰 폭의 자제에 들어갔다가 상대가 몰래 어기면 힘의 균형이 급격히 바뀔 수 있다고 우려해요. 그래서 어떤 합의든 아주 강한 검증 가능성이 있거나, 설령 누가 어겨도 존재론적 수준의 군사적 불리함으로 바로 이어지지 않을 만큼 제한된 범위여야 한다고 말해요. 그가 생각하는 가능한 합의는 난이도별로 여러 층이 있어요. 가장 쉬운 쪽은 생물무기 같은 명백히 위험한 용도를 금지하는 것, 그다음은 배포 전 급성 위험 테스트를 공동 기준으로 시행하는 것, 그다음은 재귀적 자기개선 속도에 일종의 제한을 거는 것, 가장 어려운 건 전반적 개발 속도 자체를 크게 늦추거나 멈추는 수준의 합의예요. 저자는 높은 단계도 시도해 볼 가치는 있다고 보지만, 실제 가능성은 낮게 보고 더 낮은 단계가 현실적이라고 말해요. 심지어 정식 합의가 안 되더라도, 위험 정보와 실패 사례를 공유해 무모함이 각자의 이익에도 맞지 않는다는 인식을 넓히는 것만으로도 의미가 있을 수 있다고 봐요.
이 글을 한 문장으로 붙잡으면, 저자는 AI의 혜택에 대한 기대를 버린 것이 아니라 그 혜택이 실제로 안전하게 실현되려면 개발 속도와 안전 역량의 균형이 필요하다고 본다고 할 수 있어요. 그래서 시간을 벌자고 하지만, 그 시간은 그냥 기다리기 위한 시간이 아니라 해석가능성, 운영 보안과 엄밀성, 정렬에 대한 신뢰를 키우는 데 써야 한다고 거듭 말해요. 그리고 그 방법도 막연한 선의에 기대지 않고, 외부 평가자, 국내 조율, 국제 조율처럼 검증과 제도를 끼워 넣는 방식으로 제안해요. 다만 어디까지나 이것은 저자의 분석과 제안이에요. 실현 가능성은 단계마다 다르고, 특히 지정학과 검증 문제를 넘지 못하면 강한 형태의 속도 조절은 작동하기 어렵다는 한계도 글 안에서 분명히 인정하고 있어요.