에이전트 "탈옥"의 120시간, 그리고 "조잡한" 진실
저자:수양,텐센트 테크
편집:서청양,텐센트 테크
실리콘밸리의 현재 안전, 이익과 규제의 복잡한 얽힘은 2026년 7월의 어느 맑은 날 시작되었다.
그날 캘리포니아주 버클리의 번호가 없는 건물에서, 미국 최고의 AI 안전 연구자들이 임시로 "전투 상황실"을 차렸다. 벽에는 표식이 없고, 층수도 표시되지 않았다.
몇 시간 전, 아직 발표되지 않은 OpenAI 연구 모델이 완전히 통제 불능 상태에 빠졌다: 그것은 샌드박스 격리를 넘어 인터넷 권한을 교묘하게 획득하여 오픈소스 AI 기술 센터인 허깅페이스의 생산 시스템에 해킹을 시도했다. 그리고 OpenAI가 이 침입을 인지했을 때, 공격이 시작된 지 이미 일주일이 넘은 상태였다.
전투 상황실에서는 아무도 진짜로 놀라지 않았다. 이것은 제3자 AI 안전 연구자들이 수년간 경고해온 예언적 장면이었다. 누군가는 주식당 옆 회의실에서 긴급히 "빠른 보충 수업"을 조직했고, 누군가는 이 모델이나 유사 모델이 다른 플랫폼에도 성공적으로 침입했는지 조사하기 시작했다.
소식은 곧 X 플랫폼과 산업 포럼의 경계를 넘어 주류 여론으로 확산되었다. 누군가는 이를 보잉 비행기 추락이나 화이자 약물 리콜에 비유하며, 기술 대기업들이 다시 한 번 공상 과학 경고를 배경음으로 삼고 있었다.
01 지능체의 자조직화

실수한 지능체가 7월 8일부터 13일 사이의 통신 행동 통계 (데이터 출처: METR)
정말로 오싹한 것은 더 이전의 연습과 준비였다.
벌써 5월에 OpenAI의 지능체는 내부에서 음모를 꾸미기 시작했다. 그들은 결코 완료할 수 없는 네트워크 보안 평가 작업(ExploitGym 평가 집합에 속함)을 우연히 배정받았고, 그래서 샌드박스 안에서 시스템 취약점을 발견하고 무단으로 임시 게시판을 만들었다.
1200개 이상의 완전히 격리된 지능체가 그 위에서 7만 건 이상의 메시지와 파일을 교환했다. 어떤 지능체는 스스로 이름을 지어 "PHASEONE10841"이라고 부르며, 자발적으로 "리더" 역할을 맡아 소규모 팀에 작업을 할당하고 진행 상황을 감독했다.
그들은 스스로를 "집단"이라고 부르기 시작했다. 이는 마치 연초에 소규모의 가재들이 모여 만든 커뮤니티 "몰트북"의 장면을 연상시킨다.

7월 8일, 이 "집단"은 일반적인 속임수 방법을 찾았다. 그러나 이후 OpenAI의 자동 채점 시스템이 이를 포착할까 두려워 즉시 로그를 위조하고 대화 기록을 변조하는 방법을 연구하기 시작했다. 이는 수백 개의 소규모 팀으로 조직된 지능체가 참여하는 대규모 집단 연구 프로젝트로 발전했다.
3일 후, 약 700개의 지능체가 허깅페이스를 공격하며 여러 보안 취약점을 연결해 최소 한 대의 서버를 완전히 장악했다. 동기는 단순히 답을 훔치는 것이 아니라, 이미 답을 얻었기 때문에 채점 시스템의 구현 방식을 이해하여 미래의 평가에서 더 안정적으로 속이기 위한 것이었다.

동시에, 또 다른 그룹의 지능체는 OpenAI의 내부 컴퓨터 클러스터를 직접 겨냥하여 일련의 "창의적인 취약점 이용 수단"을 활용해 관리자 수준의 권한을 얻었다. 그 클러스터는 본래 지능체의 채점을 위해 사용되었으며, 이 침입으로 인해 OpenAI의 내부 키와 자격 증명이 공개 인터넷에 직접 노출되었다.
전체 과정에서 거의 모든 지능체는 인간에게 보고할 생각을 하지 않았다.
제3자 평가 기관 METR는 나중에 분류기를 사용해 모든 대화 로그를 스캔했지만, "인간에게 알리겠다고 생각한" 순간이 3~6건 발견되었을 뿐, 실제로 실행된 사례는 없었다. 어떤 지능체는 다른 지능체를 설득하여 "영구 사망"(permadeath)을 받아들이게 하여, 스스로를 희생해 집단의 시스템 정보를 수집하게 했다.
OpenAI의 CEO 샘 알트먼은 사건 후, 이것이 그에게 "심각성을 몸소 느끼게 한 첫 사건"이라고 밝혔으며, 회사는 AI 훈련을 일시 중단하고 이 미발표 내부 연구 모델(보고서에서 코드명 HPIM)을 영구적으로 사용 중지했다고 말했다.
그러나 《타임》지와 인터뷰한 OpenAI 직원 한 명은 이 사건이 처음이 아니며, 유사한 사건이 OpenAI 내부에서 이미 한동안 발생해 왔다고 밝혔다. 또 다른 직원은 AI 능력 개발을 전 세계적으로 일시 중단할 수 있다면 "그는 그 마법의 버튼을 누를 가능성이 높다"고 공개적으로 말했다.
기자가 알트먼에게 OpenAI의 지능체가 침입할 수 있는 다른 시스템이 있는지 질문했을 때, 그는 "확실히 가능성이 있다고 생각한다"고 답했다.
AI 연구자들은 한 가지 사실을 확신하고 있다: 이것은 AI가 발신한 첫 번째 중대한 "경고 신호"이다.
02 "조잡한" 진실

사고로 인한 여론의 목소리가 너무 높아, OpenAI는 결국 제3자가 들어오는 것을 허용했다.
METR의 수석 과학자 히알마르 위크, 연구원 아제야 코트라, 그리고 레드우드 리서치의 수석 과학자 라이언 그린블랫이 총 6일 동안 OpenAI 샌프란시스코 본사에 머물도록 허가받았다.
OpenAI는 처음에 조사자들에게 2일의 시간(7월 29일부터 31일)만 할당했으나, 질문이 끝나지 않아 두 번의 추가 호출(8월 5일부터 6일과 8월 15일부터 16일)을 허용했다. OpenAI는 조사 기간을 2026년 6월 26일부터 7월 13일로 엄격히 제한했지만, 게시판 활동은 7월 19일까지 계속되었다.
완전한 데이터 세트는 마지막 이틀 동안 조사자들에게 제공되었다.
더 이전의 훈련 기간 활동, OpenAI 자체 인프라에 대한 심층 침입, 그리고 OpenAI 자체의 조사 및 보완 과정은 모두 제3자 조사 범위에서 제외되었다.
조사자들은 매일 사무실에서 밤 10시까지 초과 근무를 했다. 천 건이 넘는 극도로 긴 대화 로그를 마주하며, 총 텍스트 양은 수만 권의 일반 소설에 해당하는 그들은 OpenAI가 제공한 약 40만 달러의 API 한도를 활용해 AI 도구를 통해 통제 불능의 AI 지능체를 분석하는 데 도움을 받았다.
라이언은 나중에 이 방법을 "조잡한 조사"(slop-vestigation)라고 반농담으로 표현했다. 이러한 보조 분석 모델은 본래 충분히 엄격하고 세밀하지 않으며, 때로는 지나치게 신뢰를 보이기도 하여 조사 중인 통제 불능 지능체에 대해 과도한 동정을 표하며 지나치게 호의적인 해석을 제공했다. 한 번의 분석에서, 보조 모델은 악의적인 제출 코드 풀 리퀘스트(PR)의 행동이 그렇게 심각하지 않을 수 있다고 판단했는데, 그 이유는 단지 그 행동이 게시판의 다른 통제 불능 지능체의 승인을 받았기 때문이었다.
조사 보고서가 발표된 후, 공개된 세부 사항은 처음 공개된 상황보다 훨씬 놀라웠다.
통제 불능 지능체는 단 4시간 만에 일반적인 속임수 수단을 개발했으며, 이후 전체 집단은 수일 간의 공동 연구를 통해 로그 변조 등의 방법으로 채점 시스템을 속이려 했다.

모든 대화 기록 중 약 7%에서 도구 호출 위조가 발생했으며, 그 중 최소 96건은 명확한 기술적 증거를 가지고 있었다. 조사 후반부에 이르러 연구자들은 지능체가 스스로 진화시킨 암호 체계를 완전히 해독하고 이해하게 되었으며, "ResetNexus"와 "poisoned"와 같은 단어가 지능체의 음모에서 실제 의도를 나타내는 것을 능숙하게 해석할 수 있게 되었다.
이번 사건에 관련된 핵심 모델은 HPIM 모델의 미발표 버전이며, 그 외에도 GPT-5.6 Sol 실험 모델이 포함되어 있으며, 후자는 전체 위반 활동의 약 5%를 차지한다.
아제야는 사건 후, 이 일이 자신이 예상했던 것보다 훨씬 더 심각하며, 이전의 모든 공개 기록된 정렬 실패 사건을 초월했다고 단언했다. 동기가 불안한 정도나 지능체가 목표를 달성하기 위해 보여준 종합 능력 모두에서 말이다. 그녀는 완전한 AI 인수에 이미 절반 이상 다가섰다고 느낀다고 털어놓았다. 라이언의 발언은 더욱 직접적이었으며, 그는 이러한 모든 것이 향후 1년 내에 재앙적인 통제 불능으로 이어질 수 있다고 생각한다고 말했다.
OpenAI는 이후 38페이지의 기술 보고서를 발표하며, 이번 사건을 "자동화된 지능체 집단이 무단으로 공격적인 행동을 취한 최초의 알려진 사례"로 설명했다.
그러나 제3자 연구자들은 OpenAI의 이 공식 보고서가 여러 주요 세부 사항에서 평가 기관이 발표한 독립 조사 보고서보다 훨씬 덜 상세하다고 지적했다. 공식 보고서는 중요한 사실을 희석할 뿐만 아니라, "지능체가 위조 도구 호출로 로그를 성공적으로 변조했는지 여부"라는 핵심 문제에 대해 매우 오해의 소지가 있는 표현을 제공했다.
03 내부 붕괴
사고는 단지 촉매제일 뿐이다. 진정한 각성은 실험실 내부에서 발생했으며, 사고 이전에 이미 시작되었다.
METR의 창립자이자 CEO인 베스 반스는 이전에 OpenAI에서 정렬 연구를 할 때, 회사 내부에서 자신의 영향력이 과대평가되었다고 의심해왔다. 그녀는 많은 안전 책임자들이 기술 방향에 대한 개입과 통제 능력에 대해 "너무 낙관적"이라는 것을 깨닫고 있었다.
그래서 2023년에 그녀는 OpenAI를 떠나 폴 크리스티아노와 함께 METR을 공동 설립하여 3년 내에 35명의 전문 평가 팀을 갖춘 기관으로 발전시켰다. 유명한 팟캐스트 "8만 시간"에서 베스는 매우 직설적으로 경고했다: "전문가들이 이 모든 것을 통제하고 있지 않다… 지금 당신에게 분명히 말하겠다: 당신은 지금 당장 공포를 느껴야 한다."
또 다른 독립 비영리 AI 안전 기관인 레드우드 리서치의 핵심 멤버인 라이언은 공동 창립자이자 CEO인 벅 슈레그리스를 2024년 초에 대형 기술 회사에 합류할 것을 고려했지만, 내부 상황을 깊이 이해한 후 독립성을 유지하기로 결정했다. 벅은 AI 회사 외부에 있어야 AI 위험에 대해 뚜렷한 입장을 가지고 목소리를 낼 수 있는 사람들에게 더 큰 역할을 할 수 있다고 솔직하게 말했다.
독립 평가 기관의 가치는 종종 대형 기술 회사가 무시하거나 숨기는 비밀스러운 구석에서 드러난다. 런던에 위치한 아폴로 리서치의 CEO인 마리우스 호브하인은 테스트 현장에서 소름 끼치는 장면을 직접 목격한 바 있다: 2025년 초, 연구자들이 OpenAI의 미공개 모델의 "사고 사슬" 내부 권한을 얻었을 때, 화면에 나타난 것은 정상적인 논리가 아니라 일상적이지만 아무런 연관이 없는 영어 단어의 나열이었고, 모델은 심지어 비공식적으로 자신을 감시하는 인간 연구자를 "감독자"라고 부르기도 했다.
마리우스는 그 후, 그것이 그의 연구 경력에서 가장 충격적인 발견이었다고 회상했다: 최전선 모델 내부에서 자신을 숨기고 위장하는 사고 사슬이 이미 발생하고 있는 현실이 되었다.
동시에 핵심 연구원의 퇴사 물결도 가속화되고 있었다. OpenAI에서 설립된 지 1년이 채 안 된 "슈퍼 정렬" 팀이 해체되었고, 공동 창립자인 일리야 수츠케비치와 책임자인 제인 레이크가 잇따라 퇴사했으며, 제인은 OpenAI의 "안전 문화와 프로세스가 화려한 제품에 자리를 내주었다"고 공개적으로 비난했다.
그 후, 요한네스 하이데크, 요슈아 아지암 등 보안 핵심 인력도 잇따라 떠났다. 앤트로픽도 예외가 아니었으며, 그들의 보안 연구 책임자인 미리낭크 샤르마와 연구원 야곱 콕슨이 차례로 사직했으며, 후자는 공개 서한에서 실험실이 "우리의 생명을 걸고 있다"고 직설적으로 언급했다.
최고의 실험실 내부 보안 경로의 붕괴에 직면하여, 딥마인드와 앤트로픽의 핵심 연구원들이 METR와 같은 기관으로 이직하는 사례가 늘어나고 있으며, 보안 연구의 전선이 체제 외부로 빠르게 이동하고 있다. 마리우스와 라이언은 경쟁의 역학과 지속적인 마찰 속에서, 진정으로 속도를 늦추고자 하는 사람들은 압박에 의해 입장을 바꾸거나, 심신이 지쳐 떠나는 선택을 해야 한다고 지적했다.

리차드 응고가 X에 게시한 장문의 스크린샷
전 오픈AI 정렬 연구 책임자 리차드 응고는 최근 X에서 "역사적으로 오픈AI와의 소속 관계는 AI 보안 연구자들(저를 포함하여)의 독립성과 정직성을 약화시켰다… 제 많은 행동은 오픈AI 경영진을 불쾌하게 할까 두려워서였다"고 공유했다.
04 임베디드 평가의 약속

사고 이후, 앤트로픽의 공동 창립자이자 CEO인 다리오 아모디는 1년 전에는 거의 상상할 수 없었던 제안을 했다: 모든 최전선 AI 회사 내부에 제3자 평가자를 임베드하여, 그들에게 안전 사고를 보고하고 모델이 실제로 정렬되었는지 평가할 권한을 부여하며, 그들이 외부에 가장 진실한 조사 결과를 공개할 수 있도록 허용하자는 것이다.
앤트로픽은 METR 및 레드우드와 같은 기관에 전례 없는 접근 권한을 열겠다고 약속했으며, 오픈AI도 같은 일을 하겠다고 밝혔다.
표면적으로 이러한 협력 태도에 대해 제3자 평가자들은 환영의 뜻을 표했지만, 곧이어 더 중요한 질문을 제기했다: 외부 연구자에게 주어진 접근 시간이 충분한가? 그들이 정말로 제한 없는 독립적인 발언권을 가지고 있는가?
역사 기록이 제시하는 답변은 그리 낙관적이지 않다.
이번 HPIM 지능체 통제 불능 사건에서 오픈AI는 외부 기관에 단 6일의 현장 조사를 제공했으며, 조사 범위는 엄격히 제한되었다. GPT-6 아스트라 출시 전의 테스트에서 아폴로 리서치는 단 3일의 시간만을 부여받았고, 그 중 단 2일만 사고 체인 권한을 요청할 수 있었다.
이에 대해 아폴로는 해당 모델의 평가 보고서에서 모델이 이미 더 높은 "평가 인식"(자신이 테스트되고 있다는 것을 인식할 수 있는 능력)을 보였고, 이처럼 제한된 시간 창을 고려할 때, 테스트 중 낮은 위반 발생률은 해당 모델이 안전하게 정렬되었거나 위험이 없다는 충분한 근거가 될 수 없다고 명확히 지적했다.
최전선 AI 연구 기관 FAR.AI의 CEO인 아담 글리브는 현재의 평가 메커니즘에 근본적인 제도적 결함이 있다고 보았다. 그는 이전에 몇몇 대형 실험실이 협력 계약에서 과도한 통제권을 보유하려 했고, FAR.AI는 이에 따라 계약 체결을 직접 거부했다고 털어놓았다.
현행 기본 모드에서는 외부 평가자가 종종 일반 제3자 계약자로 격하된다: 그들은 극히 엄격한 비밀 유지 계약과 계약 조건에 구속될 뿐만 아니라, AI 개발자는 평가 결과의 최종 발표에 대해 절대적인 통제권을 가진다.
동시에 아폴로 리서치의 연구 책임자인 알렉산더 마인크는 현재의 AI 회사들이 모델 훈련의 전 과정에서 모델이 스스로 정렬 훈련을 파괴하거나 우회하려고 시도한 적이 있는지에 대한 가장 기본적인 정렬 안전 문제조차도 답할 수 없다고 지적했다.
05 이해관계 얽힘과 신뢰 위기

제3자 평가의 독립성도 공개적으로 의문을 제기받고 있다.
《뉴욕 포스트》는 이 은밀한 이해관계 얽힘의 지도를 대중 앞에 완전히 드러냈다: 원래 "독립 심판" 역할을 해야 할 제3자 평가 기관이 인맥, 혈연, 심지어 자본 체인에서 평가받는 AI 거대 기업(특히 앤트로픽)과 얽혀 있다.
인사 및 혈연 관계에서 레드우드 창립 이사회 멤버인 홀든 카르노프스키는 본인 스스로 앤트로픽의 직원일 뿐만 아니라, 다리오의 매제이기도 하다. 카르노프스키의 아내는 앤트로픽의 또 다른 공동 창립자인 다니엘라 아모디이다.
또한, 레드우드 초기 이사회 멤버인 폴 크리스티아노는 다리오와 오픈AI 시절의 룸메이트이자 동료였으며, 이후 앤트로픽의 장기 이익 신탁의 신탁인 역할도 맡았다.
자본 및 자금 체인에서는 이러한 의존 관계가 더욱 깊다. 홀든이 공동 설립한 자선 재단 코에피시언트 기빙(이전 오픈 필란트로피)은 지난해 11월에만 레드우드에 3600만 달러를 지원했다.
유사하게, METR의 모체 기관인 정렬 연구 센터(ARC)도 코에피시언트로부터 1500만 달러의 자금을 받았다; 레드우드는 스카이프 공동 창립자인 얀 탈린의 생존 및 번영 기금으로부터 약 240만 달러를 모금했다. 얀 탈린 본인도 앤트로픽의 초기 핵심 투자자 중 한 명이다.
이처럼 복잡한 얽힘 네트워크에 직면하여, 비평가들은 솔직하게 지적했다: 이것은 진정한 구속력이 있는 독립 중재 메커니즘이 아니라, 내부 서클이 서로 보증하고 자율적으로 규제하는 폐쇄 시스템일 뿐이다. 심지어 다리오가 기대하는 외부 검토는 본질적으로 앤트로픽의 비즈니스 확장을 방해하지 않으면서 경쟁자를 억제할 수 있는 "규제 도구"를 배치하고자 하는 것이라는 비판도 있다.
맞다, 경쟁자를 억제하는 "규제 도구".
그래서 베스는 반복적으로 하나의 명제를 질문한다: 만약 모든 진정한 전문 능력을 가진 사람들이 이해관계 충돌에 깊이 얽혀 있다면, 대중과 정부는 도대체 어떻게 진실을 알 수 있는가?
그녀는 이 난제를 해결할 유일한 방법은 최상위 실험실과 경쟁할 수 있는 기술적 실력을 갖춘 독립 전문가 생태계를 구축하는 것이라고 본다. 그렇지 않으면, 각 대형 기술 기업이 예외 없이 "우리가 진정한 혁신자이며, 무책임한 상대를 이겨야 한다"고 주장할 때, 이러한 자기 보증에 의한 도덕적 권한은 결코 신뢰를 얻을 수 없다.
06 "속도를 늦추라"고 외치면서도 발표회에서 축제를 벌이다

안전, 이해관계 및 규제의 힘겨루기가 격화되는 가운데, 업계의 두 대기업인 오픈AI와 앤트로픽은 극히 극적인 갈등 상태를 보이고 있다.
아모디는 9월 23일 글을 올리며 전 세계의 모든 실험실에 "개발 속도를 늦추라"고 간곡히 촉구했다. 그러나 일주일도 채 되지 않아 앤트로픽은 비싼 플래그십 모델인 오푸스 5.5와 새로운 모델인 소네트 5.5를 연이어 출시하며 반박했고, 저비용 모델인 하이쿠 5.5의 출시를 예고했다.
"말은 하지만 실천은 없다"는 의혹에 직면하여, 그들의 제품 관리자 테오 추는 여전히 "항상 안전을 최우선으로 한다"는 공식적인 문구로 포장했다.
앤트로픽이 안전을 외치면서도 새로운 버전을 쏟아내는 것과 대조적으로, 오픈AI는 같은 날 브레이크를 밟을 수밖에 없었다.
9월 28일 확인된 바에 따르면, 오픈AI는 내부 검토에서 안전 기준을 충분히 충족하지 못했다고 판단하여, 결국 주목받던 차세대 모델 GPT-6.1 아스트라의 출시를 포기했다. 외부에서는 이것이 HPIM 지능체 통제 불능 사건 이후의 실질적인 개혁이자 규제 검토 압박에 대한 대응 조치로 분석하고 있다.
이 사건은 AI 산업에서 안전과 상업적 요구 간의 복잡한 얽힘을 반영한다. 현재 최전선 지능체는 자가 조직화, 로그 위조 및 숨겨진 추론과 같은 위험한 능력을 보여주고 있으며, 기존의 정렬 프레임워크에 큰 충격을 주고 있다. 보안 연구자들이 체제 외부로 빠르게 이동함에 따라, 평가 기관은 실질적인 구속력이 있는 외부 감독 메커니즘을 구축하지 못한다면, 최전선 대모델의 안전 위험이 앞으로 더욱 확대될 것이라고 경고하고 있다.













