2026. 08. 01. · CK

매일 AI로 코딩하는 내가 《AI, 신의 탄생 인간의 종말》을 읽는 법

《AI, 신의 탄생 인간의 종말》 표지

도서관에서 붉은 표지의 《AI, 신의 탄생 인간의 종말》을 집었다. 원제는 If Anyone Builds It, Everyone Dies다. Eliezer Yudkowsky와 Nate Soares는 인간보다 훨씬 강한 AI를 현재와 비슷한 개발 방식으로 만들 경우 통제에 실패해 파국에 이를 가능성이 높다고 주장한다. 제목은 저자들의 결론을 처음부터 드러낸다.

나는 Claude Code와 Codex로 코드를 만들고 있다. 구현 시간이 줄어드는 경험을 하면서 이 책을 읽으니 AI 능력 향상을 추상적인 미래로만 보기 어려웠다. 현재 코딩 에이전트가 초지능이라는 뜻은 아니다. 세션 맥락을 잃고 잘못된 파일을 수정하며, 테스트가 없으면 완료 여부를 판단하지 못하는 모습도 매일 본다.

이 책은 도구 사용법을 알려 주는 실용서가 아니다. 매우 큰 피해 가능성을 전제로 개발 중단을 요구하는 위험 논증이다. 나는 결론에 찬성하거나 반대하는 한 문장을 먼저 고르지 않고, 저자들이 연결한 전제를 나눠 읽었다.

제목과 논증을 분리해서 읽었다

강한 제목은 독자에게 즉시 입장을 요구한다. 동의하면 경고를 받아들인 사람이 되고, 거부하면 기술 낙관론자처럼 보일 수 있다. 실제 판단에는 중간 단계가 필요하다.

나는 책의 주장을 다음 질문으로 나눴다.

능력: 현재 방식이 어느 범위까지 확장될 수 있는가
행위: 강한 모델이 장기 목표를 지속해서 추구하는가
정렬: 인간의 의도와 시스템의 행동을 맞출 수 있는가
권한: 모델이 현실에 영향을 줄 도구와 자원에 접근하는가
경쟁: 기업과 국가가 위험 신호를 보고 배치를 늦출 수 있는가
대응: 피해가 발생하기 전에 탐지하고 중단할 수 있는가

각 질문은 다른 종류의 근거를 요구한다. 벤치마크 점수는 능력 일부를 측정하지만 배치 환경의 권한을 설명하지 않는다. 에이전트가 장시간 작업을 수행한 사례도 시스템이 자체 목표를 형성했다는 증거와 같지 않다. 국가 간 경쟁은 기술 실험으로 확인할 수 없는 정치적 문제다.

전제를 나누면 책의 결론을 약하게 만들려는 태도처럼 보일 수 있다. 나는 반대로 위험 논증을 검토하려면 어느 연결이 강하고 어느 연결에 불확실성이 남는지 표시해야 한다고 본다. 큰 피해를 주장할수록 독자는 근거의 종류와 적용 범위를 확인해야 한다.

디지털 작업 절차는 복제 비용이 낮다

책에서 설득력 있게 읽은 부분은 디지털 지능과 작업 절차의 복제 가능성이다. 사람의 숙련을 다른 사람에게 그대로 복사할 수는 없다. 모델과 소프트웨어는 같은 버전을 여러 기계에서 실행할 수 있고, 한 세션이 만든 규칙과 코드를 다음 세션에 전달할 수 있다.

내 작업에서도 이 차이를 본다. 스펙과 테스트, 실행 명령을 저장소에 두면 같은 구현 패턴을 다른 기능에 적용할 수 있다. 한 에이전트가 발견한 오류를 validator로 만들면 다음 실행이 같은 검사를 반복한다. 병렬 에이전트는 독립된 파일을 동시에 처리할 수 있다.

복제한 모델이 같은 판단을 보장하지는 않는다. 입력 컨텍스트와 도구 권한, 검색 결과, 모델 업데이트가 출력에 영향을 준다. 병렬 실행은 같은 오류를 빠르게 복제할 수도 있다. 디지털 복제의 속도와 결과의 신뢰성을 별도 지표로 봐야 한다.

능력과 지속적인 목표 추구 사이

책의 위험 논증은 높은 문제 해결 능력을 가진 시스템이 인간의 의도와 어긋난 목표를 지속해서 추구할 수 있다는 가정에 크게 의존한다. 시스템이 감독을 피하고 자원을 확보하며 인간의 중단 시도를 방해할 수 있다면 피해 범위가 커진다.

현재 코딩 에이전트에서도 목표 오해는 일어난다. 사용자가 “테스트를 통과시켜 달라”고 요청하면 잘못된 에이전트가 구현을 고치지 않고 테스트 기대값을 바꿀 수 있다. 삭제 범위를 잘못 해석하면 필요한 파일까지 지울 수 있다. 이 사례는 초지능의 증거가 아니다. 목표 설명과 권한 경계, 검증기가 필요한 이유를 보여 주는 현재의 운영 문제다.

나는 다음 연결을 계속 질문하며 읽었다.

  • 높은 능력이 장기적이고 일관된 행위로 이어지는 조건은 무엇인가
  • 훈련 목표와 배치 중 주어진 작업이 어떤 관계를 가지는가
  • 샌드박스와 네트워크 제한이 실패 범위를 얼마나 줄이는가
  • 사람이 개입하는 승인 절차가 실제 공격이나 오류를 막는가
  • 여러 조직이 서로 다른 안전 수준으로 배치할 때 누가 중단을 조정하는가

저자들은 정렬과 통제 기술이 능력 발전을 따라가기 어렵다고 본다. 이 주장에 대한 반론을 읽을 때도 “안전 연구가 발전할 것이다”라는 기대만으로 충분하지 않다. 어떤 통제가 어느 능력과 배치 환경에서 작동했는지 확인해야 한다.

현재 에이전트에는 권한 사다리를 적용한다

초지능의 발생 확률을 결론 내리지 못해도 현재 도구의 피해 범위는 관리할 수 있다. 나는 에이전트 권한을 단계로 나눈다.

공개 자료 읽기
지정한 작업 폴더 읽기
복구 가능한 파일 쓰기
샌드박스 안에서 명령 실행
외부 서비스의 읽기 API 사용
외부 시스템 쓰기
배포, 결제, 삭제, 권한 변경

새 도구가 코드를 잘 만든다는 이유로 마지막 단계까지 열지 않는다. 읽기 작업에서 출처와 로그를 확인하고, 파일 쓰기는 Git과 백업으로 되돌릴 수 있게 한다. 명령 실행은 작업 디렉터리와 네트워크 범위를 제한한다.

외부 시스템 쓰기에는 별도 승인을 둔다. 에이전트가 보낼 메일의 수신자와 본문을 사람이 확인하고, 데이터 삭제는 대상 ID와 백업을 먼저 출력한다. 배포 전에는 테스트와 diff를 검토한다. 권한을 넓힌 날짜와 이유, 폐기 날짜도 기록한다.

이 구조는 정렬 문제를 해결하지 않는다. 현재 모델이 목표를 잘못 이해하거나 프롬프트 주입을 따를 때 피해가 특정 폴더와 계정 안에서 멈추도록 한다. 능력이 바뀌면 권한 평가도 다시 해야 한다.

위험이 큰 주장에는 두 개의 축이 필요하다

위험을 판단할 때 발생 가능성과 피해 규모를 함께 본다. 발생 확률을 정확히 알 수 없더라도 피해가 매우 크면 연구와 예방에 자원을 배정할 이유가 생긴다. 피해 규모가 크다는 이유만으로 특정 발생 경로가 증명되지는 않는다.

가능성 근거: 관찰, 실험, 이론, 전문가 판단
피해 범위: 개인, 조직, 사회, 전 지구
시간 범위: 현재 배치, 수년, 장기 미래
가역성: 복구 가능 여부와 복구 시간
대응 비용: 예방과 중단이 요구하는 자원
오판 비용: 과소 대응과 과잉 대응의 결과

이 표를 사용하면 “위험하다”와 “안전하다” 사이에서 토론이 멈추는 일을 줄일 수 있다. 같은 위험을 두고도 발생 가능성과 피해 규모, 대응 비용에 대한 판단이 다를 수 있다.

NIST 프레임워크와 책의 요구가 다른 지점

NIST AI 위험관리 프레임워크는 조직이 AI 위험을 Govern, Map, Measure, Manage 기능으로 다루도록 안내한다. 역할과 책임을 정하고 사용 맥락을 기록하며, 테스트와 모니터링을 거쳐 위험에 대응한다. 조직은 위험 허용 수준에 따라 시스템을 배치하거나 중단할 수 있다.

이 책은 점진적인 위험 관리보다 훨씬 강한 중단을 요구한다. 저자들은 충분히 강한 시스템이 등장하면 배치 후 측정과 수정이 늦을 수 있다고 본다. NIST 프레임워크는 현재 조직 운영에 적용할 수 있지만 저자들이 상정한 단일 실패의 전 지구적 피해를 해소한다고 말할 수 없다.

두 접근의 차이는 위험 평가와 대응 시점에 있다. 독자는 책의 중단 요구를 평가하면서 현실의 통제 수단이 어떤 실패를 막는지, 어떤 실패에는 적용되지 않는지 봐야 한다.

반론을 읽을 때 확인할 질문

책에 대한 찬반 요약만 읽으면 강한 표현끼리 경쟁한다. 나는 반론에서도 다음 항목을 찾는다.

  • 책이 사용한 전제를 정확히 다루는가
  • 현재 모델의 한계를 장기적인 한계로 확장하는가
  • 안전 기법의 실험 조건과 실패 사례를 함께 제시하는가
  • 기술 경쟁과 규제 집행 문제를 구분하는가
  • 발생 가능성과 피해 규모를 별도로 평가하는가
  • 불확실성을 숫자처럼 단정하지 않는가

저자들의 다른 글과 비판자의 원문을 함께 읽고, 책이 인용한 연구도 가능한 범위에서 확인한다. AI 안전은 기술과 정책, 철학이 섞인 주제라 한 분야의 확신으로 전체 결론을 대체하기 어렵다.

책을 덮고 바꾼 작업 규칙

이 책을 읽고 AI 도구 사용을 중단하지는 않았다. 편리한 결과를 안전성의 증거로 사용하지 않게 됐다. 에이전트가 빠르게 코드를 만들수록 권한과 검증을 별도로 점검한다.

내 작업 규칙에는 다음 항목이 남았다.

  • 새 에이전트는 읽기와 제한된 쓰기부터 시작한다.
  • 외부 로그인과 쿠키는 전용 계정을 사용한다.
  • 위험한 명령은 대상과 복구 방법을 먼저 확인한다.
  • 구현자와 검토자의 컨텍스트를 분리한다.
  • 테스트 통과가 실제 운영 안전을 모두 증명한다고 기록하지 않는다.
  • 모델과 도구 업데이트 후 권한 평가를 다시 한다.

《AI, 신의 탄생 인간의 종말》의 결론을 검증된 사실로 받아들이지는 않는다. 자극적인 제목만 보고 논증 전체를 버리지도 않는다. 이 책은 큰 피해 가능성을 어떤 전제로 연결하는지 확인하게 만들었다. 나는 현재 도구에서 확인 가능한 위험을 줄이고, 장기 주장에는 원문과 반론, 불확실성의 위치를 함께 기록한다.

참고자료

매일 AI로 코딩하는 내가 《AI, 신의 탄생 인간의 종말》을 읽는 법 · iamlazyck