작성 2026. 04. 22. · CK · 본문 보강 2026. 09. 08.

에이전트 검수를 분리하는 방법: GAN식 하네스에서 가져올 것과 버릴 것

읽기 전 요약

생성자와 평가자를 분리해도 평가자가 같은 오류를 놓치면 검수는 통과 도장에 그친다. Anthropic의 GAN에서 착안한 하네스 실험을 바탕으로 독립 근거, 반려 사유, 재검사와 종료 조건을 블로그 편집에 맞게 설계했다. 모델에게 무조건 비판하라고 지시하기보다 실제 결함을 찾는지 대조 과제로 확인하는 방법이다.

에이전트에게 초안을 쓰고 스스로 검수하라고 하면 작성한 이유까지 알고 있는 상태에서 결과를 평가한다. 두 번째 에이전트를 붙여도 첫 번째 설명을 그대로 믿으면 달라지는 것이 적다. 내가 고치고 싶은 문제는 평가의 말투보다 무엇을 근거로 통과시키는지다.

Anthropic은 장시간 애플리케이션 개발 실험에서 생성자와 평가자를 나누는 구조를 소개했다. GAN에서 착안했다는 설명이지만 생성적 적대 신경망을 새로 학습했다는 뜻은 아니다. 이미 있는 모델에게 구현과 평가 역할을 맡긴 하네스 설계다. 실험의 구성과 결과를 모든 작업에 적용하는 보편적인 처방으로 읽지는 않는다. Anthropic 하네스 실험

다른 역할에는 다른 입력과 확인 권한이 필요하다

생성자는 원고의 목적, 독자, 출처와 작성 규칙을 읽는다. 평가자는 최종 원고뿐 아니라 같은 원자료와 공개 기준을 읽어야 한다. 생성자의 “이 부분을 검증했다”는 요약만 전달하면 평가자는 독립적으로 확인할 근거가 없다. 출처를 열어보지 않은 상태에서는 출처 정확성을 통과시킬 수 없다.

코드 작업이라면 평가자가 실제 실행 결과와 테스트를 볼 수 있어야 한다. Anthropic의 실험도 평가자가 실행 중인 앱을 조작하고 구체적인 동작을 검사하는 방식에 주목한다. 이런 근거가 없는 점수와 있는 점수는 다르다. 나는 숫자 점수보다 실패한 동작과 재현 방법을 먼저 요구하겠다.

같은 모델을 쓰면 무조건 관대하고 다른 모델이면 객관적이라는 구분도 피한다. 모델이 달라도 같은 자료를 잘못 읽거나 비슷한 학습 편향을 공유할 수 있다. 역할 분리의 효과는 실제 결함을 더 발견했는지로 확인한다. 특정 모델을 비판적인 성격이라 부르며 평가자로 고정하지 않는다.

작은 편집 작업에서는 생성자에게 쓰기 권한, 평가자에게 읽기와 검사 권한만 주는 방식을 제안한다. 평가자가 원고를 고쳐놓고 자신이 고친 결과를 승인하면 변경과 검수를 다시 섞는다. 수정은 생성자에게 돌리고 평가자는 어떤 부분을 다시 확인했는지 남기는 편이 추적하기 쉽다.

블로그 검수는 사실·독자 가치·형식을 구분한다

내 블로그에 적용할 검수표는 세 종류로 나눈다. 사실 검수는 출처의 내용과 본문 주장이 맞는지 확인한다. 독자 가치 검수는 원문 요약을 넘어 실제 절차나 판단 기준이 있는지 확인한다. 형식 검수는 메타데이터, 링크, 길이, 작성 메모가 기준에 맞는지 검사한다.

검사 종류반려할 사례필요한 근거
사실해본 적 없는 도구를 써봤다고 서술실행 기록 또는 저자 확인
출처공식 문서와 다른 버전의 기능을 설명해당 버전 문서의 위치
독자 가치제목은 설정법인데 개념 설명만 있음누락된 설정 절차와 적용 조건
문체같은 대비 문장과 과장 표현을 반복문제가 있는 문장과 수정 이유
형식요약 누락·깨진 링크·작성 메모 노출자동 검사 결과

하나의 총점으로 합치면 치명적인 사실 오류를 문체 점수가 상쇄할 수 있다. 핵심 출처나 사실에 문제가 있으면 평균 점수와 상관없이 수정 대상으로 남긴다. 반대로 취향 차이에 해당하는 문장 선택 때문에 원고를 끝없이 다시 쓰게 하지는 않는다. 반려 사유에 필수 수정인지 제안인지 표시한다.

예를 들어 요약에 “세 가지 규칙을 적용해 효과를 봤다”고 적었는데 본문은 실행 계획이라면 명확한 충돌이다. 평가자는 요약과 본문의 해당 문장을 짚고 실제 상태에 맞추도록 요구한다. “조금 더 진정성 있게” 같은 피드백은 수정 기준으로 부족하다. 저자의 경험을 새로 만들게 할 위험도 있다.

형식 검사는 가능한 한 결정적인 도구를 쓴다. 글자 수와 필수 필드 존재 여부를 모델 감으로 세지 않는다. 링크의 HTTP 성공 여부와 링크가 주장을 뒷받침하는지도 구분한다. 자동 검사가 통과한 사실과 사람 또는 모델이 내용까지 읽은 사실은 보고서에서 따로 표시한다.

반려 문장은 수정할 수 있는 형태로 쓴다

좋은 반려 기록에는 문제 위치, 위반한 기준, 확인한 근거, 필요한 조치를 넣는다. 한 원고에 문제 다섯 개가 있다면 같은 문체 취향을 여러 항목으로 쪼개 수를 늘리지 않는다. 핵심 사실과 독자 약속의 불일치를 먼저 다룬다.

다음은 원고를 읽는 평가자에게 줄 요청 예시다. 자동 공개까지 허용하는 지침은 아니며 실제 도구 접근 범위는 별도로 제한한다.

원고와 지정한 출처를 대조한다.
검사한 항목과 확인하지 못한 항목을 구분한다.
필수 수정은 문제 위치, 근거, 필요한 조치로 작성한다.
직접 경험이나 출처가 없으면 내용을 만들어 보완하지 않는다.
문체 취향은 제안으로 표시하고 사실 오류와 같은 급으로 다루지 않는다.
최종 상태는 통과, 수정 필요, 확인 불가 중 하나로 제시한다.
원고 수정과 공개는 실행하지 않는다.

생성자는 반려 항목별 처리 결과를 남긴다. 고친 문장과 근거를 연결하고, 고치지 않은 항목은 이유를 적는다. 평가자는 원고 전체를 다시 평가하기 전에 이전 필수 수정이 해결됐는지 확인한다. 수정 과정에서 생긴 새 오류도 보되 같은 표현 취향만 반복해서 기각하지 않는다.

불확실한 정보를 삭제하면 독자에게 필요한 설명도 빠질 수 있다. 이때는 확인 가능한 범위로 주장을 좁히고, 실제로 따라 할 수 있는 검증 방법을 추가한다. 분량이 필요한 글이라고 미확인 사례를 다른 미확인 사례로 대체하지 않는다. 보강과 사실 정정은 함께 처리해야 한다.

평가자를 먼저 시험하지 않으면 반복 횟수만 늘어난다

평가자가 결함을 잡는지 보려면 정답이 있는 작은 원고 묶음이 필요하다. 예를 들어 날짜가 틀린 글, 본문에 없는 결론을 요약에 넣은 글, 출처가 맞는 정상 글을 준비한다. 일부 오류는 사람이 의도적으로 넣은 시험용이며 실제 공개 원고와 분리한다.

시험 결과에는 놓친 오류와 잘못 반려한 항목을 함께 기록한다. 모두 기각하는 평가자는 안전해 보이지만 정상 원고를 고치는 비용을 만든다. 반대로 대부분 통과시키면 검사 단계가 있다는 사실만 남는다. 평가 문구를 바꿀 때는 같은 시험 묶음을 다시 돌려 개선 여부를 확인한다.

Anthropic의 에이전트 평가 안내는 단일 점수보다 작업, 채점기, 실행 흔적과 환경 상태를 구분해 평가하도록 설명한다. 내 적용에서는 원고의 품질과 평가자의 품질을 따로 보는 근거로 삼겠다. 완성된 글만 보고 중간 검사에서 어떤 근거를 확인했는지 추측하지 않는다. 에이전트 평가 설계

실패 원인을 기록하면 분업을 바꿀 근거도 생긴다. 외부 링크 검사가 느려서 전체 편집이 지연된다면 링크를 묶어 확인하는 절차를 개선한다. 사실 검수가 반복해서 막히면 초안 전에 출처를 확보하는 단계가 부족한 것이다. 평가 모델을 더 비싼 것으로 바꾸기 전에 어디에서 오류가 생겼는지 살핀다.

종료 조건에는 비용과 미해결 사유를 넣는다

생성자와 평가자가 합의할 때까지 무한 반복하게 두지 않는다. 내 첫 시험에서는 자동 수정 두 차례를 상한으로 제안한다. 같은 핵심 사실을 확인하지 못하면 사람에게 필요한 질문을 남기고 그 원고만 보류한다. 이 횟수는 실험 예산이며 Google의 콘텐츠 기준이나 모델 성능 한계가 아니다.

비용도 생성과 평가를 나눠 기록한다. 평가에서 출처를 읽고 브라우저로 결과를 확인하면 단순히 에이전트 수가 두 배라는 계산으로 끝나지 않는다. 여러 번의 재작성까지 포함한 총비용과 사람이 검토한 시간을 비교해야 한다. 기존 원고의 특정 모델별 가격과 평가 비용 비율은 실측값으로 사용하지 않는다.

상태 기록에는 최종 본문 버전과 검사 결과를 연결한다. 검사를 통과한 뒤 다른 수정이 들어갔다면 그 버전을 다시 확인해야 한다. 어제 원고의 통과 기록을 오늘 배포본의 검증으로 재사용하면 안 된다. 자동 공개 절차와 평가 절차는 구분하고 사용자 승인을 필요한 위치에 남긴다.

이 구조의 첫 성공 사례는 높은 점수를 받은 원고보다 평가자가 실제 오류 하나를 찾아 수정하고 재확인한 기록이면 충분하다. 반례를 확인할 수 없는 평가는 칭찬이나 비판의 강도만 바뀌기 쉽다. 원문과 최종 글 사이의 사실을 확인하고 남은 문제를 숨기지 않는 검수부터 만들겠다.

참고자료

에이전트 검수를 분리하는 방법: GAN식 하네스에서 가져올 것과 버릴 것 · iamlazyck