AI 에이전트 하네스 r2를 3개월 운영한 경험에서 얻은 실제 교훈. 받은편지함 관리, 모델 라우팅, 자가 치유, 인간 감독의 중요성을 알아보세요.
에이전트형 AI 3개월 운영으로 배운 4가지 교훈
핵심 요약
- 받은편지함이 작업 목록보다 효율적: 스레드 기반 관리로 처리 중인 작업과 완료된 작업을 한눈에 파악
- 로컬-클라우드 라우팅 필수: 비용(로컬 4~6분)과 신뢰성(클라우드 39초)의 균형 유지
- 자가 치유는 이중검증 필요: 오류 노출이 증가하지만, 자동 복구와 배포 전 검증으로 근본 해결
- 인간 감독의 역할 여전: 주요 의사결정, 인증 실패, 메모리 제한 등은 여전히 인간이 담당
받은편지함 기반 작업 관리의 우월성
기존 Asana 작업 대기열에서 Gmail 기반 받은편지함으로 전환했습니다. 에이전트가 처리 중인 작업은 '처리 중' 라벨로 분류되고, 완료되거나 인터벤션이 필요하면 받은편지함으로 돌아옵니다. 이 방식의 장점은 "당신을 기다리는" 화면 이 되어 우선순위 관리가 명확해진다는 점입니다.
이전에는 24개의 오류 스레드가 시스템에서 조용히 방치되었으나, 이제는 한 줄의 오류 이유와 함께 즉시 표면화됩니다.
로컬·클라우드 라우팅 아키텍처의 필수성
단일 모델이 라우터 역할을 하며, 빠른 로컬 작업자, 로컬 추론기, 클라우드 대체 계층으로 구성됩니다. 성능 특성은 다음과 같습니다:
- 로컬: 작업당 4~6분 소요, 낮은 비용
- 클라우드: 약 39초 소요, 높은 신뢰성
라우터의 핵심 역할은 각 작업의 특성을 파악하고, 로컬 실패를 은폐하는 대신 클라우드로 넘어가는 실제 이유를 기록 하는 것입니다.
자가 치유: 오류 노출과 자동 복구
초기 6주간 오류율은 0%였으나, 이후 15%, 34%로 상승했습니다. 이는 시스템 악화가 아닌 오류 은폐 중단 으로 인한 투명성 증대입니다.
개선 전:
- 21개 스레드가 오류 상태로 갇혀 있었고, 가장 오래된 것은 18일 방치
- 112건의 복구가 수동 SQL로 처리됨
개선 후:
- 실패가 즉시 드러나고, 지터 백오프로 4회 자동 재시도
- 데드 레터 처리로 완전히 격리
- 오류 상태 스레드 없음
추가로, 시스템이 잘못된 배포를 자동으로 되돌리기 도 합니다. 지금까지 65건의 자동 롤백이 발생했으며, 이 중 42건은 단위 테스트 실패 때문이었습니다. 7월 말부터는 배포 전에 손상된 코드를 탐지하므로, 손상된 메인 코드가 배포되지 않습니다.
다만 여전히 인간이 처리해야 하는 케이스가 있습니다: 인증 토큰 갱신, 메모리 제한, 모델의 허위 완료(서술만 하고 실행하지 않음).
자율화 속 인간 감독의 불가피성
작업이 단순 프롬프트에서 압축된 노드 그래프 로 진화했습니다. 모델은 JSON 의도, 액션, 도메인, 신뢰도 점수를 생성하고, 결정론적 코드가 쓰기 작업을 실행한 뒤, 독립 노드가 재검증합니다.
이렇게 생성자와 검증자를 분리 함으로써 "노허들 오펜스(자동화된 플레이 진행)"가 가능합니다. 그러나 여전히 쿼터백(인간)이 필수입니다:
- 어떤 작업을 클라우드로 라우팅할지 판단
- 어떤 실패에 인간이 개입할지 결정
- 배포 롤백 여부 지시
현재 이 쿼터백 역할은 여전히 운영자 한 명이 담당하고 있으며, 이는 전체 팀이 하던 감독 역할을 한 사람이 집약한 형태입니다.
결론
에이전트형 AI를 성공적으로 운영하려면 기술적 자동화만큼이나 인간 중심의 감독 체계 가 중요합니다. 받은편지함 기반 관리, 지능형 라우팅, 투명한 오류 처리, 그리고 명확한 의사결정 권한이 결합될 때 비로소 AI 에이전트가 신뢰할 수 있는 도구가 됩니다.
Original source: Four Lessons From Three Months Inside An Agentic Harness
powered by osmu.app