AI 코딩 비용 급증 시대, 모델 라우팅으로 90% 토큰 절약하는 전략을 알아보세요. Spotify Portal의 AiKA 모드 활용법 완벽 가이드.
AI 코딩 에이전트의 토큰 낭비를 줄이는 방법
핵심 요약
- AI 코딩 비용 위기: 2028년까지 AI 코딩 비용이 평균 개발자 급여를 초과할 것으로 예상되며, 이미 많은 엔지니어링 리더가 개발자당 월 200~500달러를 토큰에 소비 중
- I/O 작업의 역할: AI 모델이 실제 사고가 아닌 입출력(I/O) 작업에 프론티어 모델을 과도하게 사용하면서 토큰 낭비 심화
- 모델 라우팅 솔루션: 두 가지 모드(bulk-reader, code-writer)로 I/O 작업을 저가 모델에 위임하면 평균 90% 토큰 절약 가능
- 재사용 가능 구조: Spotify Portal의 AiKA 모드 기반 시스템으로 플러그인 하나로 모든 프로젝트에 적용 가능
AI 코딩 비용, 이미 손에서 벗어났다
AI 코딩 에이전트가 개발자를 위해 하는 일의 대부분은 고차원적 사고가 아닙니다. 그것은 입출력(I/O) 작업 입니다.
하나의 메서드에 대한 질문에 답하기 위해 다섯 개의 파일을 읽습니다. 기존 테스트 파일 20개와 정확히 동일한 패턴을 따르는 새로운 테스트를 생성합니다. 회의 후 문서를 업데이트합니다. 이 모든 과정에서 수천 개의 토큰이 소모되지만 실제 추론은 거의 없습니다.
문제는 이러한 I/O 작업을 프론티어(최고급) 모델 에 공급하고 있다는 점입니다. 비용 대비 효율을 생각해보면, 이는 심각한 낭비입니다.
이미 산업 전체가 이 문제를 직면하고 있습니다. 2028년까지 AI 코딩 비용은 평균 개발자 급여를 초과할 것으로 예상 되며, 현재 엔지니어링 리더의 4분의 1은 개발자당 월 200~500달러를 토큰에 소비하고 있습니다. 일부는 2,000달러를 훨씬 넘습니다.
해결책: 두 가지 모드의 모델 라우팅
새로운 플랫폼이나 구독이 필요하지 않습니다. 단지 두 가지 모드만 있으면 됩니다.
Spotify Portal의 AiKA 모드란?
AiKA 모드는 임시 런타임에서 실행되는 선언적 에이전트입니다. 지침을 정의하고 모델을 선택하고 매개변수를 설정한 뒤 도구를 연결하면, Portal이 나머지를 처리합니다. 관리할 인프라나 장기 실행 서버가 없습니다.
모드 1: bulk-reader (대량 파일 읽기)
Claude가 여러 개의 큰 파일을 읽어야 할 때 사용합니다. 워커 모델이 파일을 분석한 후 요약을 반환하므로, Claude는 원본 파일을 절대 보지 않습니다.
실제 효과: 파일 크기가 350줄(구성 가능)을 초과하면 자동으로 위임되어 90%의 토큰을 절약 합니다.
모드 2: code-writer (코드 생성)
테스트, 설정 스캐폴딩, 기존 패턴을 따르는 모든 코드 생성 작업에 사용합니다. 사양과 참조 파일만 전달하면, 워커가 코드를 생성하고 디스크에 직접 씁니다. Claude는 생성된 코드를 절대 봅니다.
효율성: 기존 패턴을 일치시키기만 하면 되므로 저가 모델도 충분히 처리 가능합니다.
계층화된 위임: 자동화된 라우팅 체계
레이어 1: 훅(Hooks)
Claude Code 훅이 모든 도구 호출 전에 실행됩니다.
- check-file-size: 파일이 줄 임계값(기본 350줄)을 초과하면 읽기를 차단하고 bulk-reader로 리디렉션
- check-bash-read: 큰 파일에 대한 cat, head, tail 등 명령어를 포착하여 위임
임계값은 환경변수 SHUNT_MIN_LINES로 구성 가능합니다.
레이어 2: 스크립트
Portal CLI 호출을 래핑하는 bash 스크립트가 요청 빌드, 액션 호출, 토큰 사용량 보고를 처리합니다.
bulk-read 예시:
bulk-read --question "What does this service do?" --paths src/Service.java src/Handler.java
code-write 예시:
code-write --spec "Write tests for UserService" --reference tests/OrderTest.java --target tests/UserTest.java
레이어 3: 스킬(Skills)
Claude에게 스크립트를 언제 어떻게 호출할지 알려주는 마크다운 파일입니다. 훅이 읽기를 차단하면, 차단 메시지는 Claude를 올바른 스킬로 안내합니다.
벤치마크: 실제 토큰 절약 효과
Java 모노레포를 대상으로 테스트한 결과, bulk-read 절감률은 평균 90%에 달했습니다.
code-write 시나리오에서는 코드가 디스크로 직접 이동하므로 Claude가 본 적 없는 출력 토큰을 완전히 절약할 수 있습니다.
이 방식의 한계
편집은 위임할 수 없습니다: 워커 모델의 요약에는 신뢰할 수 있는 줄 번호가 포함되지 않으므로, 분석 기반 편집이 필요하면 여전히 특정 섹션을 직접 읽어야 합니다.
추론은 위임할 수 없습니다: 워커 모델이 표면적 패턴을 발견하지만, 미묘한 스레드 안전성 버그 같은 심층 분석은 Claude의 역할입니다.
지연 시간 누적: 각 위임은 네트워크 왕복입니다. 응답 시간은 일반적으로 10~30초이며, Portal은 단일 호출을 30초로 제한합니다.
모드의 진정한 가치: 재사용성과 조합성
AiKA 모드의 핵심 강점:
- 재사용 가능: 동일한 bulk-reader와 code-writer 모드가 모든 프로젝트에서 작동
- 공유 가능: 공개 모드는 누구든 즉시 사용 가능
- 조합 가능: doc-writer, reviewer, translator 등 새로운 모드를 쉽게 추가 가능
- 분리된 설계: 플러그인(언제 위임할지)과 모드(어떻게 응답할지)가 분리되어 있어, 워커 모델만 바꿔도 플러그인 수정 불필요
이를 통해 모델 라우팅이 시스템 엔지니어링 문제에서 단순한 구성 문제로 전환 됩니다.
직접 사용해보기
- spotify/portal-ai-plugins 마켓플레이스에서 플러그인 설치
- Claude Code에서
/portal:setup실행하여 Portal 인스턴스 인증 - 여러 파일에 걸친 질문 시 자동으로 위임 시작
대량 읽기와 코드 작성 모드는 이미 공개되어 있으므로 별도로 만들 필요가 없습니다.
결론
AI 코딩 비용 위기는 더 비싼 모델이 아니라 더 똑똑한 라우팅 으로 해결됩니다. I/O 작업을 저가 모델에 위임하면 토큰 낭비 없이 프론티어 모델의 진정한 가치를 살릴 수 있습니다. 두 가지 모드와 자동화된 훅만으로도 평균 90%의 토큰을 절약하세요.
원문출처: Portal by Spotify cut my Claude Code token usage by 90% | Spotify Engineering
powered by osmu.app