Anthropic 엔지니어들이 공개하는 Claude Code, Claude Fable, Claude Tag의 실제 활용법과 개발 문화. AI 시대 소프트웨어 개발 어떻게 바뀌었나?
Claude Code, Fable, 태그: AI가 바꾼 개발의 현재
핵심 요약
- Claude Code는 1년 반 만에 개발자의 일상을 근본적으로 변화시켰음. 초기 권한 프롬프트 확인이 필수였던 것과 달리, 이제는 모델을 충분히 신뢰하고 위임할 수 있음
- Claude Fable과 Opus 4.8로 시스템 프롬프트 80% 감소. 모델이 더 강력해지면서 과도한 제약 대신 맥락 중심의 가이드가 효과적임을 발견
- Claude Tag는 멀티플레이어 에이전트로서 능동형 작업 수행. Anthropic 내 제품 PR의 65%를 자동 처리하며 팀 협업 방식을 재정의
- 소프트웨어 엔지니어링의 핵심이 실행(execution)에서 제품 감각(product intuition)으로 이동
- 자동 모드 안전성은 광범위한 평가와 레드팀 테스트를 통해 검증됨
개발자 경험의 변화: 1년 반의 진화
Claude Code가 출시되고 소네트 3.7이 공개된 지 1년 반이 지났다. Anthropic 엔지니어들은 처음에 모든 작은 작업을 면밀히 모니터링하고 권한 프롬프트를 신중하게 검토하며 "아니요"를 반복해야 했다.
이제 상황이 완전히 바뀌었다. 각 모델 세대가 나올 때마다 엔지니어들은 한 발짝 물러설 수 있게 되었다. 많은 사소한 구현 작업을 Claude에게 위임하면서 더 창의적인 업무에 집중할 수 있게 된 것이다.
이러한 변화의 가장 큰 영향은 기능 구현에 걸리는 시간 이다. 과거 6~12개월이 걸리던 작업이 이제는 일주일 단위로 완성된다.
소프트웨어 엔지니어링의 새로운 규칙
실행에서 제품 감각으로의 전환
과거 2년 전의 표준 프로세스는 다음과 같았다:
- 제품 관리자가 고객과 대화
- 6개월간 크로스펑셔널 팀과 PRD(제품 요구사항 문서) 협의
- 첫 코드 한 줄을 작성하기 전에 철저한 사양과 문서 완성
이제는 완전히 반대다. 아이디어를 내고 구축하는 데 걸리는 시간이 급격히 단축되면서, 엔지니어들에게 요구되는 능력이 변했다.
Anthropic 팀은 엔지니어들에게 권고하는 것을 명확히 했다:
- 비즈니스 감각과 제품 감각을 더 개발하라
- 무엇을 만들 가치가 있는지 판단하는 안목
- 비즈니스에 실질적인 영향을 미칠 것이 무엇인지 파악
결과적으로 제품 영역에서는 제품 안목의 가치가 높아지고, 실행의 중요성은 다소 낮아졌다. 물론 인프라 영역은 여전히 세부 사항의 정확성에 큰 비중을 둔다.
"다시 작성"의 재평가
1년 전까지만 해도 "절대 다시 작성하지 말라"는 것이 소프트웨어 엔지니어링의 금언이었다. 그러나 이제 상황이 달라졌다.
좋은 테스트 스위트가 있다면, 다시 작성하는 과정 중에 스스로를 검증하게 된다. 더 나아가 서로 다른 구현을 여러 번 시도한 후 가장 정확한 것을 선택하는 방식도 가능해졌다.
Claude Tag: 멀티플레이어 에이전트의 등장
Claude Tag는 Slack 내에서 1주일 전 출시된 협업 도구다. Claude Code와 근본적으로 다른 점 은 다음과 같다:
핵심 차이점
| 구분 | Claude Code | Claude Tag |
|---|---|---|
| 모드 | 반응형 (사용자 요청 대기) | 능동형 (자동 모니터링) |
| 위치 | 독립 개발 환경 | Slack 채널 내 |
| 협업 | 개인 중심 | 팀 협업 (멀티플레이어) |
능동형 작업의 예
"이 채널의 모든 버그 보고서를 모니터링하고, 그것을 수정하는 PR을 올리고, 이 코드베이스 부분을 마지막으로 건드린 엔지니어를 태그해 줘"
Claude Tag는 채널이 존재하는 동안 지속적으로 이 작업을 수행한다. 수동 개입 없이.
팀 메모리 기능
Claude Tag에게 팀의 선호도를 자연어로 알려주면, 모든 미래 게시물에 대해 이를 기억한다:
- "버그는 막되, 경고는 디버깅하지 마"
- "항상 이렇게 검토해 줘"
이러한 선호도는 팀의 모든 멤버에게 적용된다.
실제 영향: 65%의 PR 자동 처리
Anthropic의 제품 엔지니어링 팀은 현재 제품 PR의 65%를 Claude Tag의 내부 버전으로 처리하고 있다. 이는 단순히 시간 절약을 넘어 개발 워크플로우 자체의 변화를 의미한다.
시스템 프롬프트의 급격한 감소
80% 토큰 감소의 의미
Claude Fable과 Opus 4.8 출시로 Anthropic은 Claude Code의 시스템 프롬프트를 80% 감소시켰다. 이는 단순한 최적화가 아니라 모델에 대한 신뢰도의 변화를 반영한다.
과도한 제약에서 맥락 중심으로
초기 Opus 4 계열 모델들을 다룰 때:
- 많은 예시가 필요했음
- 세부적인 지시사항이 필수였음
- "하지 마"라는 부정적 지시가 효과적이었음
새로운 모델들은 다르다.
과도한 제약을 줄이고 더 많은 맥락을 제공하는 것이 훨씬 효과적임을 발견했다. 예를 들어:
예시 제거의 효과:
- 초기: Claude에게 구체적인 예시를 제공해야 함
- 현재: Claude가 제공된 예시보다 훨씬 더 창의적으로 작동
지시사항의 재구성:
- 나쁜 예: "항상 프런트엔드 변경을 검증하세요"
- 좋은 예: "프런트엔드 작업 시 백엔드 엔드포인트 호출만으로는 전체 경험을 이해할 수 없습니다. 사용자 경험 변경이 큰 경우 로컬에서 앱을 실행하세요"
모델별 다른 시스템 프롬프트
흥미로운 점은 최첨단 모델과 구형 모델이 다른 프롬프트를 필요로 한다는 것 이다.
80% 감소는 최신 모델(Fable, Opus)에만 적용되며, 구형 모델들은 여전히 전체 시스템 프롬프트를 사용한다. 이는 더 강력한 모델의 판단력이 우수하다는 신뢰에서 나온 결정이다.
코드 품질 보증: 신뢰 구축의 과정
다각적 코드 리뷰 체계
Anthropic의 코드 리뷰 방식은 세 가지 레이어로 구성된다:
코드 소유자의 수동 검토 (핵심 영역)
- 중요 시스템과 핵심 코드 변경사항
- 직접 승인 필수
Claude 기반 자동 코드 리뷰
- 모든 PR에 적용
- 대부분의 리뷰 커버
강화된 테스트와 CI/CD
- 보안, 기능성 자동 검증
- Claude가 테스트도 작성하고 검증
신뢰도 구축의 핵심: 평가 세트
처음부터 모든 코드를 사람이 검토했으나, 6개월 이상의 데이터 축적을 통해 점진적으로 신뢰를 구축했다.
접근 방식:
- 특정 파일 범주 코드 변경에 대해 "코드 리뷰가 100% 문제를 잡아내고 있다"는 판단 도출
- 인시던트 발생 시 "코드 리뷰가 왜 이를 놓쳤나?" 분석
- 그 케이스를 평가 세트에 추가하여 재발 방지
새 모델 출시 시 전체 평가 세트 실행 → 이전 모델보다 확실히 우수한지 확인 → 확신을 가지고 배포
시스템 프롬프트 개선의 평가
가장 기본적인 질문: 시스템 프롬프트를 개선했을 때 실제로 제품이 나아지는가?
평가 방식:
기능 최적화 (핵심 지표)
- 완전한 정의와 코드베이스 제공 시 Claude가 올바른 결정을 내리는가?
- 버그를 완전히 수정하는가?
- 모든 테스트를 통과하는가?
행동 최적화 (사용자 경험)
- Claude가 부적절한 발언을 하지 않는가? (예: "이제 잠자리에 들 시간입니다")
- 불필요한 대화형 확인을 줄이는가?
새 모델과의 호환성
- Opus → Fable 전환 시 성능 유지 또는 개선 확인
- 모든 평가 케이스 통과
자동 모드의 안전성: 광범위한 검증
실제 안전성 인프라
자동 모드의 작동 원리:
- 소넷 분류기 → Claude의 도구 사용, 대화 맥락, 사용자 지시를 판단
- 동적 권한 처리 → 사용자 요청에 따라 권한 결정
- 샌드박싱 → 네트워크 요청 등 샌드박스 밖 작업 검증
- 강화 학습 → 보안 정책 학습
평가와 레드팀
Anthropic은 자동 모드 안전성에 대해:
- 수천 개의 평가 세트 구축
- 적대적 환경에서의 레드팀 테스트 (프롬프트 인젝션, 악성 입력 등)
- 주요 위험 범주별 완화 조치
공식 입장: "평균적인 인간 검토자보다 위험이 훨씬 낮습니다"
추가 보안 기능:
- Claude Tag의 자체 자격 증명 → 사용자를 대신하여 작동할 필요 없음
- 신뢰할 수 있는 장치(Trusted Devices) 정책
- 자격 증명 주입(Credential Injection) → 에이전트에 직접 노출되지 않음
엔지니어 문화의 역할
"우리는 절충점과 협상하지 않는다"
Anthropic 공동 창업자들이 강조하는 문화:
- 머릿속으로 절충점을 상상하고 야심 차게 행동하지 않도록 설득하는 경향을 거부
- "좋아, 해보면 어떨까?"의 사고방식
- 절충점이 실제 데이터로 드러날 때까지 최대한 야심 차게 접근
제품 기술의 진화
제품 관리 역할의 변화:
- 엔지니어, 디자이너, PM의 역할이 혼합
- 좋은 아이디어가 있지만 리소스가 없을 때 직접 구현해서 영감 제공
- 초기 프로토타입을 직접 만들어 팀에 영감 주기
- 내부 커뮤니케이션과 출시 자동화
실제 활용 사례
비디오 편집 (Claude Fable)
컨퍼런스 기조연설을 위해:
- 원본 영상, 발표 자료 영상, 오디오, HTML 슬라이드 제공
- Claude Fable이 자동으로:
- 전체 영상을 전사
- 불안정한 발표 자료 감지 → HTML 소스로 대체
- 무대에서의 연사 위치 동적으로 잘라냄
- 애니메이션과 그래픽 추가
- ffmpeg, remotion 등 자동 활용
결과: 즉시 출시 가능한 수준의 최종 영상
암벽 등반 앱 (Claude Code + Workflows)
팀을 위한 맞춤형 등반 목적지 계획 앱:
- Mountain Project에서 팀 실력 수준의 등반 코스 찾기
- Airbnb로 숙박지 탐색
- 접근 거리 필터링 (차 주차지에서 암벽까지의 도보 거리)
- 모든 팀원의 현재 위치와 직항편 확인
기존 방식: Mountain Project를 일일이 클릭하며 검색
Claude 버전: 선호도 입력 후 자동 처리
아직 남은 과제
디자인과 UX 감각
현재 Claude가 가장 어려워하는 영역:
- 패딩, 마진 등 세부 정렬
- 새로운 상호작용 경험 설계 (프론티어 AI 제품)
- "Opus만의 미학"에서 벗어나기
현실 세계와의 상호작용
- 실험 조율
- 과학 문제 해결
- 광범위한 도메인 지식 필요
결론
1년 반 사이에 Claude Code, Fable, Tag는 AI 시대의 소프트웨어 개발이 어떤 모습인지 보여주고 있다.
핵심 변화:
- 기술적 실행보다 제품 감각이 중요해졌다
- 신뢰할 수 있는 에이전트와 함께 일한다는 것은 더 야심 찬 목표를 추구할 수 있다는 뜻이다
- 안전성은 끊임없는 평가와 투자로 확보된다
- 문화적 용기 — "절충점과 협상하지 않기" — 기술 발전을 가능하게 한다
Anthropic이 보여주는 이 변화는 단순히 도구의 진화가 아니라, 인간과 AI가 협력하는 방식의 근본적인 재정의 다.
원문출처: Claude Fable, Claude Tag, and Anthropic's Culture — Cat Wu & Thariq Shihipar ft Simon Willison
powered by osmu.app