앤트로픽 첫 기술 PM이 공개하는 토큰 효율화, 모델 개발 여정, AI 시대 제품 관리의 변화. 평가(Evals)가 PRD를 대체하는 이유와 성공 전략.
AI 시대, 제품 관리자는 "토큰"으로 생각해야 한다
핵심 요약
- 토큰 사고가 필수: 픽셀 최적화처럼 토큰(AI 모델의 입출력 단위)을 꼼꼼하게 분석하고 최대화해야 함
- 평가(Evals)가 새로운 PRD: 사용자 피드백을 기반으로 한 평가가 전통적 제품 요구사항 문서를 대체하고 있음
- 근본 원칙 사고가 핵심: 패턴 매칭이 아닌 첫 번째 원칙에서 사용자 가치를 파악하는 능력이 가장 중요
- 모델 발전의 불연속적 도약: 스케일링 법칙으로는 예측 불가능한 새로운 능력이 갑자기 나타남
- 직접 구축이 필수: PM과 리더십도 실제로 AI 도구를 만들고 사용해봐야 함
앤트로픽의 초기 전환점들
2023년 초만 해도 Anthropic은 OpenAI의 경쟁 상대로 간주되지 않았습니다. 당시 제품 팀은 5명의 엔지니어로 구성되어 있었고, API 비즈니스 전체를 담당하는 인원은 단 한 명이었습니다. 하지만 회사의 강력한 문화와 미션이 이 작은 팀을 움직였습니다.
'골든 게이트 클로드' 실험 이 변곡점이 되었습니다. 2024년 초, 해석 가능성 연구에서 발견한 모델 특징을 활용해 Claude가 금문교에 집착하도록 만드는 경험을 24시간 만에 Claude.ai에 출시했습니다. 2,000명 정도만 경험했지만, 이를 통해 팀은 깨달았습니다: 우리는 경쟁사와 다른 방식으로 독창적인 경험을 만들 수 있다는 것.
Opus 3의 성공 도 중요했습니다. 모델이 코딩에 탁월하도록 훈련하기로 결정했을 때, 이는 작은 훈련 조정이었지만 초기 사용자들에게 엄청난 가치를 제공했습니다. 당시만 해도 사람들은 AI가 긴 형식의 코드를 작성할 수 있다고 생각하지 않았습니다.
"평가가 새로운 PRD다"
AI 제품 관리의 가장 큰 변화는 평가(Evals)가 전통적 PRD(제품 요구사항 문서)를 대체한다는 것입니다.
초기 사례로 Claude 2 시절, 사용자들이 "지시를 잘 따르지 못한다"고 피드백했습니다. 팀이 깊이 파고들자, 약 80%의 실패가 Claude가 올바른 JSON 형식을 생성하지 못하는 데서 비롯 되었습니다. 이를 바탕으로 30~40가지 실패 사례를 수집해 평가 세트를 만들었고, 이제 새 모델 출시 때마다 이 평가를 실행합니다. 현재 이 평가는 99.9% 정확도를 보여주며, 더 이상 주요 문제가 아니라는 뜻입니다.
평가 작성의 3단계:
- 사용자 피드백 수집 및 세부 분석
- 고충의 패턴과 원인 파악 (환각? 도구 사용 실패? 지식 부족?)
- 표준화된 테스트 케이스로 변환하여 연구팀에 전달
이 과정 없이는 연구팀이 어디를 개선해야 할지 알기 어렵습니다.
PM이 해야 할 일의 변화
AI 시대에 PM의 역할은 근본적으로 달라졌습니다.
픽셀에서 토큰으로의 전환: 과거 제품 관리자는 UI/UX 픽셀을 최적화했습니다. 이제는 토큰을 최적화합니다. 제품 담당자들은 사용자 피드백에서 나오는 실패 궤적을 읽고, 모델이 과신했는지, 환각을 일으켰는지, 도구를 호출해야 했는지를 판단해야 합니다.
직접 사용이 필수: Anthropic의 창의적인 사상가들과 최고의 프로토타입 제작자들은 매 버전의 Claude와 직접 상호작용하는 데 많은 시간을 씁니다. 기술을 직접 다뤄보지 않고 완벽한 전략을 고안하기는 불가능합니다.
스케일링 법칙을 넘어선 '새로운 능력'
AI 개발을 이해하는 데 필수적인 개념이 있습니다: 새로운 능력의 불연속적 도약.
일반적으로 알려진 스케일링 법칙은 부드러운 선형 곡선을 보여줍니다. 더 많은 컴퓨팅과 데이터를 투입할수록 손실이 점진적으로 감소한다는 것입니다. 하지만 실제로는 특정 지점에서 새로운 능력이 갑자기 나타납니다.
예를 들어, 어떤 모델은 "1+1"을 계산하지 못하다가 갑자기 안정적으로 계산할 수 있게 됩니다. 이 도약이 언제 일어날지는 예측하기 어렵고, 이를 발견하려면 적절한 평가 시스템이 필수입니다.
Labs 팀: "불연속적인 베팅"의 장
Anthropic은 핵심 제품 팀 외에 별도의 Labs 팀을 두고 있습니다. 이 팀의 역할은 10배, 100배, 심지어 1000배의 개선 으로 이어질 수 있는 아이디어를 탐색하는 것입니다.
성공 조건:
- 소규모 팀 구성 (때로는 개인부터 시작)
- 강한 테마/방향성은 유지하되, 정확한 프로토타입은 유연하게
- 실패를 학습의 기회로 봄
- 공개적인 실험과 아이디어 공유 문화
초기에는 Slack 채널에서 여러 팀원들이 Claude를 테스트하고 다양한 사용 사례를 시도했습니다. 이러한 공동 발견이 이후 Claude Code, Skills, MCP 같은 혁신 제품으로 발전했습니다.
AI 시대의 제품 관리자 채용
성공적인 AI 제품 팀을 만드는 데 필수적인 특성은:
- 근본 원칙 사고: 패턴 매칭이 아닌 첫 번째 원칙에서 사용자 가치를 파악하는 능력
- 세부 사항에 대한 몰입: 모든 것을 높은 수준에서만 다루지 않고 깊이 파고드는 태도
- 동료와의 신뢰: 자기중심적이 아닌 팀 지향적인 사람
- 기술에 대한 진정한 사랑: AI를 단순히 업무 도구가 아닌 탐색 대상으로 보는 열정
특히 Anthropic에서는 이러한 특성을 가진 사람들이 빠른 결정과 신뢰 기반의 협업을 가능하게 합니다.
Claude를 "생각의 파트너"로 활용하기
PM들이 Claude를 활용하는 방식도 변화하고 있습니다. 단순한 업무 자동화를 넘어, 사고의 보강 이 중요해집니다.
효과적인 활용법:
- 먼저 관점 개발: 처음부터 Claude에만 의존하지 않기
- 스파링 파트너로 삼기: 아이디어를 다듬고 가정에 도전하도록 하기
- 표준화 작업 위임: 월간 사업 검토 같은 정형화된 작업은 Claude에게 전적으로 맡기기
- 반박을 환영하기: Claude가 당신의 아이디어에 이의를 제기할 때가 가장 가치 있음
Claude의 명확한 헌법(Constitutional AI)은 모델이 언제 반박할지 알게 해주며, 이것이 오히려 더 유용한 대화 파트너를 만듭니다.
토큰 극대화의 철학
가리 탄의 말처럼, "지금 당장 토큰에 연간 10만 달러를 기꺼이 지출한다면, 당신은 2028년의 누군가가 살게 될 방식으로 살고 있는 것입니다."
이는 단순한 비유가 아닙니다. 제품 관리자는 토큰 사용을 픽셀 수준으로 최적화해야 합니다. 모든 입출력이 의미 있는지, 사용자 가치를 제공하는지를 끊임없이 질문해야 합니다.
빠른 발전 속에서 적응력이 핵심
Anthropic은 지난 1년간 4가지 모델 시리즈를 출시했지만, 올해 2분기에만 그보다 더 많은 양을 출시했습니다. 이 속도 속에서 살아남는 방법은:
- 오래된 계획에 집착하지 않기: 새로운 정보가 나타나면 즉시 적응
- 팀과의 신뢰 구축: 혼자가 아니라 함께 움직이기
- 미션과 가치에 정렬: 이를 통해 빠른 의사결정 가능
- "집단 지성"의 힘: 팀이 서로를 돕고 보완하는 문화
결론
AI 제품 관리의 미래는 토큰으로 생각하고, 평가로 정의하고, 첫 번째 원칙으로 추론 하는 PM에게 달려 있습니다. 기술이 빠르게 진화할수록, 사용자를 깊이 있게 이해하고 그 피드백을 실행 가능한 방식으로 전환할 수 있는 인재가 더욱 귀중해집니다.
지금이 AI 시대 제품 관리자의 황금기입니다. 당신의 판단력, 호기심, 그리고 근본 원칙적 사고가 세상을 바꾸는 제품을 만들 수 있습니다.
Original source: Anthropic’s first technical PM on token maxing, the jagged edge, and living in the future
powered by osmu.app