YC 데이터 클럽에서 논의된 AI 발전의 병목현상. 전문가 데이터와 감독 확장이 모델보다 중요한 이유를 알아보세요.
AI 시대 데이터의 진정한 가치: 전문가 감독이 핵심
핵심 요약
- 데이터는 AI 발전의 가장 큰 병목현상: 아키텍처나 GPU가 아닌 고품질 전문가 데이터 부족이 진정한 제약
- 프로덕션 AI의 우선순위 재편: 모델에 95% 투자하던 학계와 달리, 테슬라는 데이터에 75%를 할애
- 데이터 시장의 급성장: 2016년 회의론에도 불구하고 현재 1,000억 달러 이상의 시가총액 창출
- 전문가 확장의 중요성: 의사, 변호사, 회계사 등 전문가의 지식을 소프트웨어로 인코딩하는 것이 핵심
- 데이터 2.0으로의 전환: 단순 라벨링에서 에이전트 환경과 검증 메커니즘으로 진화
데이터가 AI 성능을 결정한다
2016년 기계학습 커뮤니티는 "데이터는 상품(commodity)이다"고 믿었습니다. ImageNet과 같은 대규모 데이터셋을 다운로드한 후에는 추가 데이터가 필요 없다는 생각이 일반적이었습니다. 당시 Scale AI가 10억 달러로 평가받는 것에 대해 대부분의 벤처캐피탈리스트는 "데이터 비즈니스의 최종 가치는 0"이라고 예측했습니다.
하지만 지난 10년간 현실은 이를 완전히 뒤집었습니다. 데이터 부문은 1,000억 달러 이상의 시가총액 을 창출했으며, Y 콤비네이터의 가장 성공적인 투자 분야 중 하나가 되었습니다.
학계와 산업의 우선순위도 근본적으로 달라졌습니다. 박사 과정 학생들은 시간의 95%를 모델과 알고리즘에, 5%만을 데이터셋에 투자합니다. 반면 테슬라와 같은 프로덕션 AI 기업은 이를 역전시켜 75%를 데이터에, 25%를 모델에 할애합니다.
성능 개선의 진정한 원인: 데이터 분석
채용 면접에서 심층학습 직무 지원자들에게 "F1 점수를 85%에서 개선하려면 어떻게 할 것인가?"라고 묻곤 합니다. 많은 지원자는 모델 아키텍처를 단순히 조정하는 방법(ReLU 대신 GeLU 사용, 더 많은 레이어 추가)을 제안합니다. 이들은 즉시 탈락합니다.
올바른 접근법은 데이터를 면밀히 분석하는 것입니다. 오탐(false positives)과 미탐(false negatives)을 분류하여 근본적인 문제를 식별해야 합니다. 예를 들어, "재고 있음/재고 없음" 감지 시스템의 성능 저조는 모델 결함이 아니라 냉장고의 김 서림이나 사람이 시야를 가리는 문제 일 수 있습니다.
안드레이 카르파티의 ImageNet 연구는 이를 잘 보여줍니다. 그는 이미지를 수동으로 분석하여 인간 기준선을 설정했고, 사람들도 다양한 품종의 개를 구분하는 것과 같은 미묘한 분류에서 어려움을 겪는다는 것을 발견했습니다. 이는 아무리 고급 모델을 사용해도 훈련 데이터의 품질과 정확성 이 가장 중요함을 보여줍니다.
현재 프로덕션 AI에서는 아키텍처가 매우 표현력이 뛰어나기 때문에 데이터 자체가 전체 노력의 약 97%를 차지 할 수 있습니다.
훈련 데이터와 실제 데이터의 격차
"테스트 분포"는 항상 "훈련 분포"보다 훨씬 복잡합니다. 깨끗한 훈련 이미지로 학습한 모델도 실제 프로덕션 환경의 지저분하고 예측 불가능한 데이터를 만나면 실패합니다.
경제를 자동화하려면 "전문가 데이터"와 "전문가 RL 환경" 모두 가 필요합니다. 일부 작업은 "자동으로 검증 가능"합니다(단위 테스트, 수학 문제, 게임). 하지만 많은 중요한 작업은 "자동으로 검증 불가능"합니다(디자인, 의료 진단, 법률 판단).
후자의 작업들은 주관적인 인간의 선호도와 전문 지식에 의존하며, 인간 전문가들조차 의견이 항상 일치하지 않을 수 있습니다.
데이터는 지속적인 제품, 불변의 자산이 아니다
"데이터셋/RL 환경은 .zip 파일이 아니라 제품"입니다. 이는 상당한 장인정신과 지속적인 개발이 필요함을 의미합니다.
세일즈포스의 예를 들면, 수십억 시간의 사용자 상호작용 데이터를 축적해도 UI 변경만으로 모든 데이터가 쓸모없어질 수 있습니다. 새로운 데이터 수집이 필요합니다. 이러한 신선한 데이터에 대한 끊임없는 필요성은 데이터 비즈니스의 장기적 가치를 증명합니다.
전문가 데이터가 AI 발전의 병목현상
현재 AI 발전의 주요 제약 요인은 아키텍처 혁신, GPU 성능, 또는 에너지 소비가 아닙니다. 포괄적인 전문가 데이터와 이를 효과적으로 사용할 환경의 부족 이 진정한 문제입니다.
AI 모델이 S&P 500 수익률 예측에서 무작위 확률을 능가하지 못하는 이유는 트레이더의 전문 인간 데이터가 부족하기 때문입니다. 동일한 원칙이 회계사, 의사, 변호사에게도 적용됩니다. 이러한 분야에서 인간 수준 이상의 AI 역량을 달성하려면 전문화된 전문가 데이터가 필수적입니다.
LLM과 스마트폰 앱의 유사성
"스마트폰에 앱이 있듯이, LLM에는 데이터가 있습니다." 스마트폰의 유용성이 인스타카트, 도어대시, 우버, 손전등, 지도 같은 수많은 앱에서 비롯되는 것처럼, LLM도 회계사, 변호사, 의사, 목수, 패션 디자이너가 큐레이션한 전문 데이터 로부터 능력을 얻습니다.
애플이 모든 플랫폼에 대해 별도의 인스타카트를 만들 필요가 없듯이, 앤트로픽, 오픈AI, 구글, 애플 같은 거대 모델 회사가 모두 의료 AI를 직접 만들려는 것은 비효율적입니다. 대신, 한 회사가 의료 네트워크와 특정 환자 데이터를 잘 관리하여 AI 환경을 구축하는 데 집중하는 것이 현실적입니다.
결론
2026년 현재 AI 발전의 가장 큰 도전은 더 강력한 모델을 만드는 것이 아니라, 전문가의 지식과 판단을 확장 가능한 형태로 인코딩하는 것 입니다. 데이터는 더 이상 상품이 아닙니다. 지속적인 개발과 전문가의 감독이 필요한 핵심 경쟁 자산 입니다.
Original source: Going In Deep On Data | YC Paper Club
powered by osmu.app