vLLM과 함께 알아보는 오픈 웨이트 모델의 부상, 추론 엔진의 역할, 그리고 오픈 소스 AI가 어떻게 산업을 변화시키고 있는지 살펴봅시다.
오픈 소스 AI가 핵심 인프라가 된 이유
핵심 요약
- vLLM의 위상: vLLM은 현재 50만 개의 GPU에서 실행되는 오픈 소스 추론 엔진으로, 데이터베이스나 운영 체제처럼 AI 인프라의 중추 역할을 수행 중
- 배포 차이의 중요성: 폐쇄형 모델이 일반/고속 두 가지 옵션만 제공하는 반면, 오픈 웨이트 모델은 공급자가 최대 10가지 속도 수준을 제공 가능
- 제어와 비용: 기업들이 오픈 웨이트 모델을 선택하는 이유는 단순 비용 절감을 넘어, 데이터 보존 정책, 성능 프로필, 보안 규정 준수에 대한 완전한 제어권 때문
- 전환점의 도래: 약 1년 전부터 많은 스타트업과 애플리케이션 회사들이 오픈 소스 위에 진정한 AI를 구축하기 시작했으며, 이는 폐쇄형 솔루션만으로는 불가능한 수준의 맞춤화를 가능하게 함
오픈 소스 AI의 역사와 변화
초기 AI 시대에는 모든 최첨단 AI 작업이 오픈 웨이트로 공개되었습니다. 하지만 계산 복잡도의 증가 로 인해 상황이 변했습니다. BERT 이전에는 ResNet 같은 모델도 일반 CPU에서 어느 정도 실행 가능했지만, BERT 이후로는 GPU 실행이 필수가 되었습니다.
vLLM은 2022년 ChatGPT 이전에 시작되었으며, 초기 목표는 느린 오픈 소스 데모를 빠르게 만드는 것이었습니다. 그러나 팀은 LLM 서비스 제공이 기존 머신러닝 워크로드와 근본적으로 다르다 는 점을 발견했습니다. GPU와 TPU에서 실행해야 하고, 입력 분포, 비결정적 출력, 배치 및 스케줄링 차이를 모두 처리해야 하기 때문입니다.
약 1년 전, 오픈 소스는 스타트업 생태계에서 중추적인 역할로 부상 했습니다. Cursor, Decagon, Harvey와 같은 혁신적인 애플리케이션 회사들은 폐쇄형 솔루션만으로는 자체 AI를 구축할 수 없다는 결론에 도달했습니다. 그들은 중간 훈련, 후처리 훈련, 추론 및 배포 기술을 개발해야 했고, 이 모든 것은 오픈 소스 위에서만 가능했습니다.
vLLM의 핵심적 역할과 "제로데이 모델 릴리스"
vLLM은 1,000개 이상의 모델 아키텍처를 지원하며, "제로데이 모델 릴리스" 라는 독특한 프로세스를 수행합니다. 이는 새로운 모델 아키텍처가 출시되면 vLLM이 즉시 그것을 온라인으로 가져올 수 있다는 의미입니다.
이 과정에서 NVIDIA, AMD, Google, Amazon, Intel과 같은 하드웨어 공급업체들과의 광범위한 협력 이 이루어집니다. 이들 회사는 자신들의 최신 칩이 최적으로 작동하는지 확인하기 위해 vLLM을 벤치마크로 자주 사용합니다. 예를 들어, Mistral이 첫 모델을 출시했을 때 커뮤니티가 이를 실행하려 할 때, vLLM 팀은 인프라 지원을 통합하여 모든 사람이 쉽게 재사용할 수 있도록 했습니다.
오픈 웨이트 채택을 이끄는 비용과 제어
초기에는 폐쇄형 모델의 높은 비용 이 오픈 웨이트 채택의 주요 동인이었습니다. 그러나 최근에는 상황이 변했습니다. 기업들이 높은 토큰 지출을 관리하려면서 비용이 점점 더 중요해진 것도 사실이지만, 제어 가 더 근본적인 이슈입니다.
기업들은 음성 에이전트의 응답 시간 같은 성능 지표를 직접 관리하고 싶어합니다. 이는 자체 모델을 운영할 때만 가능합니다. 폐쇄형 API는 예기치 않은 다운타임이나 계약 위반에 취약하기 때문입니다. 오픈 웨이트 모델의 경우, 사용자는 다음을 제어할 수 있습니다:
- 성능 프로필: 폐쇄형 모델의 일반/고속 모드 대신, 공급자가 초당 400-500 토큰에 이르는 최대 10가지 속도 수준 제공 가능
- 데이터 보존 정책: 많은 폐쇄형 모델과 달리, 데이터가 서버에 남지 않도록 제어
- 보안과 규정 준수: 완전한 감시권을 통해 인프라 요구사항 충족
오픈 소스 모델의 지속 가능성과 경제적 인센티브
오픈 소스 AI와 전통적인 오픈 소스 소프트웨어는 근본적으로 다릅니다. 오픈 소스 소프트웨어는 개인의 기부 시간에 의존할 수 있지만, AI 모델 훈련에는 수백만 또는 수십억 달러의 컴퓨팅 자원 이 필요합니다. 따라서 경제적 인센티브가 필수적입니다.
최근 여러 모델 연구소들이 라이선스 조건을 강화하고 있습니다. Meta의 Llama 출시 시에는 일일 활성 사용자 수나 연간 반복 매출이 임계값을 초과하면 상업 계약을 체결해야 한다는 조건이 있었습니다. Minimax의 M2.7과 Kimi K3 모델도 유사한 조건을 통해 생태계의 건전한 발전 을 도모하고 있습니다.
이는 탐욕이 아닌 지속 가능성의 문제 입니다. 초기 자본 지출, 반복된 실패와 재훈련 비용, 다음 프로젝트 진행을 위한 자금은 어디서 올까요? 신약 개발 산업처럼, AI 모델 훈련의 R&D도 적절히 자금을 지원받고 지속 가능해야 합니다.
안전장치(Guardrails)와 오픈 웨이트의 유리성
폐쇄형 모델의 안전장치는 다소 자의적이며 시행하기 어렵습니다. 이로 인해 많은 오탐(false positives)이 발생 하여 합법적인 사용 사례까지 차단됩니다. 예를 들어, GPU 커널 연구 중 유효하지 않은 메모리 접근 오류도 "레드 라인"을 촉발할 수 있습니다. 결과적으로 많은 인프라 개발자들이 더 합리적인 안전장치를 갖춘 오픈 웨이트 모델을 선호하고 있습니다.
중재 문제가 완전히 해결되지 않는다면, 미래에는 신뢰할 수 있는 사용 사례를 위해 사람들이 기본적으로 오픈 웨이트 모델을 선택 할 것입니다. 왜냐하면 그곳에서 안전장치를 직접 제어할 수 있고, 특정 요구에 맞게 조정할 수 있기 때문입니다.
추론 엔진의 미래와 협력의 중요성
지난 18개월 동안 추론은 훨씬 복잡해졌습니다. 모델의 규모와 다양성이 증가했고, 장기 실행 에이전트도 등장했기 때문입니다. 이로 인해 오픈 소스 개발은 선택이 아닌 필수 가 되었습니다. 거대한 모델을 실행하고, 최대 효율을 위해 최적화하며, 수많은 사용 사례에서 신뢰성을 보장하려면 대규모의 협력이 필요합니다.
OpenRouter와 Ollama 같은 기업들과 Hugging Face 같은 플랫폼은 이 생태계의 중요한 파트너로서, 모든 사람을 위해 AI 모델의 유용성과 접근성을 향상시키고 있습니다.
5년 후 오픈 웨이트의 미래
5년 후 오픈 웨이트 모델이 폐쇄형 모델과의 능력 격차를 좁힐 것인가? 핵심은 능력이 아니라 배포 전략과 시장 진출 방식 입니다. 현재도 능력 측면에서는 큰 격차를 보지 못합니다.
차이를 만드는 것은 데이터와 환경 입니다. 누가 어떤 데이터를 얻고, 모델이 스스로 개선될 수 있도록 어떤 종류의 환경을 구축하는지가 중요합니다. 예를 들어, Kimi K3는 프론트엔드 코딩 벤치마크를 통해 뛰어난 능력을 입증했습니다.
내년은 오픈 웨이트 모델 연구소들이 어떻게 차별화하고, 재귀적 자기 개선을 통해 모델을 실제 세계에 적용할지 가 모든 것입니다. 전 세계 어디에나 뛰어난 연구자들이 있으며, 그들은 흥미로운 문제에 매력을 느낍니다. 오픈 소스는 이들이 서로에게 배우고, 각 플레이어의 위치를 파악하며, 서로의 어깨 위에 서서 더 빠르게 발전할 수 있는 경주 트랙을 만들어줍니다.
결론
오픈 소스 AI는 단순한 기술 트렌드가 아니라 AI 인프라의 중추 가 되었습니다. vLLM과 같은 추론 엔진, 오픈 웨이트 모델, 그리고 이를 지원하는 생태계는 기업들이 자신의 AI 시스템을 완전히 제어하고 맞춤화할 수 있는 방법을 제공합니다. 비용과 제어, 안전장치와 유연성을 원하는 모든 조직에게 오픈 소스 기반은 이제 선택이 아닌 필수입니다. 전 세계의 뛰어난 연구자들이 협력할 때, 진정한 혁신이 가능합니다.
Original source: How Open Source Became AI's Backbone | Inferact with a16z
powered by osmu.app