Ollama CEO가 밝히는 오픈 모델 혁명: 기업의 80-90% AI 토큰이 오픈소스로 전환, 로컬·클라우드 하이브리드 시대 도래
오픈 소스 AI 모델이 기업 비용을 급락시키는 이유
핵심 요약
- 비용 붕괴: 기업의 80-90% AI 토큰이 오픈 모델로 처리되며 AI 비용이 급격히 감소 중
- 기업 도입 확대: AT&T가 이미 토큰 소비량의 40%를 오픈 모델로 전환, 포춘 500대 기업의 85%가 Ollama 사용
- 로컬·클라우드 하이브리드: MacBook과 고사양 GPU에서 200억~1200억 매개변수 모델을 효과적으로 실행 가능
- 코딩 에이전트 주도 성장: OpenClaw, Hermes 같은 협업 도구가 토큰 사용량을 150배 증가시킴
- 효율성 중심 경쟁: DeepSeek Flash 같은 저비용 모델이 대부분의 작업(80%)을 충분히 처리
오픈 모델이 기업을 점령하다
기업들이 OpenAI, Anthropic 같은 폐쇄형 모델 제공업체에서 오픈소스 모델로 빠르게 전환하고 있다. Ollama의 데이터에 따르면, 현재 기업은 AI 예산의 10-20%만 오픈 모델에 할당하면서도 처리하는 토큰의 80-90%는 오픈 모델을 통해 이루어진다. 이는 오픈 모델이 비용 측면에서 경쟁력 있음을 의미한다.
AT&T는 이미 토큰 소비량의 40%를 오픈 모델로 전환했으며, 미국과 독일의 모델을 평가 중이다. 동시에 포춘 500대 기업의 85%가 Ollama를 도입하면서, 오픈 모델 채택은 더 이상 선택이 아닌 필수 가 되고 있다.
코딩 에이전트와 협업 도구가 변수
토큰 사용량의 급증을 주도하는 것은 코딩 에이전트와 AI 협업 도구 다. 3월부터 4월에 걸쳐 OpenClaw와 Hermes 같은 프로젝트가 급부상했으며, Ollama 클라우드의 데이터에서 이 변화가 명확히 드러난다.
연초 이후 전체 토큰 사용량은 약 150배 증가 했다. 초기에는 1500만 토큰 수준이었지만, 코딩 에이전트의 확산으로 현재는 수십억 개 수준에 도달했다. 이는 오픈 모델의 컨텍스트 윈도우가 128K에서 100만 이상으로 확장 되면서 가능해졌다. 개발자뿐 아니라 금융, 지원, 마케팅, 영업팀도 이러한 도구를 활용해 반복적인 업무를 자동화할 수 있게 됐다.
로컬 실행과 클라우드의 경계가 흐려진다
하드웨어의 발전으로 로컬 모델 실행이 다시 주목받고 있다. Apple Silicon은 MacBook에서 Llama 같은 중간 규모 모델(20억40억 매개변수)을 효율적으로 실행할 수 있으며, Nvidia의 새로운 워크스테이션 GPU는 책상 위에서 **200억1200억 매개변수 모델을 빠르게 실행** 할 수 있다.
로컬 모델과 클라우드 호스팅 모델은 역할 분담을 하고 있다:
- 로컬 실행: 문서 처리, 간단한 자동화 같은 낮은 지연시간이 필요한 작업. 이미 구매한 하드웨어에서 사실상 무료로 실행 가능
- 클라우드 호스팅: 복잡한 코딩 에이전트, 다중 추론 단계가 필요한 어려운 문제
현재 로컬에서는 미국·중국·유럽 모델이 고르게 혼합되어 사용되지만, 클라우드에서는 중국 모델(DeepSeek 등)이 지배적(사용량의 거의 100%)이다.
비용 효율성이 모든 것을 바꾼다
가장 주목할 점은 DeepSeek Flash 같은 초저비용 모델의 부상 이다. 이들은 전체 작업의 80%에 충분히 좋으면서도 매우 빠르고 저렴하다. 이는 기업이 토큰 사용량에 대해 걱정 없이 더 많이 소비할 수 있게 해준다.
오픈 모델의 미래는 "만능 모델(god model)"이 아닌 다양한 크기와 용도의 모델 조합 으로 진화하고 있다. 복잡한 작업은 최첨단 모델로, 일상적인 작업은 소형·효율적 모델로 처리하는 하이브리드 접근이 표준이 되고 있다. 이는 법률사무소에서 파트너 변호사가 어소시에이트 변호사에게 업무를 위임하는 것과 유사하다.
결론
오픈 모델은 단순히 비용을 줄이는 것을 넘어, 기업에 AI에 대한 통제권과 맞춤화 능력 을 제공한다. 로컬·클라우드 하이브리드 실행, 초저비용 모델의 확산, 그리고 코딩 에이전트 같은 새로운 사용 사례가 결합되면서 오픈 모델은 더 이상 취미 프로젝트가 아닌 기업 IT 인프라의 핵심 이 되고 있다.
Original source: Open Models Are Collapsing The Cost Of AI
powered by osmu.app