2026년 AI 토큰 시장이 비용·속도·정확도에 따라 세분화되면서, 1년 된 오픈소스 모델도 최신 모델과 경쟁하는 현황을 분석합니다.
AI 추론 시장의 세분화: 다양한 모델이 공존하는 이유
핵심 요약
- 토큰 시장의 세분화: OpenRouter 데이터에 따르면, 1년 된 GPT-OSS-120b가 Claude Opus 4.8 일일 토큰 볼륨의 36%를 처리하고 있으며, GLM 5.2는 4950억 토큰으로 선두를 차지
- 크기·출처·아키텍처의 다양성: AI 모델은 용도에 따라 소형·중형·대형으로 구분되고, 밀집형 또는 희소형(MoE) 아키텍처로 나뉨
- MoE 아키텍처의 혁신: 1180억 매개변수를 가진 Laguna S 2.1이 260억 매개변수 모델과 동일한 디코딩 비용으로 작동하며, 도구 호출 실패율 7%포인트 감소 달성
- 경쟁으로 인한 다양화: Anthropic이 Opus 5를 출시하고, Poolside가 Laguna S 2.1을 선보이는 등 중간 모델 시장이 확대 중
토큰 시장이 세분화된 배경
AI 추론 시장은 단순히 "더 크고 더 좋은" 모델을 추구하던 시대에서 벗어났습니다. 비용, 속도, 정확도 라는 세 가지 축에 따라 세분화되고 있습니다.
OpenRouter의 일일 토큰 처리량을 보면 이를 분명히 알 수 있습니다. GLM 5.2가 4950억 토큰으로 선두를 달리고 있으며, Claude Opus 4.8은 1996억 토큰을 처리합니다. 놀랍게도 2025년 8월에 출시된 1년 된 GPT-OSS-120b는 여전히 713억 토큰으로 Opus의 약 36%를 차지 하고 있습니다. 이는 최신 모델이 모든 용도에 필요하지 않다는 뜻입니다.
다양한 선택지가 생기는 이유
모델의 차이는 크기뿐만 아니라 여러 차원에서 나타납니다:
- 크기: 소형(26B), 중형(118B), 대형(200B+)
- 출처: OpenAI, Anthropic 등 미국 모델과 GLM 등 중국 모델
- 아키텍처: 모든 매개변수가 활성화되는 밀집형과 필요한 매개변수만 활성화하는 MoE(Mixture-of-Experts) 희소형
- 정확도: 코딩 특화 또는 일반 목적
- 속도: 초당 토큰 생성 속도
- 모달리티: 텍스트 전용 또는 비전 포함
이러한 다양성 때문에 사용자들이 자신의 필요에 맞는 모델을 선택할 수 있게 되었습니다.
MoE 아키텍처가 바꾼 로컬 세그먼트
가장 주목할 만한 변화는 MoE(Mixture-of-Experts) 아키텍처의 등장 입니다. 필자는 주말에 에이전트를 구동하는 모델을 Gemma 4 26B에서 Laguna S 2.1(118억 매개변수)로 교체했습니다.
예상상으로는 더 큰 모델이 더 느려야 하지만, 실제로는 M5 Max에서 두 모델 모두 동일한 속도로 생성됩니다. 이는 Laguna가 MoE 아키텍처를 사용하기 때문입니다. 118억 개의 매개변수가 메모리에 있지만, 토큰당 80억 개만 활성화되므로, 결과적으로 118억 매개변수 모델이 260억 매개변수 모델과 동일한 디코딩 비용으로 작동 합니다.
실제 성능에서도 차이가 나타났습니다. 필자의 로컬 코딩 및 이메일 에이전트에서 도구 호출 실패율을 측정한 결과, Laguna S 2.1은 Gemma 4 26B (27.1%)보다 20.1%의 실패율을 기록해 약 7%포인트 개선 되었습니다.
경쟁이 세분화를 가속화하는 중
최근 경쟁이 모델 다양성을 더욱 가속화하고 있습니다. Anthropic은 Opus 5를 반값의 저가형 모델로 출시 했으며, Poolside는 Laguna S 2.1이라는 중간 모델을 선보였습니다. 이는 각 가격대와 성능대별로 경쟁이 치열해지고 있음을 의미합니다.
결론
AI 추론 시장의 세분화는 건강한 경쟁 시장의 신호입니다. 더 이상 모든 토큰을 최고 사양의 모델로 처리할 필요가 없으며, 로컬 노트북 세그먼트는 훨씬 더 높은 수준의 품질을 제공 할 수 있게 되었습니다. 이는 경쟁이 필연적으로 이끌어갈 미래의 방향입니다.
Original source: Yeltsin in the AI Aisle
powered by osmu.app