AI 코딩 벤치마크에서 하네스가 모델보다 더 큰 영향을 미친다는 연구 결과. 캐싱을 통한 40-80% 비용 절감 방법을 공개합니다.
AI 하네스가 모델 성능을 좌우하는 이유
핵심 요약
- 하네스의 영향력: 같은 AI 모델도 하네스에 따라 성능이 25% 이상 차이 난다
- 입력 토큰 지배: OpenRouter 전체 트래픽의 86-98%가 입력 토큰으로 구성
- 캐싱의 가치: 프롬프트 캐싱으로 40-80%의 비용을 절감할 수 있다
- 성능 격차: GPT-5.5는 Cursor 하네스에서 Codex보다 25.7% 포인트 높은 정확도를 기록
하네스가 모델보다 중요한 이유
Endor Labs의 연구에 따르면, 동일한 AI 모델이 서로 다른 하네스에서 극적으로 다른 성능을 보입니다. GPT-5.5는 자체 Codex 하네스에서 61.5%의 정확도를 기록했지만, Cursor 하네스에서는 87.2%를 기록했습니다. 이는 하네스만으로 25.7% 포인트의 성능 향상 을 이끌어낼 수 있다는 것을 의미합니다.
Anthropic의 Claude Opus 4.7도 마찬가지입니다. Claude Code에서 87.2%의 정확도를 기록했지만, Cursor에서는 91.1%로 상승했습니다. 놀랍게도 두 선도 모델 모두 자사가 개발한 하네스보다 경쟁사인 Cursor 하네스에서 더 높은 성능을 보였습니다.
입력 비용: 하네스가 통제하는 전장
AI 비용 구조를 보면 입력 토큰이 압도적입니다. OpenRouter의 데이터에 따르면 전체 LLM 트래픽의 86-98%가 입력 토큰 입니다. 출력 토큰이 입력 토큰보다 5배 비싸지만, 입력 토큰의 절대량이 훨씬 크기 때문에 전체 비용은 입력에 의해 결정됩니다.
이는 입력 비용을 제어하는 것이 AI 운영 비용의 대부분을 좌우한다 는 뜻입니다. 모델 자체는 이를 제어할 수 없지만, 하네스는 제어할 수 있습니다. 하네스가 어떤 컨텍스트를 모델에 보낼지 결정하기 때문입니다.
캐싱 전략으로 40-80% 비용 절감
하네스의 가장 효과적인 비용 제어 방식은 프롬프트 캐싱 입니다.
500개의 장기 에이전트 세션을 분석한 연구 결과, 지능적인 캐싱 전략으로 41-80%의 비용을 절감 할 수 있었습니다. 동시에 첫 토큰 생성 시간(time-to-first-token)도 13-31% 단축되었습니다. 이 절감 효과는 500토큰에서 50,000토큰 프롬프트까지 선형적으로 증가했습니다.
가장 효과적인 방법은 안정적인 접두사(prefix)만 캐싱하고 동적 콘텐츠를 캐시 중단점(cache breakpoint) 뒤에 배치 하는 것입니다. 이렇게 하면 쿼리마다 반복되는 공통 컨텍스트를 캐시하면서도 각 요청의 고유한 정보는 매번 새로 처리합니다.
번들된 하네스의 추가 이점
자사의 모델과 하네스를 공동 설계하면 더욱 강력한 캐싱 전략을 구현할 수 있습니다. Claude Code의 경우 실제 세션에서 약 96%의 캐시 적중률 을 달성했습니다. 더 나아가 동일 버전 사용자 간에 시스템 프롬프트 캐시를 공유하고, 포크된 하위 에이전트는 99% 바이트 동일성으로 구축하여 90%의 비용 절감 효과를 얻습니다.
하지만 중요한 점은 Cursor와 같은 제3자 하네스도 유사한 성능을 달성할 수 있다는 것입니다. 진정한 캐시 규율은 하네스 설계에 있으며, 이는 자사 개발 여부와 무관하게 구현 가능합니다.
결론
AI 성능의 미래는 모델 자체가 아니라 하네스에서 결정 됩니다. 하네스는 더 이상 단순한 모델 래퍼가 아니며, 정보 검색, 캐싱 최적화, 컨텍스트 관리를 통해 모델의 잠재력을 실제로 끌어낼 수 있는 핵심 요소가 되었습니다. 당신의 AI 애플리케이션 성능을 높이려면 모델 선택만큼 하네스 설계에도 주목해야 합니다.
Original source: Aftermarket Harnesses
powered by osmu.app