“토큰값은 떨어져도 비용은 늘어” AI 고도화가 부른 효율 경쟁, 토큰 관리 역량이 ‘무기’ 된다
입력
수정
LLM 토큰 가격 하락세에도 비용 부담 오히려 가중돼 AI 사용 확대에 속도 내던 기업들, 통제적 노선으로 선회 AI 에이전트 확산으로 비용 관리 필요성 나날이 커져

인공지능(AI) 모델 이용 시 지불하는 토큰 가격이 사상 최저 수준으로 떨어졌다. 중국 AI 업체들의 저가 공세와 글로벌 빅테크 간 가격 경쟁이 격화하면서 단위당 이용료가 빠르게 낮아진 것이다. 다만 고성능 모델과 AI 에이전트의 확산으로 절대적인 토큰 소비량과 모델 호출 횟수가 급증한 만큼, 기업들의 실제 AI 운용비는 오히려 늘어날 가능성이 커지고 있다. 이에 시장에서는 단순한 사용량 확대보다 토큰 효율을 높이는 비용 관리 역량이 AI 도입 경쟁력의 핵심으로 부상하는 추세다.
AI 토큰 비용 '하향곡선'
28일 시장조사업체 실리콘데이터에 따르면, 지난달 31일(이하 현지시각) 실리콘데이터 거대언어모델(LLM) 토큰 지출 지수는 100만 토큰당 97센트(약 1,320원)까지 떨어졌다. 이는 지난해 말 지수 발표 이후 최저치이자, 올여름 기록했던 최고점 대비 절반 이하로 하락한 수준이다. LLM 토큰 지출 지수는 단순한 업체별 단가가 아니라, 실제 시장에서 소비되는 100만 토큰당 가중 평균 가격을 측정하는 지표다. 토큰은 AI가 사용자의 질문이나 문장, 이미지 등의 정보를 처리하기 위해 잘게 나눈 기본 단위로, AI 서비스 이용이 많아지고 처리해야 할 작업이 복잡해질수록 일반적으로 소비량이 늘어난다.
토큰 가격 하락세를 견인한 것은 중국 AI 업체들의 저가 공세였다. 문샷AI의 '키미 K3' 등 중국산 오픈소스 모델들이 낮은 가격과 준수한 성능을 앞세워 글로벌 시장 영향력을 확대하자, 미국의 주요 AI 기업들도 잇달아 가격 인하에 나서는 모습이다. 일례로 오픈AI는 지난 7월 GPT-5.6 '테라'와 '루나'의 애플리케이션 프로그래밍 인터페이스(API) 가격을 각각 20%, 80% 낮췄고, 8월에는 '솔'의 가격도 20% 내려 잡았다. 구글도 지난달 '제미나이 3.7 플래시'를 이전 모델의 절반 수준인 100만 토큰당 입력 0.75달러(약 1,020원), 출력 3.75달러(약 5,100원)에 선보였다.
토큰 사용량 증가세 가팔라
다만 이러한 가격 하락이 곧장 AI 비용 감소로 이어지지는 않았다. 최근 출시되는 고성능 AI 모델은 고난도 문제를 해결하기 위해 더 긴 추론 과정을 거치는 것이 대부분이며, 자율형 AI 에이전트 역시 하나의 업무를 수행하는 도중 수많은 모델 호출과 검증을 반복한다. 토큰 사용량 증가 속도가 토큰 가격 하락 속도를 뛰어넘으며 오히려 비용 부담이 가중될 수 있는 구조다.
일례로 앤트로픽의 최신 모델 '클로드 페이블 5.1'의 경우, 입력·출력 가격을 이전 모델인 '페이블 5'와 같은 100만 토큰당 10달러(약 1만3,600원), 50달러(약 6만8,020원)로 유지하면서 캐시 읽기 가격은 1달러(약 1,360원)에서 0.25달러(약 340원)로 75% 낮췄다. 그러나 아티피셜 애널리시스 종합 지능 지수(AAII)에서 페이블 5.1의 최대 노력(Max) 기준 작업당 비용은 3.69달러(약 5,020원)로, 페이블 5의 3.14달러(약 4,270원)보다 18% 높았다. 이는 페이블 5.1이 보다 높은 성능을 구현하기 위해 이전 모델 대비 약 1.7배 많은 출력 토큰을 사용했기 때문이다.
이 같은 토큰 비용 증가 흐름은 향후 한층 가속화할 것으로 보인다. 지난 16일 화웨이는 연구 보고서 '인텔리전트 월드 2035: 비전을 행동으로 전환하기'를 공개하고, 2035년 전 세계 연간 토큰 소비량이 현재보다 10만 배 폭증할 것이라 내다봤다. AI 에이전트 중심의 인터넷 환경이 기존 애플리케이션 중심의 인터넷과 다른 방식으로 컴퓨팅·네트워크 수요를 확대할 수 있다는 진단이다. 시장조사업체 가트너 역시 2028년까지 에이전트형 AI의 워크플로당 추론 비용이 기본적인 챗봇 상호작용의 5배 이상에 이를 것으로 전망했다.
기업들의 초기 AI 도입 전략
기업들은 토큰 비용 구조 변화를 고려해 AI 운용 전략을 속속 수정해 나가고 있다. 생성형 AI 등장 초기까지만 해도 기업들은 AI 비용 효율보다 사용량 확대에 초점을 맞췄다. AI가 실제 업무에 얼마나 도움이 될지를 검증해야 하는 시기였던 만큼, 직원들의 AI 활용도 제고 및 내부 AI 사용 습관 정착이 우선 과제로 여겨진 것이다. 이와 관련해 한 시장 전문가는 "생성형 AI가 본격적인 생산 도구로 자리 잡기 전에는 토큰 비용이나 모델별 단가를 세밀하게 따질 필요가 없었다"며 "조직 전반에서 AI 활용 사례를 최대한 빠르게 늘리고 반복 사용을 유도해 '혁신'을 이끌어내는 것이 기업들의 주요 목표였기 때문"이라고 짚었다.
실제 아마존·마이크로소프트·쇼피파이·액센츄어 등 일부 기업은 과거 직원들의 AI 활용도를 업무 지표 및 인사 평가에 반영하거나, 사용량 순위표와 인센티브 제도를 운영하는 등 적극적인 AI 사용을 장려한 바 있다. 스페인의 대형 은행 BBVA는 직원 3,000명에게 챗GPT 엔터프라이즈 라이선스를 제공하고 다양한 맞춤형 GPT 제작을 독려하기도 했다. 미국 최대 건강보험사 중 하나인 유나이티드헬스그룹 산하 의료 서비스·헬스케어 IT 기업 옵텀 역시 일부 직원들이 챗GPT나 마이크로소프트(MS) 코파일럿을 하루 한 차례 이상 사용하는지 추적하며 AI 사용 빈도를 직접 관리했다.
표1. 산업계의 AI 운용 전략 변화
| 구분 | AI 도입 초기 | 최근 |
|---|---|---|
| 운영 목표 | 직원의 AI 활용 확대, 업무 적용 사례 발굴 | 생산성 대비 토큰 비용 최적화 |
| 사용 관리 | 활용 빈도 추적, 사용량 순위·인센티브 운영 | 직원별 사용 한도 설정, 불필요·중복 호출 억제 |
| 모델 선택 | 성능 중심의 고사양 모델 활용 | 업무 난도에 따른 저비용·고성능 모델 선별 |
| 비용 통제 | AI 사용 습관 정착을 위한 적극적인 예산 집행 | 작업 성과·프롬프트·토큰 비용을 연계한 효율 관리 |
| 시스템 구축 | 직원이 직접 모델과 활용 방식을 선택 | 업무 복잡도에 따라 적정 모델을 자동 배정 |
비용 절감 전략에 힘 실려
하지만 최근 들어 기업들은 AI 토큰 소모를 무작정 확대하기보다 투입 비용을 효율화하는 방향으로 움직이고 있다. 실제 우버는 올해 AI 코딩 예산을 4개월 만에 모두 소진하자 직원 1명당 AI 모델 월 사용액을 1,500달러(약 204만원)로 제한했다. 월마트도 직원들에게 간단한 업무에는 상대적으로 저렴한 모델을 사용하도록 지시하고, 여러 직원이 동일한 질문이나 업무를 중복 입력해 발생하는 비용을 줄이는 시스템을 도입했다. 아마존은 AI 활용을 독려하기 위해 운영하던 임직원 사용량 순위표를 폐지했다. 직원들이 순위 경쟁에 매몰돼 불필요한 작업에도 AI를 사용하는 것을 막기 위한 조치다.
이 밖에도 미국 인사관리 소프트웨어 업체 리플링은 업무 결과물, 프롬프트 수, 토큰 비용 등을 함께 비교하는 'AI 스펜드 콘솔'을 구축하고, 작업 난도에 따라 적절한 가격대의 모델을 자동 선택하는 AI 게이트웨이를 도입했다. 미국 데이터·AI 플랫폼 기업 데이터브릭스는 단순히 직원별 사용 한도를 설정하는 대신 업무 난도에 맞춰 모델 자체를 바꾸는 방식을 채택했다. 내부 시험에서 중국 Z.ai의 오픈웨이트 모델 'GLM 5.2'가 앤트로픽의 고성능 모델 '클로드 오푸스 4.8'과 통계적으로 유사한 수준의 작업 성능을 기록하자, GLM 계열 모델을 개발자 업무에 확대 적용함과 동시에 업무 복잡도를 판별해 적절한 모델을 자동 선택하는 '스마트 라우팅' 체계를 도입한 것이다. 데이터브릭스 테스트상 GLM 5.2의 작업당 비용은 1.28달러(약 1,741원)로 오푸스 4.8의 1.94달러(약 2,639원)보다 약 34% 낮았다.
‘토큰 효율화’ 기술 부상
향후 효율적 토큰 활용 역량은 한층 중요도가 높아질 것으로 전망된다. AI 에이전트 등의 확산과 함께 AI 비용 관리 필요성이 나날이 커지고 있기 때문이다. 현시점 대표적인 토큰 소비량 효율화 방법으로는 프롬프트·컨텍스트 캐싱 등을 통한 모델 호출 및 반복 연산 최소화가 꼽힌다. 시스템 프롬프트, 긴 문서, 대화 이력처럼 반복적으로 사용되는 입력을 매번 처음부터 처리하지 않고 이전에 계산한 결과를 재사용하는 것이다. 모델 호출 자체를 생략하는 방식도 있다. AI 게이트웨이 사업자들은 △동일한 요청에 과거 응답을 바로 반환하는 인메모리 캐시 △여러 서버가 공유하는 Redis 캐시 △표현이 달라도 의미가 비슷한 질문을 판별해 기존 답변을 재사용하는 시맨틱 캐시 등을 활용한다. 이 경우 모델 API를 호출하지 않기 때문에 해당 요청에 대한 토큰 비용이 아예 발생하지 않는다.
프롬프트·컨텍스트 압축도 주요 비용 절감 수단이다. △긴 문서나 대화 이력 요약 △중요도가 낮은 문장과 토큰 제거 △검색증강생성(RAG)을 통해 질의와 관련성이 높은 부분 선별 등의 조치를 통해 입력 토큰 수 자체를 줄이는 형태다. 이러한 구조를 구현한 대표적인 사례가 MS 리서치의 LLMLingua다. LLMLingua는 소형 언어모델을 이용해 입력 토큰의 중요도를 평가한 뒤 불필요한 부분을 제거하는 방식으로 운용되며, 프롬프트를 최대 20배 압축하면서도 성능 손실을 1.5%포인트 수준으로 제한한 것이 특징이다.