월 AI 청구서 120만 달러 — 한 스타트업이 2개월 만에 10만 달러로 되돌린 법

개요

항목 내용
주제 AI 에이전트 스타트업 폴시아(Polsia)의 폭발적 성장과 컴퓨팅 비용 위기, 오픈소스 인프라 전환으로의 극복
핵심 관점 "AI 비용은 제품이 아니라 인프라 문제다" — 성장 속도가 마진을 죽이는 구조를 어떻게 풀었는가
핵심 키워드 AI 인퍼런스 비용 · GPU 임대 · 오픈소스 모델 · 에이전트 인프라 · 토큰 소진율(Burn rate)
출처 Ben Cera 채널 영상 「I Built a $250M AI Company. The Bill is $1M a Month」 (16:35, 발화 184세그먼트 / 화면 120프레임)

핵심 메시지 3가지

① 성장이 곧 부채가 되는 구조 — 4개월 만에 48배

폴시아의 월 AI 청구서는 25,000달러 → 50만 달러 → 100만 달러(실제 약 120만 달러)로 4개월 만에 뛰었습니다. 원인은 명확합니다. 제품 안에서 일어나는 모든 액션이 곧 AI 에이전트의 토큰 소비였기 때문입니다.

"Nobody complains about AI costs until the bill gets too high."

② 해법은 모델 교체가 아니라 '일하는 방식의 재설계'

복잡한 코딩이 아니라 단순·표준화 가능한 작업이 대부분이라는 사용 패턴을 파악한 뒤, GPU 임대 + 오픈소스 모델 + 에이전트 전용 인프라로 전환했습니다. 설정에 2개월, 그 결과 6월 청구서는 약 10만 달러로 떨어졌습니다.

③ 비용 절감의 목적은 마진이 아니라 '무료 제공'

벤 세라는 절감된 비용을 가격 인하와 무료 버전으로 돌립니다. "수십억 명이 쓰려면 Anthropic으로는 불가능하다"는 판단 — 저렴하고 풍부한 지능(cheap, abundant intelligence)을 확보하는 것이 AI의 종착점이라는 논리입니다.


1. 비용 곡선 — 숫자로 읽는 4개월

시점 월 AI 청구서 근거 (화면/발화)
초기 (파리 아파트) $0 목표 화면 3:46 "$0 AI Bill" 자막
성장 초입 $25,000 영상 설명문
3월 $500,000 화면 10:12 "$500,000 AI Bill" / 발화 7:40
4월 $1,000,000 화면 10:15·10:19 "$1,000,000 AI Bill" / 발화 0:05
4월 실청구 약 $1,200,000 발화 10:38 "Actually, was more like 1.2 million"
중간 관측 $58,117 화면 5:04 "$58,117 AI Bill"
6월 (전환 후) 약 $100,000 발화 12:53 "in June my AI bill dropped to pretty much 100k"

증감 산식 - 증가 배율: 1,200,000 ÷ 25,000 = 48배 - 절감액: 1,200,000 − 100,000 = 1,100,000달러 - 절감률: 1,100,000 ÷ 1,200,000 = 약 91.7%

사용자 측 곡선도 같습니다. 3월 한 달 만에 유료 사용자 500명 → 5,000명(10배). 인프라가 먼저 무너지기 시작했고, 본인은 "trying to crumble"이라고 표현했습니다(발화 7:50).

차 안 야경 위에 "and the month after that it was $1,000,000" 자막이 얹히는 순간 — 청구서 100만 달러 돌파를 알리는 화면


2. 비용은 어디서 새는가 — 토큰 단위의 가시화

폴시아가 공개한 모니터링 화면은 "AI 비용 폭증"을 추상이 아니라 단위로 보여줍니다.

지표 수치 출처
세션 총 토큰 2,254,000 (in 1,848,000 / out 406,000) 화면 7:00 claude code · Sonnet 4.5
월간 누적 토큰 101,200,000 (101.2M) 화면 7:29 "Tokens spent"
요청 1건 비용 $0.0060 ~ $0.0282 화면 7:08 에이전트 로그 테이블
사용 모델 Opus / Sonnet (고단가 폐쇄형) 발화 3:55, 8:22

로그 한 줄이 그대로 원가입니다. tool_use +9,390 → $0.0282, summarize +5,985 → $0.0180, embeddings +2,434 → $0.0073. 작업 유형별 단가가 4배까지 벌어져 있고, 에이전트가 스스로 여러 단계를 실행할수록 이 값이 곱으로 쌓입니다.

고객 1인당 원가 추산 - 전환 전: 1,200,000 ÷ 5,000 = 월 240달러/고객 - 전환 후: 100,000 ÷ 5,000 = 월 20달러/고객

240달러는 구독료로 회수 가능한 금액이 아닙니다. 본인이 "300~500달러를 받지 않고 이 수준의 AI 서비스를 제공하는 것"이 핵심 과제라고 말한 이유가 여기에 있습니다(발화 10:45).


3. 전환의 5단계 — 무엇을 어떻게 바꿨나

① 원인 규명 — 고객 대부분은 복잡한 코딩이 아니라 단순·표준화 가능한 작업을 요청 (발화 11:44)
↓
② 제안 접수 — 4월, 동료가 "GPU를 임대하고 오픈소스 모델을 쓰자"고 제안 (발화 11:21)
↓
③ 현장 검증 — 직접 데이터센터에 가서 임대할 랙을 확인 (발화 11:36)
↓
④ 인프라 계약 — 에이전트 전용 인프라 업체와 독점 계약, 에이전트 실행에 최적화된 스택 구축 (발화 9:30~9:40)
↓
⑤ 2개월 설정 → 6월 절감 실현 — 월 10만 달러 수준 도달, 수익성·가격 인하·무료 버전 동시 확보 (발화 12:53~13:19)

전환 ③단계의 현장 — Supermicro 랙과 액체냉각 CDU, GPU 서버 모듈이 촘촘히 배치된 데이터센터 내부

여기서 중요한 것은 의사결정 순서입니다. 비용을 줄이려고 모델을 바꾼 게 아니라, "고객이 실제로 시키는 일이 무엇인가"를 먼저 쪼갰습니다. 단순 작업이 대다수라면 최고가 모델이 필요 없다는 결론이 자동으로 나옵니다. 반대로 사용량이 늘수록 요청이 더 길고 복잡해져 초기 손익분기 시도는 실패했습니다(발화 10:24).


4. 제품 정의 — '답변'이 아니라 '실행'

구분 일반 챗봇 폴시아가 지향하는 에이전트
출력 "메타 광고, 콜 아웃리치, 인플루언서, 유튜브 채널을 할 수 있습니다" "메타 광고를 시작합니다. 콜 아웃리치를 실행합니다. 채널을 만듭니다"
역할 조언자 직원 · 공동창업자 · 어시스턴트
공급자 선택 사용자가 도구 비교 여러 업체 서비스를 통합해 "작동하는 결과"만 제공
확장 욕구 아이디어 1개 아이디어 무제한 — 단 통장 잔고는 무제한이 아님

발화 14:31이 이 설계 철학을 가장 압축합니다. "여러 회사와 협력하며 가장 잘하는 곳을 고른다. 고객은 어느 회사인지 신경 쓰지 않는다. 그냥 작동하길 원한다."

실제 고객 사례도 있습니다. 아리아(Arya)는 수면 보조·금융 지원·마인드 리셋 정보를 하나로 취합해 개인화해주는 앱으로, "아주 단순한 아이디어를 넣었더니 다음 순간 다 만들어져 있었다"는 평가를 받았습니다(발화 13:34~13:43). 무료 사용이 비용을 키우는 구조라 5 크레딧 제한 같은 안전장치도 함께 도입했습니다(발화 14:28).

파리 아파트에서 시작된 개발 환경 — 창가 듀얼 모니터의 터미널·코드 창이 폴시아의 출발점


5. 성장의 부수 효과 — 마케팅과 투자

  • 펀딩 라운드를 에이전트가 직접 진행するという 스텐트가 주효했습니다. 투자자 문의가 폭주했고(발화 7:24), 프리시드 투자사 True Ventures는 SF 이전을 계속 권유했습니다(발화 4:41, 5:55).
  • 성장 수치를 공개 대시보드로 노출해 데이터룸 요구에 대응했습니다(발화 6:46).
  • 인적 네트워크가 초기 신뢰로 전환됐습니다. LA에서 7년간 Travis Kalanick과 Cloud Kitchens에서 함께 일한 인연, 정량 문제해결력과 창의성을 동시에 갖춘 인물로 평가한 동료가 초기 투자자가 됐습니다(발화 0:39, 2:20, 2:37).
  • 다만 본인은 자금의 한계를 명확히 압니다. "Cash doesn't solve anything for your product." — 숨 쉴 시간만 살 수 있었을 뿐입니다(발화 9:22).

관점 포인트

  • AI 원가는 '사용자 수'가 아니라 '액션 수'에 비례한다. 자동화 기능을 하나 추가할 때마다 에이전트 실행이 늘고 청구서가 뛴다.
  • 단가 테이블을 먼저 만들어라. 작업 유형별 토큰·비용이 4배 차이 나면, 어떤 작업을 어느 모델에 붙일지가 곧 전략이 된다.
  • 세션당 2,254,000 토큰, 그중 입력 1,848,000. 컨텍스트·프롬프트가 비용을 지배한다는 뜻이며, 표준화로 줄일 여지가 가장 큰 항목이다.
  • 모델 교체는 2개월의 설정 비용을 요구한다. 절감분 110만 달러/월과 비교하면 회수 기간은 며칠 단위다.
  • 절감의 종착점을 미리 정해두라. 폴시아는 마진이 아니라 무료 버전과 가격 인하로 방향을 고정했다.
  • 공개 지표는 신뢰 자산이다. 성장 데이터를 대시보드로 보여주는 행위는 투자자 대응과 마케팅을 동시에 해결한다.
  • 지리적 판단도 비용 구조의 일부다. "이해받을 수 있는 유일한 곳"이라는 이유로 SF로 옮긴 결정은 후속 미팅·고객 접점 비용과 직결됐다.

최종 핵심 정리

확인 질문 답
위기의 본질은? 제품 결함이 아니라 모든 액션이 고단가 모델 호출이던 비용 구조
결정적 통찰은? 고객의 요청은 단순·표준화 가능 → 최고가 모델이 불필요
실행 수단은? GPU 임대 + 오픈소스 모델 + 에이전트 전용 인프라 독점 계약
결과 수치는? 월 120만 달러 → 10만 달러, 절감률 약 91.7%, 고객당 원가 240달러 → 20달러
그 다음에 한 일은? 가격 인하 · 무료 버전 제공 · 5 크레딧 제한
방향성 판단은? 오픈소스가 폐쇄형과 경쟁하는 변곡점, 향후 10년에 1,000년치 진보 전망

한 줄 요약: AI 스타트업의 비용 위기는 "더 싼 모델"이 아니라 "고객이 실제로 시키는 일이 무엇인가"를 쪼개는 순간 풀린다 — 저렴하고 풍부한 지능을 확보한 쪽이 결국 무료화를 선언할 수 있다.