월 청구서 120만 달러까지 가본 AI 스타트업 대표가, 6주 만에 10만 달러로 낮추기까지
개요
- 주제: AI 에이전트를 핵심 제품으로 만드는 스타트업이 '토큰 비용'이라는 구조적 함정에 빠졌다가, 오픈소스 모델 + 자체 GPU 임대로 빠져나온 실사례
- 핵심 관점: AI 비용은 "아끼면 해결되는 항목"이 아니라 제품 아키텍처를 바꿔야 해결되는 항목이다
- 핵심 키워드: AI 인퍼런스 비용 · 에이전트 토큰 소진 · 오픈소스 모델 전환 · GPU 임대 · 마진 구조 · 스케일링 이전 비용 설계
핵심 메시지 3가지
① 성장은 비용을 선형으로 올리지 않는다 — "모든 액션 = 에이전트 1회 호출"
Polsia는 사용자가 무언가를 만들 때마다 그 안의 작업이 전부 AI 에이전트 호출로 처리되는 구조였다. 기능이 하나 추가될 때마다(고객지원 에이전트, Meta Ads 자동화) 호출 횟수가 곱으로 늘었다.
"매번 Polsia 안에서 뭔가가 일어날 때마다, AI 에이전트가 대부분 Opus나 Sonnet 같은 아주 비싼 모델로 작업을 수행한다. 그래서 청구서가 계속 올라갔다."
② 펀딩은 문제를 해결하지 않는다 — "현금은 제품 문제를 해결하지 못한다"
투자 라운드를 통해 확보한 자금은 비용 문제를 없애는 게 아니라 시간을 사는 것에 불과했다. 대표 본인이 "Cash doesn't solve anything for your product. In this case, it helped me with some breathing room"이라고 정리한다.
③ "수십억 명이 쓰는 제품"과 "최상위 폐쇄형 모델"은 양립 불가
가격을 내려 대중화하려면 모델 단가를 내려야 하고, 그 선택지는 Anthropic 라인업 밖에만 있었다.
"Polsia를 수십억 명이 쓰게 하고 아이콘이 되는 회사로 만들고 싶다. 그러려면 가격을 낮춰야 하는데, Anthropic을 써서는 그걸 할 수 없다."
1. 비용은 이렇게 올랐다 — 청구서 타임라인

| 단계 | 시점 | AI 월 청구서 | 근거 발화/표기 |
|---|---|---|---|
| ① 출발 | 파리 아파트 개발기 | $0 | 화면 자막 "$ 0 AI Bill" |
| ② 초기 과금 | 출시 직후 | $25,000 | 영상 설명문 |
| ③ 점화 | 3월 | $58,117 | 화면 자막 "$58,117 AI Bill" |
| ④ 급등 | 3월 말 | $500,000 | "And my AI cost went up to $500,000" |
| ⑤ 경보 | 4월 | $1,000,000+ 추세 | "It's trending towards going to a million dollars plus a month" |
| ⑥ 정점 | 최고 월 | $1,200,000 | "Actually, was more like 1.2 million" |
| ⑦ 반전 | 6월 | 약 $100,000 | "in June my AI bill dropped to pretty much 100k" |
증가 배수 산식
- 4개월 증가폭: 1,200,000 ÷ 25,000 = 48배
- 정점 → 6월 절감률: (1,200,000 − 100,000) ÷ 1,200,000 = 91.7%

2. 왜 이렇게 됐나 — 비용 발생 구조 분해
호출이 쌓이는 경로
① 사용자가 아이디어를 입력한다
↓
② Polsia 안의 에이전트가 작업을 수행한다 (Opus / Sonnet 호출)
↓
③ 기능이 추가될 때마다 호출 지점이 늘어난다 (고객지원 에이전트, Meta Ads 자동화)
↓
④ 사용자가 더 길고 복잡한 태스크를 시킨다
↓
⑤ 청구서는 사용자 수 × 작업 복잡도 × 모델 단가로 곱셈 증가
실측 토큰 데이터 (화면 대시보드)
| 지표 | 수치 |
|---|---|
| 세션 총 토큰 | 2,254,000 |
| — 입력 | 1,848,000 (약 82%) |
| — 출력 | 406,000 (약 18%) |
| 월 허용량 소진 | 101,200,000 tokens (101.2M) |
| 사용자 1회 호출 단가 | $0.0060 ~ $0.0282 |
호출 로그 한 줄이 luca.rossi chat.completion +4,140 → $0.0124, alex.tan tool_use +9,390 → $0.0282처럼 붙는다. 즉 비용은 기능이 아니라 호출 단위로 발생하며, 무료 사용량까지 포함하면 1인당 비용이 매출을 앞지르는 역마진 구간이 생긴다. 실제로 이 대표는 "break even"을 먼저 시도했다가 "사람들이 더 긴 태스크, 더 복잡한 요청을 해서 결국 너무 비싸졌다"고 말한다.
고객 1인당 월 비용 환산
- 정점 기준: 1,200,000 ÷ 5,000 = $240 / 고객·월
- 6월 기준: 100,000 ÷ 5,000 = $20 / 고객·월

3. 스케일링의 벽 — 5천 → 5만 고객 시나리오
| 가정 | 고객당 월 비용 | 5만 고객 월 청구서 |
|---|---|---|
| 전환 전 (Opus/Sonnet) | $240 | $12,000,000 |
| 전환 후 (GPU + 오픈소스) | $20 | $1,000,000 |
산식: 240 × 50,000 = 12,000,000 / 20 × 50,000 = 1,000,000
이 숫자가 설명하는 게 원문에도 그대로 나온다.
"5,000 고객에서 50,000 고객으로 가면, 3개월 안에 펀딩을 전부 소진한다. 그래서 스케일하기 전에 반드시 뭔가를 해결해야 했다."
핵심은 순서다. 성장은 해결책이 아니라 증폭기였고, 단위비용을 먼저 고치지 않으면 고객 확보가 곧 자살이 되는 구조였다.
4. 무엇을 바꿨나 — 3단계 처방

| 단계 | 조치 | 내용 |
|---|---|---|
| ① 진단 | 사용 패턴 재정의 | "대부분의 Polsia 사용자는 오히려 단순한 일을 묻고, 코드베이스도 단순해서 상당 부분을 표준화할 수 있다" → 최상위 모델이 필요 없는 트래픽이 다수 |
| ② 전환 | GPU 임대 + 오픈소스 모델 | 투자자 Ilan의 제안("we could rent GPUs and we can start using open source models")으로 데이터센터 현장을 직접 방문해 랙을 확인 |
| ③ 고정 | 에이전트 전용 인프라 파트너 계약 | Sapiom과 에이전트 인프라 독점 계약 체결 — 자율 에이전트를 구축하려는 모든 회사에 맞게 설계된 인프라 |
- 소요 기간: 약 2개월의 설정 작업
- 결과: 6월 청구서 약 $100,000 → "이건 게임체인저다. 이제 수익성을 낼 수 있다는 뜻이기 때문"
절감 이후에 비로소 가능해진 3가지 결정 1. 수익성 확보 — 흑자 전환 경로가 열림 2. 가격 인하 — "300달러, 500달러를 받지 않고도 이 수준의 AI 서비스를 제공할 수 있음" 3. 무료 버전 출시 — "누구나 Polsia를 시도해 파운더가 될 수 있게 돕는다" (사용 예시인 Arya는 수면·금융·멘탈 리셋 정보를 개인별로 종합하는 제품으로, 크레딧 5회 제한을 둠)
관점 포인트
- "비용은 나중에"가 통하지 않는 구간이 있다 — 이 팀도 초기엔 "Anthropic·OpenAI 모델이 비싼 건 알지만 고객이 제품을 원하는지 먼저 확인하자"며 비용을 후순위 처리했다. 후순위로 둔 대가는 4개월 뒤 48배로 청구됐다.
- 자동화 기능 추가 = 비용 항목 추가 — Meta Ads, 고객지원 에이전트처럼 "제품을 좋게 만드는" 각 기능이 정확히 토큰 소진 지점이었다. 기능 로드맵과 비용 로드맵은 같은 문서여야 한다.
- 투자금은 단위비용을 고치지 못한다 — 펀딩은 절감책이 아니라 시간 매입 수단이다. "돈을 안 쓸 바보가 아니다, 이 돈은 컴퓨트용"이라는 본인 표현도 같은 맥락.
- 외부 경고 신호를 실제 트리거로 쓴 것 — 4월 Ilan이 "이건 미쳤다, 정상 아니다"라고 했을 때 "방금 돈 댔으니 괜찮다"로 넘겼고, 같은 말을 한 번 더 듣고 나서야 "당신이 맞다, 정상 아니다"로 전환했다.
- 모델 선택의 기준은 성능이 아니라 트래픽 스펙트럼 — "단순한 질문과 단순한 코드베이스"가 다수라는 사실을 데이터로 확인한 뒤에만 오픈소스 전환이 결정됐다.
- 가격 정책이 제품 비전을 결정한다 — "무료 버전을 만들 수 있는가"의 답이 곧 모델 벤더 선택으로 수렴한다.
- 동시에 열린 낙관론 — 오픈소스/폐쇄형 수렴 질문에 대해 "전혀 꺾일 기미가 없고, 오히려 아직 과소평가돼 있다", "지금 변곡점", "천장이 없어 보인다", "다음 10년에 1,000년치 진보를 보게 될 것"이라는 전망을 함께 제시한다.
최종 핵심 정리
확인해야 할 질문 5가지
- 우리 제품에서 AI 호출이 발생하는 지점 몇 개인가 — 기능별로 목록화가 되는가
- 사용자 요청 중 상위 모델이 실제로 필요한 비중은 몇 %인가 — "단순 태스크 다수"라는 이 사례의 진단을 우리 데이터로 재현할 수 있는가
- 고객 1인당 월 인퍼런스 비용을 지금 계산해봤는가 (이 사례: $240 → $20)
- 고객이 10배 늘었을 때 청구서는 선형인가, 곱셈인가
- 무료 버전·가격 인하를 막는 제약이 기능 문제인가, 단위비용 문제인가
한 줄 요약
"AI 비용은 청구서를 줄여서 해결하는 항목이 아니라, 어떤 모델이 어떤 태스크를 맡을지를 아키텍처 수준에서 다시 정해야 해결되는 항목이다 — 그리고 그 재설계는 고객이 늘기 전에 끝내야 한다."
댓글 0
아직 댓글이 없습니다 — 첫 댓글을 남겨보세요.