원본 영상 보기

AI 도구를 직접 운영하면 구독료를 줄일 수 있을까요?

AI 코딩 도구를 여러 개 구독하다 보면 매달 나가는 돈도 커집니다. 개발자 유튜브 채널 Fireship은 2026년 9월 7일 영상에서 월 320달러를 쓰던 AI 구독 조합을 다섯 가지 도구로 바꿨다고 소개했습니다. Ollama, 9Router, Headroom, Dify, OpenHands입니다.

이 도구들은 각자 맡은 일이 다릅니다. AI 모델을 실행하거나, 여러 AI 서비스를 연결하거나, AI에 보낼 자료를 줄이거나, 화면에서 앱의 처리 순서를 연결하거나, 코드를 쓰고 고치는 AI 에이전트에 일을 맡깁니다. 공통점은 프로그램을 자기 컴퓨터나 서버에 설치해 운영할 수 있다는 것입니다. 이를 ‘셀프호스팅’이라고 합니다. 필요하면 Claude나 GPT 같은 유료 서비스도 함께 쓸 수 있습니다.

영상 속 320달러는 Fireship이 밝힌 자신의 지출입니다. Cursor 20달러와 Claude Max·GPT Pro·Gemini Ultra 각각 100달러를 합친 금액으로, 현재 정가나 실제 절감액을 확인한 수치는 아닙니다. 아래에서는 다섯 도구의 역할과, 직접 운영할 때 따져볼 비용을 하나씩 살펴봅니다.

Ollama: 내 컴퓨터에서 AI 모델 실행하기

Ollama는 AI 모델을 내려받아 내 컴퓨터에서 실행하는 프로그램입니다. 질문을 외부 AI 서비스에 보내는 대신, 컴퓨터에 설치한 모델이 답하게 합니다. 이렇게 모델 파일을 받아 직접 실행할 수 있는 모델을 ‘오픈 웨이트 모델’이라고 합니다.

로컬 모델만 사용한다면 질문을 외부 모델 업체로 보낼 필요가 없고, 그 업체에 답변 사용료를 내지도 않습니다. 대신 컴퓨터를 마련하고 전기를 쓰는 비용은 남습니다. 모델이 클수록 필요한 장비 성능도 높아집니다.

Fireship도 이 점을 짚습니다. 작은 모델은 일반적인 컴퓨터에서도 실행할 수 있지만, 최신 대형 코딩 모델에는 훨씬 큰 장비가 필요하다는 것입니다. 따라서 지금 쓰는 Claude나 GPT의 코딩 성능을 그대로 얻을 수 있을지는 별도로 확인해야 합니다.

9Router: 여러 AI 서비스를 한곳에서 연결하기

9Router는 코딩 앱과 AI 모델 제공자 사이에서 요청을 전달하는 프로그램입니다. 코딩 앱이 9Router에 요청을 보내면, 9Router가 설정에 따라 사용할 AI 서비스를 고릅니다. 여러 서비스의 접속 정보를 한곳에서 관리하는 셈입니다.

예를 들어 평소에는 기존 구독을 쓰다가 허용량이 다 차면 더 저렴한 종량제 모델로, 그다음에는 무료·체험 서비스로 요청을 넘길 수 있습니다. 종량제 요금의 기준인 ‘토큰’은 AI가 읽고 쓰는 글을 나눈 작은 단위입니다. 영상은 저렴한 대안으로 OpenAI 모델을 들지만, 9Router README의 해당 예시는 GLM과 MiniMax입니다.

9Router 자체는 사용자에게 이용료를 청구하지 않습니다. 하지만 연결한 AI 서비스의 요금은 그대로 내야 합니다. 대시보드에 표시되는 비용도 실제 청구액이 아닌 추정치입니다. 도구가 반환한 긴 결과를 줄이는 RTK 기능은 기본으로 켜져 있으며, 압축에 실패하거나 결과가 더 길어지면 원문을 보냅니다.

무료 서비스에도 사용량과 기간 제한이 있습니다. 아래는 9Router README에 적힌 조건입니다. 가입하거나 연결하기 전에는 해당 서비스의 최신 조건도 확인하는 편이 좋습니다.

9Router README의 무료 사용 조건
서비스문서에 적힌 조건
Kiro AI월 약 50 크레딧. 신규 계정은 첫 30일 동안 체험 크레딧 500 추가
OpenCode Free인증 없이 연결 가능. 제공되는 무료 모델은 예고 없이 변경될 수 있음
Vertex AI신규 Google Cloud(GCP) 계정에 300달러 크레딧, 유효기간 90일. Gemini API와 Vertex AI Studio는 구글 모델로 가는 서로 다른 연결 방식이다. 2026년 3월부터 이 무료 크레딧은 일반 Gemini API 연결로는 쓸 수 없고, README는 Vertex AI Studio 쪽으로 연결하라고 안내함
2026년 중단된 무료 사용 옵션iFlow, Qwen Code, Gemini CLI의 무료 사용 옵션은 중단된 것으로 기재됨

Headroom: AI에 보내는 긴 자료 줄이기

AI 코딩 에이전트는 작업하면서 로그나 검색 결과, 도구 실행 결과를 읽습니다. 이런 자료가 길면 AI에 보내는 입력도 늘어납니다. Headroom은 모델에 전달하기 전에 이 자료를 짧게 줄여 입력량을 줄이는 도구입니다. 이미 짧거나 정보가 빽빽한 글에서는 줄일 수 있는 양이 적습니다.

Headroom은 원문을 버리지 않습니다. 원문을 컴퓨터에 저장해 두고, 모델이 자세한 내용이 필요할 때 다시 가져올 수 있게 합니다. README에서는 이 방식을 CCR이라고 부릅니다.

9Router와 함께 쓰는 것도 가능합니다. 문서에 따르면 9Router가 Headroom에 압축을 요청한 뒤 모델 제공자로 전달할 수 있습니다. Headroom이 응답하지 않으면 원문을 그대로 보내도록 되어 있습니다. 직접 운영하는 방식 외에 유료 지원과 관리형 팀 서비스도 제공합니다.

문서에 설명된 9Router와 Headroom의 연결 흐름
  1. 코딩 앱 → 9Router 코딩 앱이 9Router에 요청을 보냅니다.
  2. Headroom에 압축 요청 — 선택 사항 9Router가 Headroom에 입력 자료를 줄여 달라고 요청한 뒤 모델 쪽으로 전달할 수 있습니다. 압축하지 못하면 원문을 보냅니다.
  3. 9Router가 모델 선택 설정과 사용량에 따라 요청을 보낼 서비스를 고릅니다. RTK로 도구 결과를 줄이는 기능도 있습니다.
  4. AI 모델이 요청 처리 외부 모델 제공자나 Ollama로 실행한 로컬 모델에 요청을 전달합니다.

Dify: AI 앱의 처리 순서 만들기

Dify는 앱이 처리할 일을 화면에서 순서대로 연결하는 도구입니다. 정보를 입력받고, 데이터베이스에서 자료를 찾고, AI가 답을 쓰게 하는 식입니다. 이렇게 만든 작업 흐름을 다른 앱에서도 호출할 수 있도록 API라는 연결 창구로 제공할 수 있습니다.

Fireship은 말을 짝지어 주는 농담 앱으로 이 과정을 설명합니다. 말의 프로필을 입력하면 데이터베이스에서 상대를 찾고, AI가 둘이 어울리는 이유를 써 줍니다. 예시는 장난스럽지만, ‘입력 → 정보 검색 → AI 설명’이라는 앱의 처리 순서를 이해하기에는 유용합니다.

Dify 공식 문서는 직접 설치하는 Community Edition과 업체가 운영해 주는 Dify Cloud를 안내합니다. Cloud에는 무료 Sandbox 플랜이 있습니다. 직접 서버를 운영할지, 운영을 맡길지에 따라 선택이 달라집니다.

OpenHands: AI에게 코딩 작업 맡기기

OpenHands는 AI 에이전트가 코드를 다루도록 작업을 맡기고 관리하는 도구입니다. 여기서 에이전트는 답변만 하는 챗봇보다 한 걸음 더 나아가, 주어진 작업을 수행하는 AI 프로그램을 뜻합니다.

공식 문서의 구성은 크게 작업을 보고 대화하는 브라우저 화면인 Agent Canvas, 에이전트를 실행하는 Agent Server, 개발자가 에이전트를 만들 때 쓰는 Python 도구 모음인 Software Agent SDK로 나뉩니다.

Fireship은 서버에서 에이전트를 계속 실행하면서 OpenAI·Anthropic의 모델이나 Ollama로 실행한 모델을 연결하는 활용법을 소개합니다. 어떤 모델을 연결하느냐에 따라 이용 비용과 필요한 장비가 달라집니다. 직접 운영하는 방식 외에 업체가 운영을 맡는 OpenHands Cloud와 조직용 Enterprise도 있습니다.

다섯 개를 한꺼번에 설치할 필요는 없습니다

이 영상에서 얻을 만한 아이디어는 AI 작업을 역할별로 나누어 보는 것입니다. 모델을 직접 실행하고 싶은지, 여러 서비스를 편하게 연결하고 싶은지, 앱을 만들고 싶은지에 따라 먼저 살펴볼 도구가 달라집니다.

비용을 줄이는 것이 목적이라면 현재 구독료뿐 아니라 모델 사용료, 서버·컴퓨터 비용, 직접 관리하는 시간도 함께 따져야 합니다. 지금 구독 중인 서비스의 코딩 성능이 중요하다면, 필요한 작업에서 대체 도구가 충분한지 확인한 뒤 바꾸는 편이 좋습니다.

필요한 작업에 따른 도구 선택
도구하는 일고려할 점
Ollama내 컴퓨터에서 AI 모델 실행모델에 맞는 컴퓨터 성능과 전기 비용
9Router여러 AI 서비스 연결과 사용량에 따른 전환각 서비스의 요금과 무료 사용 한도
HeadroomAI에 보내는 긴 자료 압축자료의 종류에 따라 압축 효과가 달라짐
DifyAI 앱의 처리 순서 구성직접 서버를 운영할지, Cloud를 쓸지 선택
OpenHandsAI 에이전트에 코딩 작업 맡기기연결할 모델과 서버 운영 방식 선택

출처

Fireship

함께 본 출처

자료 및 작성 기준

Fireship 영상의 영어 자막 전체를 읽고, 9Router·Headroom의 GitHub README, OpenHands 소개 문서, Dify 문서 홈페이지와 대조했습니다. 이 기사는 영상과 문서를 풀어 설명한 것으로, 직접 설치하거나 비용 절감·자동 전환·코딩 성능을 실험한 결과는 아닙니다.