팀플럿AX
서비스제품표준 단가회사 소개소식문의하기

제품

원하시는 서버에 세우는
로컬 LLM

GCP · AWS · 사내 서버 어디든. 데이터가 밖으로 나가지 않고, 월 사용료 대신 서버비만 냅니다. 오픈 웨이트 모델을 vLLM으로 서빙하고 OpenAI 호환 API로 내어 드리니, 쓰시던 코드는 한 줄도 안 바꿉니다.

언제 로컬 LLM 이 맞는가

셋 중 하나면 맞고, 아니면 API 게이트웨이가 더 쌉니다

01

데이터를 밖으로 못 보낼 때

의료 · 법무 · 인사 · 금융 자료, 계약상 국외 이전 금지. 모델이 고객 계정 안에서만 돌고, 우리도 데이터를 보지 않습니다.

02

월 API 요금이 서버비를 넘을 때

하루 수천 건 이상이면 서울 리전 L4 한 장(온디맨드 월 약 93~101만 원, 약정 시 절반)이 API 요금보다 쌉니다. 진단 때 실제 사용량으로 손익분기를 계산해 드립니다.

03

모델을 우리 데이터로 길들일 때

용어 · 서식 · 말투를 LoRA 로 학습. 학습 데이터는 고객 서버를 떠나지 않고, 결과에는 사람 확인 단계를 둡니다.

반대로 하루 수백 건 이하 · 최신 최상위 모델이 꼭 필요 · 운영 인력 없음 이면 AI API 게이트웨이가 맞습니다. 진단에서 그렇게 말씀드립니다(진단은 무료).

구축 단가

부가세 별도 · 서버비는 고객 계정으로 직접 결제

소형GPU 1장 · 24GB1,490,000

표준 2주

Qwen3-14B 또는 Kanana 8B + 임베딩. 동시 5~10명, 문의 분류 · 답장 초안 · 요약

  • 서버 만들기(GCP · AWS 고객 계정 또는 사내 서버)
  • vLLM 서빙 + OpenAI 호환 /v1
  • 개인정보 검사(guard) 기본 켬
  • 콘솔(GPU · 요청량 · 비용 · 차단 로그)
  • 모델 2종까지 병행
  • 기존 코드 무수정 연결
중형A100급 1장 또는 L4 ×42,990,000

표준 3주

Qwen3-32B · EXAONE 4.0 32B · Kanana 32B. 동시 20~50명, 사내 문서 RAG

  • 소형 전부
  • 사내 문서 RAG(bge-m3 + 벡터 DB)
  • 모델 3종 병행 · 무중단 교체
  • 야간 자동 축소(비용 절감)
  • 부하 시험 보고서
  • SSO · 팀별 API 키
대형H100급 · 다중 GPU5,900,000~

표준 4주~

70B · MoE 모델, LoRA 파인튜닝, 동시 100명+

  • 중형 전부
  • LoRA 파인튜닝(고객 데이터, 사람 확인 포함)
  • 다중 GPU · 다중 노드 서빙
  • 장애 자동 복구 · 이중화
  • 전용 네트워크 · 감사 로그
  • 견적

운영 · 관리(선택, 월)

기본190,000원/월월 1회 모델 · 보안 패치, 장애 알림, 월간 보고
표준390,000원/월주 1회 점검, 비용 최적화(스팟 · 약정 안내), 모델 교체 2회/월
전담790,000원/월평일 4시간 내 대응, 분기 부하 시험, 파인튜닝 1회/분기

운영 계약 없이 구축만 받으셔도 됩니다. 인수인계 문서와 3개월 무상 장애 대응이 구축에 포함됩니다. 사내 서버 설치는 같은 단가에 출장비 실비.

서버비는 얼마나 드나

2026년 9월 23일 공식 요금표 · 온디맨드 · 서울 리전 기준(미국 리전은 비교용)

클라우드인스턴스GPU미국 시간당서울 시간당서울 월(730h)원화(1,400원/$)
AWSg6.xlargeNVIDIA L4 24GB × 1$0.80$0.99$722101만 원
AWSg5.2xlargeNVIDIA A10G 24GB × 1$1.21$1.49$1,088152만 원
AWSg6.12xlargeNVIDIA L4 24GB × 4$4.60$5.66$4,130578만 원
AWSp5.48xlarge ÷ 8NVIDIA H100 80GB × 1 (8장 인스턴스의 1장분)$6.88$9.49$6,931970만 원
GCPg2-standard-4NVIDIA L4 24GB × 1$0.71$0.91$66393만 원
GCPa2-highgpu-1gNVIDIA A100 40GB × 1$3.67$4.05$2,956414만 원

서울 리전은 미국보다 10~38% 높습니다(실측: AWS L4 +23%, A10G +23%, H100 +38%, GCP L4 +28%, A100 +10%). 1년 약정이나 스팟(중단 허용)은 40~70% 낮아지고(예: 서울 g6.xlarge 스팟 약 $0.57, g5.2xlarge 스팟 약 $0.69), 야간 · 주말 자동 축소를 켜면 소형 구성은 월 40만 원대까지 내려갑니다. 사내 서버는 24GB GPU 워크스테이션 구매(대략 수백만 원, 견적 별도) 뒤 전기 · 회선만 듭니다. 정확한 월비는 진단 때 실제 사용량으로 계산해 드립니다.

지원 리전

데이터가 국내에 있어야 하면 서울, 서울에 GPU 가 없으면 도쿄, 국외 이전이 허용되면 미국이 가장 쌉니다. 2026년 9월 23일 각 클라우드 공식 문서 확인.

클라우드리전쓸 수 있는 GPU비고
AWS서울 ap-northeast-2L4(G6) · A10G(G5) · A100(P4d) · H100(P5 · P5e)전부 가능. 소형~대형 모두 서울에서
AWS도쿄 ap-northeast-1L4(G6) · A10G(G5) · H100(P5 단일 GPU는 Capacity Blocks)서울 매진 시 대안. 지연 30ms 안팎
AWS미국 버지니아 · 오하이오 · 오리건전 GPU · 가장 쌈(서울 대비 −20~30%)데이터 국외 이전이 허용될 때만
GCP서울 asia-northeast3L4(G2, a·b 존) · A100 40GB(A2, b 존) · H100(A3 High · A3 Edge, c 존)전부 가능. A100 은 b 존 하나라 예약 권장
GCP도쿄 asia-northeast1L4(G2, a·b·c) · A100 40GB(A2, a·c) · H100(A3 Mega, b) · B200(A4, b)서울보다 GPU 종류가 많음. 요금은 서울과 같음
GCP미국 us-central1 등전 GPU · 가장 쌈데이터 국외 이전이 허용될 때만
사내고객 서버실 · IDCNVIDIA 24GB 이상(RTX 4090 · 5090 · A6000 · L40S 등) 리눅스같은 절차로 설치. 사양 · 견적 같이 잡음

지원 모델

전부 오픈 웨이트 · 라이선스와 필요한 GPU 메모리를 같이 적었습니다

구분모델크기만든 곳 · 라이선스특징GPU 메모리(대략)
한국어EXAONE 4.032B · 1.2BLG AI연구원추론 모드 · 도구 사용. 상업 이용은 LG와 별도 계약 필요32B: 4bit 약 20GB(L4 1장) · FP16 64GB(A100 ×2)
한국어HyperCLOVA X SEED0.5B · 1.5B · 3B네이버3B는 이미지 이해. 상업 이용 허용(일부 조건 제외)3B: 8GB 안팎, L4 1장에 다른 모델과 병행
한국어Kanana 1.58B · 32B카카오한국어 특화, 라이선스 자유도 높음(Apache 2.0 에 가까움)8B: 4bit 5GB · 32B: 4bit 20GB
한국어A.X 4.07B · 72BSK텔레콤공개 모델. 72B는 H100급7B: 4bit 5GB · 72B: 4bit 40GB+
범용Qwen38B · 14B · 32B · 235B-A22BAlibaba (Apache 2.0)한국어 성능 좋음 · 도구 사용 · 긴 문맥. 기본 추천14B: 4bit 9GB · 32B: 4bit 18~20GB · 235B: 130GB+
범용Gemma 34B · 12B · 27BGoogle (Gemma 라이선스)이미지 입력 · 128K 문맥12B: 4bit 8GB · 27B: 4bit 16~18GB
범용Llama 4 Scout · Llama 3.x8B · 70B · Scout(109B MoE)Meta (Llama Community License)MAU 7억 이상 별도 계약. 영어 강함70B: 4bit 40GB · Scout: 4bit 62GB
범용Mistral Small 3 · Phi-4 · DeepSeek-R1 Distill7B~32BMistral · Microsoft · DeepSeek (Apache 2.0 · MIT)가벼운 추론 · 코드4bit 5~20GB
임베딩bge-m3 · multilingual-e50.3B~0.6BBAAI · Microsoft (MIT)RAG 문서 검색용. 한국어 지원1~3GB, LLM과 같은 GPU에 병행

4bit = AWQ · GPTQ 양자화. 품질을 조금 내주고 메모리를 3~4분의 1로 줄입니다. 라이선스는 진단 때 고객사 용도(상업 · 사용자 수)에 맞춰 확인해 드리고, 특히 EXAONE 은 상업 이용 계약이 따로 필요합니다. 목록에 없는 모델도 vLLM 이 지원하면 올릴 수 있습니다.

무엇을 받으시나

구축이 끝나면 이 상태입니다

로컬 LLM 콘솔

콘솔

GPU · 요청량 · 비용 · 차단 로그를 한 화면에

어떤 모델이 얼마나 메모리를 쓰는지, 오늘 몇 건이 들어왔는지, 이번 달 서버비가 얼마로 가는지, 개인정보 검사가 무엇을 막았는지. 운영 계약이 없어도 이 화면은 남습니다.

vLLMOpenAI 호환 /v1개인정보 검사야간 자동 축소RAG

무료 진단에서 잰 사용량으로 GPU 크기와 모델을 고릅니다. 고객 GCP 프로젝트 · AWS 계정에 우리가 권한을 받아 만들고, 끝나면 권한을 돌려드립니다. 사내 서버면 OS · 드라이버부터.

vLLM 으로 모델을 올리고 OpenAI 호환 /v1 을 내어 드립니다. base_url 만 바꾸면 기존 코드가 그대로 돕니다. 보내기 전 개인정보 검사(주민등록번호 · 카드번호는 검증식 통과분만 세움, 휴대폰 · 이메일은 가림)를 기본으로 켭니다.

사내 문서를 임베딩해 검색-생성(RAG)을 붙이고, 모델 2~3종을 무중단으로 바꿀 수 있게 합니다. 동시 사용자 수를 실제로 걸어 응답 시간을 재고 보고서로 드립니다.

설치 문서 · 되돌리기 절차 · 비용 절감 설정(약정 · 스팟 · 자동 축소)을 정리해 드리고, 3개월간 장애 대응은 무상입니다. 이후는 운영 계약 또는 건별.

자주 묻는 질문

아니요. 오픈 웨이트 32B 급은 최상위 상용 모델보다 어렵고 긴 과제에서 뒤집니다. 문의 분류 · 답장 초안 · 요약 · 사내 문서 검색처럼 «정해진 일»은 충분하고, 그게 로컬 LLM 의 자리입니다. 진단에서 고객 실제 문서로 미리 돌려 보고 결정합니다.

구축 기간에도 모델 · 로그는 고객 계정 안에 있습니다. 우리는 권한을 받아 설치하고 끝나면 반납합니다. 학습에 쓰지 않고, 콘솔의 검사 로그도 원문이 아니라 «무엇을 막았는지»만 남깁니다.

원칙적으로 고객 계정 직접 결제입니다. 계정이 고객 것이어야 데이터 · 비용 · 되돌리기가 전부 고객 손에 남습니다. 계정 만들기부터 같이 해 드립니다.

네. 둘 다 OpenAI 호환 규격이라 base_url 만 바꾸면 됩니다. 반대로 게이트웨이를 쓰다 사용량이 늘면 로컬로 옮기는 것도 같은 방식입니다.

됩니다. 24GB 이상 NVIDIA GPU 가 있는 리눅스 서버면 같은 절차로 설치합니다. 없으면 워크스테이션 사양과 견적을 같이 잡아 드립니다.

로컬 LLM 이 맞는지부터
무료 진단으로 확인하세요

문의하기
우리 회사 AX를
고민하고 계신가요?